如何不欺骗自己

面向讲究食客的统计学

盲测和测试结果不同

你可能已经做过厨房版的盲选偏好测试:两个样本,相同容器,相同数量,受控的食用温度,以及随机代码,而不是“原味”和“改良版”等名称。

请您品尝两者并选择其中一个。

明显的问题是,掷硬币有50%的概率给出你希望的答案。不太明显的问题更糟糕:即使两个样本相同,你可能仍然会选择一个。

盲测删除可能偏向答案的信息。它本身并不能使答案具有信息性。在这本书的许多地方,我们建议改变厨房程序或食谱。如果这是用来验证变化效果的测试,一个人的偏好投票可能是真实的感知、随机选择或在没有可靠的区分的情况下做出的强迫性决定。

缺少的成分不是更多的盲目性。而是正确的测试方法和一抹统计学。

优先级之前检测测试

首先,我们需要将盲测混淆在一起的两个问题分开:

  1. 品尝者能检测到差异吗?
  2. 如果是这样,他们更喜欢哪个版本?

三角测试是为了这个目的而设置的:给品尝者三个编码的样品。两个含有产品A,一个含有产品B,或者反之亦然。问一个问题:哪个样品与其他两个不同?

显然,如果品尝者无法分辨两个西红柿,比如,他们的雄辩地偏爱在满月下生长的西红柿,这主要是因为他们喜欢发表意见。我们都知道,食品界没有缺乏意见。

击败猜测

认为在满月下生长的西红柿与其他西红柿没有区别的假设有一个技术名称:空假设。如果品尝者被迫做出选择,他们仍然有三分之一的机会正确识别神奇的西红柿。要击败空假设,你需要招募更多做出独立判断的品尝者。

在三角测试中,一个品尝者猜测正确答案的概率为:

p=13.p=\frac{1}{3}.

对于给定的独立品尝者数量,在您能够95%确定小组没有只是猜测之前,他们中必须有多少人正确识别出奇数样本?

计算这个概率要用到二项分布。下图的纵轴表示仅靠猜测至少得到这么多正确答案的概率,横轴表示正确找出不同样品的品尝者人数。nn是品尝小组的人数,α\alpha是显著性阈值。如果希望结果由猜测产生的概率低于5%,那么α\alpha就是5%。

三角测试的二项分布上尾概率图;三人、六人和十二人品尝组在随机猜测下答对的概率均为三分之一。
根据三角测试的空假设,每个点都给出了猜测产生至少这么多正确奇数样本选择的概率。省略了简单的阈值$k=0$,因为$P(X\ge0)=1$。

如果您有一组12名品尝者,您需要至少8个人来挑选奇怪的样品,才能有95%的把握认为结果不是纯粹的运气。如果您有一组3名人员,您需要三人都能正确识别它。如果您的小组只有2人,您永远无法有95%的把握认为他们不是在胡猜。

多人品尝小组的实际考虑因素

有六种可能的服务订单:

AAB, ABA, BAA, BBA, BAB, ABBAAB,\ ABA,\ BAA,\ BBA,\ BAB,\ ABB

在面板尺寸允许的情况下,尽可能均匀地使用所有六个。这既平衡了奇数样品的位置,也平衡了哪种产品是奇数。否则,习惯性地选择中间杯的品尝者,或在第三个位置等待时加热的样品,可能会产生结果。

每个品尝者都应该在不咨询其他人的情况下做出一个独立的选择。同一人的重复判断并不自动是独立的:他们可能会学习、厌倦或记住一个代码。数学将观察视为独立的,因此实验必须使这一假设合理。

偏好有自己的空假设

一旦我们有证据表明存在差异,我们就可以测试偏好。我们仍然必须拒绝空假设。在偏好测试中没有对错的答案,但通常有一种答案是我们希望在这种口味测试中听到,因此在下面的讨论中,我将称之为“目标”答案。

给每个品尝者两份编码样品,并询问他们更喜欢哪一个。设YY为选择目标版本的品尝者数量。由于随机选择目标版本的概率现在为50%,高于三角测试中的33%,因此我们需要更多的一致性才能达到相同的置信水平:

偏好测试的二项分布上尾概率图;没有偏好优势时,三人、六人和十二人品尝组选择改动配方的概率均为二分之一。
根据偏好测试的空假设,每个点都给出了没有偏好优势至少为改变的食谱产生那么多选票的概率。省略了微不足道的阈值$r=0$,因为$P(Y\ge0)=1$。

含义很明显:如果你对奶奶的柠檬馅饼食谱做出改变,你永远无法确定你是否做得更好,除非你有一个大家庭作为你的品尝小组。

除非你做出真正和显著的改进。

差异越大,就越容易检测到

假设十二名品尝者中只有六人回答正确。你没有拒绝猜测。你没有证明没有差异。

也许只有少数人才能检测到这种差异。也许当样品冷却时,差异就会消失。也许面板太小了。如果一个真正可察觉的差异使每个品尝者在概率q>1/3q>1/3的情况下正确,并且实验宣布在kk或更多正确答案的情况下检测到差异,那么找到这种差异的概率为

Pq(Xk)=j=kn(nj)qj(1q)nj.P_q(X\ge k) = \sum_{j=k}^{n} \binom{n}{j}q^j(1-q)^{n-j}.

这就是检验的功效。阈值kk仍由上面的猜测模型确定:12次判断中至少答对8次,才能有把握认为结果并非随机猜测。但qq越大,答对至少8次的概率就越高。

三角测试无法告诉我们两种食物为何不同、感官差异有多大,或哪一种更好。它只做一件范围有限的事:让所谓的感知差异与一个精确的随机猜测模型竞争。偏好测试做的是另一件范围有限的事:让所谓的改进与无人偏爱任一版本时预期的五五开结果相比较。在追问热、盐或时间会怎样改变食物之前,先把这些问题区分开,是一种有益的思维卫生。

评论

还没有评论。分享你的想法吧!