基础率谬误经典例题精讲:7 个例子逐步算给你看

更新于 2026-07-16

基础率谬误(base rate fallacy)指的是:你根据具体证据——一次检测结果、目击者证词或一条警报——来判断概率,却忽视或低估了这件事本身有多常见。治好这个毛病最快的办法,就是亲眼看几次算术是怎么"翻车"的,所以本文将逐一演算七个例子。每个例子都会给出基础率、证据概率、一张自然频率表,以及正确答案。

两个要素(和两种不同的错误)

下面每道题都有同样的骨架:一个基础率(base rate,即这个情况有多常见,也叫患病率或先验概率)和若干证据概率(如灵敏度和假阳性率)。笼统地说某个检测"准确率 99%"可能并不够用,因为这句话未必告诉你检测在各个群体上分别表现如何。

可能出现两种相关的错误:

这两种错误常常同时出现,但谁也不单纯是谁的原因或机制。下面进入例题。

例 1:罕见病检测

题设: 患病率为千分之一。灵敏度为 99%,假阳性率为 5%。你的检测结果是阳性。你患病的可能性有多大?

取 100,000 人:

群体人数检测呈阳性
患病10099
健康99,9004,995

P(患病 | 阳性) = 99 ÷ (99 + 4,995) ≈ 1.9%

直觉答案——"接近 99%"——把灵敏度和阳性结果之后的患病概率混为一谈了。健康人群基数大得多,其产生的假阳性远远多于真阳性。

例 2:出租车目击证人

改编自 Kahneman 和 Tversky 研究过的一道题。题设: 某城市 85% 的出租车是绿色的,15% 是蓝色的。一位目击者说肇事逃逸的出租车是蓝色的。在类似条件下,该目击者对两种颜色的辨认正确率都是 80%。

取 100 辆出租车:

群体数量证人说"蓝色"
蓝色1512
绿色8517

P(蓝色 | 证人说蓝色) = 12 ÷ (12 + 17) ≈ 41%

证词是有意义的:它把概率从 15% 提升到了 41%。但这并不能让"是蓝色"变得比"不是蓝色"更有可能。如果一个论证直接拿证人 80% 的准确率当作这辆车是蓝色的概率,那就是忽视了车队的构成比例。

例 3:工程师–律师描述题

改编自 Kahneman 和 Tversky 的工程师–律师问题。题设: 一个群体包含 70 名律师和 30 名工程师。随机抽取一人,其描述为:安静、喜欢解谜、擅长动手。在这个标注好的假设情境中,设 60% 的工程师和 20% 的律师符合该描述。

群体人数符合描述
工程师3018
律师7014

P(工程师 | 描述) = 18 ÷ (18 + 14) = 56.25%

这段描述在工程师中出现的可能性是律师中的三倍,但答案只是略高于 50%,因为起始群体中律师更多。一段听起来很"典型"的描述并不能抹掉先验分布。

例 4:垃圾邮件过滤器

题设(假设情境): 在某企业邮件流中,2% 的邮件是垃圾邮件。某过滤器能标记 98% 的垃圾邮件,同时会误标 2% 的正常邮件。一封邮件被标记了。它是垃圾邮件的可能性有多大?

取 10,000 封邮件:

群体数量被标记
垃圾邮件200196
正常邮件9,800196

P(垃圾邮件 | 被标记) = 196 ÷ (196 + 196) = 50%

即使检测能力很强,在这组特定的流行率与假阳性率组合下,被标记的邮件中有一半是正常邮件。除非检测器的假阳性率相对于基础率足够低,否则稀有目标会产生大量误报。同样的道理也适用于欺诈警报和安全监控。

例 5:针对极罕见特征的大规模筛查

题设(假设情境): 某特征在人群中的比例为十万分之一。筛查的灵敏度为 99%,假阳性率为 1%。

取 100,000 人:

群体人数检测呈阳性
具有该特征10.99
不具有99,999999.99

P(特征 | 阳性) = 0.99 ÷ (0.99 + 999.99) ≈ 0.1%

这里出现小数形式的期望人数是可以接受的,因为表格代表的是在重复抽取的人群上的平均值。这个结果并不是对筛查本身的整体判决。它只说明:在这组假设的概率之下,初次阳性提供的证据有限,需要进一步评估才能支持结论。

例 6:机场安检扫描仪警报

题设(假设情境): 假设 0.5% 的受检行李中含有违禁品。扫描仪能标记 90% 含违禁品的行李,同时会误标 4% 的其他行李。某件行李触发了警报。它含有违禁品的可能性有多大?

取 10,000 件行李:

群体数量被标记
含违禁品5045
不含违禁品9,950398

P(违禁品 | 被标记) = 45 ÷ (45 + 398) ≈ 10.2%

警报把概率从 0.5% 提升到了约 10.2%,所以它是有信息量的。但大多数警报仍然是误报,因为普通行李的数量压倒性地多。把 90% 的检出率当成"被标记的行李有 90% 的概率含违禁品",就是把条件概率颠倒了。

例 7:职场药检(LSAT 风味)

题设(假设情境): 某雇主主张:"我们的检测能在 95% 的情况下识别出使用者,所以检测呈阳性的员工应被推定为使用者。"设 1% 的员工使用该物质,灵敏度为 95%,假阳性率为 5%。

取 10,000 名员工:

群体人数检测呈阳性
使用者10095
非使用者9,900495

P(使用者 | 阳性) = 95 ÷ (95 + 495) ≈ 16%

这位雇主把某一项性能指标当成了对结论概率的定论。LSAT 的谬误类选项可能会把这描述为:未能考虑该情况在相关人群中的出现频率。

四步法

在时间压力下你不需要写出贝叶斯定理(Bayes' theorem)。搭一张频率表就行:

  1. 选一个总体,让基础率容易表示成整数。
  2. 按基础率拆分成"有"和"没有"两组。
  3. 对两组分别套用证据概率
  4. 相除: 真阳性 ÷ 全部阳性。

同样的方法适用于检测、证人、过滤器和警报。

它在 LSAT 和 GRE 中如何出现

在 LSAT 逻辑推理(Logical Reasoning)部分,要警惕从"该方法能检出大多数真实案例"跳到"这个被检出的案例大概率是真实的"这类论证。同时也要警惕省略了相关分母的原始数量比较。可以在 PurrLearn 的 LSAT 逻辑推理谬误测验中练习识别这些结构。

GRE 的 Analyze an Argument 写作题已随着 2023 年 9 月缩短版 GRE 的推出而取消,因此它已不是现行 GRE 的题型。旧的 Argument 题目仍可用作一般性的推理练习,包括练习识别缺失的流行率数据,但不应把它们误当成现行考试的格式。

想要更多互动式的概率和选择偏差练习,可以试试蒙提霍尔问题测验幸存者偏差测验。它们训练的是相关的思维习惯:追踪完整的可能性集合,并追问现有证据遗漏了哪些情况。

常见问题

有没有一个简单的基础率谬误例子?

某疾病的患病率为千分之一;某检测的灵敏度为 99%、假阳性率为 5%;你检测呈阳性,就以为自己几乎肯定病了。在这些假设下,实际概率约为 1.9%,因为假阳性的数量多于真阳性。

基础率谬误和混淆 P(A|B) 与 P(B|A) 是一回事吗?

不是。条件概率颠倒是把两个不同的概率互换了。忽视基础率则是指忽略或低估先验频率。它们可以分别单独发生,尽管一个错误答案可能同时涉及两者。

基础率谬误在 LSAT 中如何出现?

某论证可能会因为"该方法能可靠地检出真实案例"就断定某个被识别出的案例大概率是真实的,却不考虑真实案例有多罕见、假阳性有多频繁。

如何避免基础率谬误?

在对某个结果、警报或匹配做出反应之前,先问问目标情况本身有多常见。然后把基础率、灵敏度和假阳性率放进一张频率表。如果基础率未知,证据可能仍然有意义,但你无法仅凭检出率算出后验概率。

结语

这七个例子共享同一个结构:一个先验概率、各群体各自的证据概率,以及一个"观察到证据之后概率是多少"的问题。破解方法是机械化的——选一个总体,按基础率拆分,套用证据概率,然后相除。反复练习这套流程,你就能更容易地在 LSAT 论证、旧版 GRE 推理材料以及日常生活的概率说法中识破这个陷阱。

配套系统课

《基础率谬误》互动课把同一个陷阱拆成 3 段教学 + 6 道自测题,每题都有人话解析,免费开始。

免费开始学

配套互动测验

喵学堂的免费互动测验把这些概念变成随手小测,每题都有人话解析。

看看所有测验

想边学边练,不只是读?

注册后可以用互动课程边学边练,成绩、错题本和学习进度都会自动保存。

免费注册