🧠 心理学入门 · 看懂自己和别人

基础率谬误例子:医学检测数字拆解与 MCAT 风格测验

从一万人的假设性筛查开始,分清灵敏度、误报率与阳性可信度

一句话先懂 · TL;DR

什么是基础率谬误?用医学检测和一万人表格算清阳性结果,并通过 6 道 MCAT 风格应用题检验理解。

先别问检测多灵,先问病有多常见

假设你参加一种罕见病筛查:人群患病率为 1%;检测能找出 90% 的病人,也就是灵敏度为 90%;健康人中有 5% 会误报阳性,也就是特异度为 95%、假阳性率为 5%

现在你的结果是阳性。直觉很容易抓住“90%”并说:我有九成概率患病。但 90% 回答的是“已经患病的人,有多大概率测出阳性”,你真正想问的是“已经测出阳性的人,有多大概率患病”。方向反过来了,答案也会完全不同。

这就是基础率谬误的常见形式:面对一条醒目的个案证据时,忽略事件原本的发生比例,也就是基础率

几个量不能混用:灵敏度是 P(阳性|患病);特异度是 P(阴性|健康);假阳性率是 P(阳性|健康),等于 1−特异度;阳性预测值才是 P(患病|阳性)。而“总体准确率”是全部受测者中判断正确的比例,会随样本里的患病者比例变化。只听到“99% 准确”而不知道样本构成和混淆矩阵,通常还算不出阳性者患病的概率。

🔆把检测想成夜店门卫:灵敏度看他能拦住多少真正的闯入者,特异度看他能放过多少正常客人,阳性预测值则问“被拦下的人里,多少真是闯入者”。如果今晚本来只有极少数闯入者,即使门卫眼力不错,被拦下的人中也可能挤着不少无辜客人。

一万人表格:让分母自己现身

回到开头的假设性筛查。不要在三个百分比之间心算,直接请 10000 人走进表格:患病率 1%,所以有 100 名病人和 9900 名健康人。检测的灵敏度为 90%,因此 100 名病人中有 90 人呈阳性;假阳性率为 5%,因此 9900 名健康人中有 495 人也呈阳性。

现在只看阳性人群:90 个真阳性,加上 495 个假阳性,共 585 人。阳性预测值是 90÷585≈15.4%

阳性确实把患病概率从 1% 提高到了约 15.4%,所以检测提供了重要证据;但它没有把概率提高到 90%。顺便核对总体准确率:判断正确的是 90 个真阳性加 9405 个真阴性,共 9495 人,因此这个场景里的总体准确率是 94.95%,既不是灵敏度 90%,也不是阳性预测值 15.4%。

处理 MCAT-style 场景时,可以依次写四格:患病且阳性、患病且阴性、健康且阳性、健康且阴性。问题问“阳性后患病”,分母就只能是所有阳性者。

💡找分母像找聚会合照:题目问“阳性的人里面”,就先把所有阳性者叫进镜头,再数其中的病人。不要把“所有病人”那张合照误当成答案的分母。

基础率要选对,证据也别重复计算

假设某品牌电池的公司级故障率只有 0.2%,但你手里的电池来自一个已发现装配问题的批次,该批次故障率为 4%。设备现在又发出过热警报。此时拿 0.2% 安慰自己就太宽泛了;如果批次信息可靠且确实适用于这块电池,4% 才是更匹配的起点。

基础率不是永远选最大的统计表,也不是挑一个最符合心情的数字。它应来自与当前个案在时间、地点、来源和机制上足够相似的参考类,同时有足够样本支撑。

接着再让证据更新这个起点:警报对故障电池有多敏感?对正常电池多常误报?复测是否真的带来了新信息?

如果两个应用只是读取同一个物理传感器,那么两个弹窗并不是两份独立证据。相反,由不同原理产生、误差来源也不同的复核结果,通常能提供更强的更新。但即便两项证据独立,也不能仅凭“两个阳性”宣称 100% 确定;仍要结合基础率与各自的条件概率。

⚠️别把同一位目击者换两件外套,就当成来了两位证人。证据数量看起来翻倍,不代表信息量真的翻倍;先追问它们是否共享同一个数据源、误差或触发原因。

自测 · 学完检查一下

想真正动手做题、记进度、攒连胜?到互动课里练。

某二手交易平台中,约 0.5% 的商品信息属于诈骗。风控系统能标记 80% 的诈骗信息,同时会误标 2% 的正常信息。分析员看到一条信息被标记后说:“它有 80% 的概率是诈骗。”他的主要错误是什么?

答案:他把警报的命中率直接当成了结论:所求概率还取决于 0.5% 的诈骗占比与 2% 的误标率,他把条件的方向用反了

对:80% 是 P(标记|诈骗),而分析员需要的是 P(诈骗|标记);后者还取决于诈骗的基础率以及正常信息的误标率。最诱人的错误项是“直接采用 0.5%”:它注意到了基础率,却完全丢掉了警报带来的新证据;正确做法是用警报更新基础率,而不是停在基础率。98% 是正常信息不被误标的概率,78% 则是把适用于不同人群的两个比例直接相减,两者都不是所求概率。

一套山地救援信号系统监测 10000 次登山者签到。历史上约 2% 的签到对应真实险情;系统能对 90% 的真实险情报警,并会对 4% 的非险情误报。某次报警后,真实存在险情的概率最接近多少?

答案:约 31%

对:10000 次签到中约有 200 次真实险情,其中 180 次报警;其余 9800 次非险情中,4% 会误报,即 392 次。报警共约 572 次,真实险情占 180÷572≈31%。最诱人的错误项是“约 90%”:90% 是险情发生后系统报警的概率,不能反过来当作报警后真有险情的概率。“约 86%”来自错误地用 90%−4%,而“约 2%”则完全没有用报警更新基础率。

一家内容平台只公布:“有害内容识别模型在评估集上的总体准确率为 97%。”模型随后标记了一篇帖子。根据这条信息,下面哪项判断最严谨?

答案:仅凭总体准确率算不出该帖确为有害的概率,还需要部署环境的基础率与分类别的表现

对:总体准确率把真阳性和真阴性混在一个按类别比例加权的平均里;同一个 97% 可能对应截然不同的灵敏度和误标率,所以推不出被标记帖子的有害概率。最诱人的错误项是“97% 概率有害,因为已把两类错误平均在内”:恰恰因为它是加权平均,才不能当成单次标记的可信度——平均掉的正是你需要拆开的信息。3% 是全部样本的错误比例,不等于已标记样本的误判概率;一个模型也可能靠做好占多数的类别拿到 97% 准确率,灵敏度和特异度并无 97% 的下限保证。

一道 MCAT 风格的假设题中,同一种检测在两个人群里的灵敏度均为 80%、特异度均为 90%。疾病在 A 人群的患病率为 20%,在 B 人群为 2%。因为阳性在 B 人群中更加罕见、更令人意外,所以 B 人群的阳性者反而更可能真正患病。

答案:

对(即为什么选“错”):检测表现相同时,患病基础率更高的 A 人群拥有更高的阳性预测值。按每 1000 人估算,A 人群约有 160 个真阳性和 80 个假阳性,阳性预测值约 67%;B 人群约有 16 个真阳性和 98 个假阳性,约为 14%。最诱人的直觉是把“结果更意外”理解成“结果更可信”;实际上,罕见事件意味着真病例更少,假阳性更容易占据阳性人群。

一家快递公司要判断某个在节前夜间经过 X 中转站、随后扫描记录中断的高价包裹是否被盗。为了给后续证据设定合理起点,下面哪个基础率最合适?

答案:X 中转站在相近节前时段、同类运输服务中,扫描中断包裹最终确认被盗的比例

对:它在地点、时段、服务类型和已知线索上都与当前包裹匹配,最接近当前个案所属的参考类。最诱人的错误项是“全国所有普通包裹的年度失窃率”:样本可能更大,却混入了不同价值、流程、地点和时段的包裹,基础率过于宽泛。“已经报失的包裹”是在结果出现后筛选人群,回答的是另一个条件问题;媒体案例则受报道选择影响,也缺少稳定分母。

招聘委员会收到候选人两位前同事写来的两封热情推荐信,一位委员说:“两封信是两份独立证据,候选人优秀的概率应该被更新两次。”下面哪条新信息最直接削弱“独立证据”这一前提?

答案:两位推荐人对候选人的全部好印象,都来自候选人牵头过的同一个明星项目

对:两封信共享同一个上游来源——那个项目的成功。如果项目的光环里混有运气或团队他人的功劳,这个偏差会同时灌进两封信,第二封的证据力和第一封大量重合,远不是一次全新的独立观察。最诱人的错误项是“这种候选人本来罕见”:低基础率会拉低最终概率,但它回答的是起点问题,不能证明两条证据是否独立。两位推荐人宽严不同只是各自的判断阈值不同,来源仍可能重合;寄到时间相隔一周更只是传递时差,不会凭空产生新信息。

想边练边学,而不只是读?

到互动课里答题、记进度、攒连胜——游客即可试学,无需注册。

进入互动课程 →

学点新东西,不错过更新

新课程、新功能、学习小技巧——偶尔一封,随时退订。