假设你参加一种罕见病筛查:人群患病率为 1%;检测能找出 90% 的病人,也就是灵敏度为 90%;健康人中有 5% 会误报阳性,也就是特异度为 95%、假阳性率为 5%。
现在你的结果是阳性。直觉很容易抓住“90%”并说:我有九成概率患病。但 90% 回答的是“已经患病的人,有多大概率测出阳性”,你真正想问的是“已经测出阳性的人,有多大概率患病”。方向反过来了,答案也会完全不同。
这就是基础率谬误的常见形式:面对一条醒目的个案证据时,忽略事件原本的发生比例,也就是基础率。
几个量不能混用:灵敏度是 P(阳性|患病);特异度是 P(阴性|健康);假阳性率是 P(阳性|健康),等于 1−特异度;阳性预测值才是 P(患病|阳性)。而“总体准确率”是全部受测者中判断正确的比例,会随样本里的患病者比例变化。只听到“99% 准确”而不知道样本构成和混淆矩阵,通常还算不出阳性者患病的概率。