幸存者偏差和损耗偏差都会因为漏掉相关案例而误导判断,但它们描述的是两种不同的机制。幸存者偏差来自只看通过了某道筛选或"可见性"过滤的案例;损耗偏差来自一个最初已被纳入或观察的样本,在后续跟踪中发生了"有信息量"的流失。这个区别在研究、考试成绩宣传和产品留存看板里都很要紧。
一句话答案
| 偏差 | 核心问题 | 关键提问 |
|---|---|---|
| 幸存者偏差 | 证据只包含通过了筛选、或仍然可见的案例。 | 在得出这个结论之前,谁已经被筛掉了? |
| 损耗偏差 | 最初被观察的人或案例在跟踪期间流失,而且流失方式会扭曲结果。 | 观察开始之后谁离开了,他们的缺席会不会改变估计? |
损耗可能让研究者手里只剩一群"幸存者",但两个术语指向的是不同的事实。幸存者偏差强调的是决定谁可见的那道过滤;损耗偏差强调的是一个明确起始样本随时间的流失。
两者的修正都从分母开始:找出结论声称要描述的完整群体,而不是只看还能拿来检查的那些案例。
幸存者偏差:从看得见的幸存者身上总结经验
当结论建立在通过了某种选择、筛查或可见性过滤的案例上,而失败、中止或以其他方式缺席的案例被忽略时,就出现了幸存者偏差。
这道过滤不一定是字面意义上的"存活"。它可以是一家公司还在经营、一个学生读完了项目、一个产品仍在被使用,或者一个故事因为结局好而获得了关注。
研究例子:某项目的毕业生
一所大学只调查读完某研究生项目的学生,发现他们汇报的职业发展很好,于是得出该项目能稳定产出这种结果的结论。
这里的问题是幸存者偏差,因为调查以"完成项目"为条件。入学但没读完的学生不在样本里,而他们的结果对"该项目整体效果"的说法是相关的。
被拒的申请者、去了其他项目的人可能也重要,如果大学想说是这个项目造成了差异的话。但那是另一类对照组问题,不是这个例子里核心的幸存者问题。
考试例子:高分者的经验
一个备考网站采访了成绩优异的学生。很多人说自己每个周末做一套完整模拟题,于是读者得出结论:这个安排能稳定带来好成绩。
这个结论可能就是幸存者偏差。读者看到的是用了这个安排的成功学生,看不到用了类似安排却考得不好、练到倦怠、或者中途放弃的学生。
这些建议仍可能有用。它自己无法证明的,是这个安排导致了高分,或者它对大多数学生都有效。这是幸存者偏差详解:例子、常见误区与快速测验里讲的那类更广泛推理错误的常见变体。
产品例子:只分析留下来的用户
一个订阅产品团队研究最活跃的现有用户,发现他们在第一周经常使用某个功能,于是决定向所有新用户推广该功能来提升留存。
被观察的这些用户通过了"留存"这道过滤:他们还活跃着。已流失的用户可能试过这个功能但不喜欢,也可能因为引导流程失败根本没走到那一步。现有用户并不自动代表所有注册过的人。
更好的起点是最初的注册队列,然后比较留存用户和流失用户。这方面最经典的历史案例是二战中的幸存者偏差:那架布满弹孔的飞机。
损耗偏差:跟踪期间"有信息量"的流失
当一个最初被纳入或观察的样本,其成员在跟踪期间流失,而这种流失改变了剩余数据能公正说明的东西时,就出现了损耗偏差。
光有流失还不够。两组之间流失率不同是一个警示信号,但它既不是损耗偏差的必要条件也不是充分条件。两组流失同样多,如果离开的人在与结果相关的特征上有差异,流失照样"有信息量";反过来,流失率不同也未必实质性地扭曲结果,只要流失和被估计的结果无关。
核心问题不只是"走了多少人",而是"缺席的这些案例会不会改变比较或估计"。
研究例子:压力管理课程
一项研究跟踪被分配去上压力管理课程的员工和对照组员工。跟踪期间,课程组里初始压力最高的人特别容易不再回复问卷。
到最后一次问卷时,课程组剩下的人报告的压力低于对照组。这个结果可能被扭曲了,因为被观察到的课程组已经不再代表所有开始干预的人。这种流失是有信息量的:它和一个对结果重要的特征相关。
一份严谨的报告应该给出每组开始时有多少人、每次跟踪时还剩多少、以及关于缺失观测已知的信息。
考试例子:推理训练营
一所学校跟踪报名了十周推理训练营的学生,在结束时测量模拟考的进步幅度。最吃力的学生更可能中途不来了,错过最终测评。
如果学校只报告完成最终测评的学生的平均进步,估计可能过于乐观。问题不只是有人走了,而是从最初报名样本里的流失和可能的成绩相关。
这是损耗偏差,因为相关的扭曲是在跟踪期间形成的,而不只是一堆按成功筛选出来的见证。
产品留存例子:引导流程实验
一个产品团队把新用户随机分到两个版本的引导流程,两个月后请他们填满意度问卷。早早取消订阅的用户几乎不会填。
假设 A 版本在回复者中的满意度更高。这可能说明引导做得更好,但如果不满意的用户在 A 版本的跟踪回复中缺席得更多,这也可能是损耗偏差。两组回复者可能已经和最初分配的两组不可比了。
有用的分析会保留最初的队列,并把跟踪完成率和满意度结果放在一起报告。
怎么区分幸存者偏差和损耗偏差
读研究、论证、成绩宣传或数据看板时,按这个顺序问:
- 结论声称描述的是哪个群体?
- 用作证据的是哪些被观察到的案例?
- 可见性是否取决于通过某道选择过滤?
- 是否有案例最初被观察到、后来在跟踪中流失?
- 缺失的案例有没有可能改变结论?
当论证把可见的幸存者当作代表、无视被筛掉的案例时,叫它幸存者偏差。当最初样本在跟踪期间的有信息量流失扭曲了结果时,叫它损耗偏差。
真实案例可以两者兼有。一项研究可能只招募某项目的毕业生,然后在后续跟踪中又不均匀地流失了毕业生。当两种机制各自解释了不同的问题时,把两个都点出来。
这种诊断对逻辑推理题很有用:把陈述的证据和结论声称覆盖的群体分开。要更系统地识别论证漏洞,参见 LSAT 逻辑推理题型:如何识别并解决每一种。
快速辨认练习
1. 盈利的创业公司
一档播客采访达到盈利的创业公司创始人,因为受访者多数没拿外部融资,就得出"不融资是最好的策略"的结论。
答案:幸存者偏差。 播客先挑出了盈利的公司,再从这些可见的幸存者身上泛化。它漏掉了同样没融资但失败或没能盈利的公司。
2. 课程完成率结果
一门在线课程在报名时和八周后各测一次。进步很小的学生更可能不再登录、错过最终测评。课程方只报告完成了测评的学生的进步。
答案:损耗偏差。 这些学生一开始在被观察的样本里,之后在跟踪中流失,而流失和"进步"这个被测量的结果相关。
3. 设备可靠性
一家医院请员工评价目前在用设备的可靠性。因反复出问题而被撤下的设备不在评价范围内。
答案:幸存者偏差。 证据只限于还在使用的设备,排除了会影响可靠性估计的故障设备。
三道题够看出模式,不够练成本能。幸存者偏差测验再给你十二个场景,答完即判,每条解析都点名那道"过滤"在哪。
常见问题
幸存者偏差和损耗偏差是一回事吗?
不是。幸存者偏差关注的是以"通过过滤的可见案例"为条件;损耗偏差关注的是最初被观察样本在跟踪期间的有信息量流失。损耗可能留下一群"幸存者",但因果机制不同。
两组流失率不同就一定是损耗偏差吗?
不一定。流失率不同应该引起审视,但它本身不能确立偏差。缺失的案例必须在某种会改变估计或比较的方式上有所不同。
流失率相同还会有损耗偏差吗?
会。如果结果更差的人在两组里以相似比例离开,用剩余样本做的估计仍可能被扭曲。百分比相似并不保证缺失的信息相似。
怎么在备考建议里识别幸存者偏差?
问一句:用了同样方法但没成功、中途放弃、或者根本没出现在成功故事样本里的人怎么样了?高分者的建议可以用来提出假设,但它不自动成为"普适方法"的证据。
结论
幸存者偏差关乎被选择过滤"露出来"的案例;损耗偏差关乎一个明确样本在跟踪期间的有信息量流失。无论哪一种,更好的推理都从三个问题开始:谁不见了,为什么不见了,手头这些案例撑不撑得起结论。