🪤 思维陷阱 · 思维陷阱·经典关卡

琳达问题合取谬误、Wason 2-4-6 与四卡片选择任务、可得性启发:85% 中招的经典认知实验逻辑陷阱全拆解|思维陷阱

85% 的人栽在琳达问题、只有 21% 一次猜中 2-4-6、抽象四卡片不足 10% 答对换成饮酒年龄场景就 74%——相似度、正例与易回忆度,如何冒充概率、证据与频率

一句话先懂 · TL;DR

一节有出处的逻辑陷阱课,带你亲手掉进四个最经典的认知实验:琳达问题里 85% 的人违反合取规则,认为『出纳且女权』比『出纳』更可能,统计训练几乎不救——统计小白违规 89%、修过统计课的研究生 90%、斯坦福决策科学博士生 85%,因为大脑用『像不像』替代了『是不是』(代表性启发,与律师-工程师问题的基率忽视是同一机制);Wason 2-4-6 任务只有 21% 一次猜中规则,人人只测正例不做证伪——Klayman & Ha 重解读:这是中性的『正例测试策略』在特定问题结构下的失败,不是动机性自欺,解药是『若我错了会看到什么』的负例测试;四卡片任务抽象版不足 10% 答对,换成饮酒年龄场景飙到 74%,逻辑结构相同、内容决定成败;可得性实验里 69% 的人猜反字母 K 的位置,车祸致死实际约为糖尿病的 1.5 倍却被平均判成 350 倍——易回忆度冒充了真实频率。每个陷阱配免疫处方:合取铁律、找基率、负例测试、看统计不看画面感。事实出自 Tversky & Kahneman、Wason、Klayman & Ha 等一手论文。

哪个更可能?——琳达问题与被扔掉的基率

先做一道题——认真选,别跳过。

琳达,31 岁,单身,直言,非常聪明,主修哲学。学生时代深切关注歧视与社会正义议题,还参加过反核游行。

请问哪个更可能?

- (A) 琳达是银行出纳
- (B) 琳达是银行出纳,积极参与女权运动

选好了吗?如果你选了 B——恭喜中招,而且你不孤单:Tversky & Kahneman (1983) 用最直白的二选一版本测了 142 名 UBC 本科生,85% 选了 B。但 B 不可能比 A 更可能:B 是 A 的子集——每一个『出纳且女权』的琳达,首先得是『出纳』。合取事件的概率永远不可能超过它的成分:P(A 且 B) ≤ P(A)。这条铁律叫合取规则,违反它就是合取谬误(conjunction fallacy)

更扎心的是:统计训练几乎不起作用。八项概率排序版按统计背景分组:统计小白违规率 89%,修过统计课的研究生 90%,斯坦福决策科学博士生 85%;直接测验总体违规 88%。

为什么?T&K 的解释是代表性启发(representativeness):『出纳且女权』更琳达——概率排序与代表性排序的相关高达 .98。你的大脑用『像不像』悄悄替换了『是不是』,用相似度替代了概率

有一个流行辩护:『被试只是把「银行出纳」读成了「出纳但不是女权者」,这是误读,不是谬误。』T&K 当年就用对照实验排除了:让另一组 119 人用 9 点量表逐项给两个选项打概率分——逐项评分没有理由做排他性解读,结果 82% 仍给「出纳且女权」更高分(均值 5.6 vs 3.5)。不过问法确实关键:改成频数格式(『100 个像琳达的女性里,有多少是银行出纳?有多少是出纳且参与女权运动?』),谬误率从约八成锐减到两成上下——谬误真实存在,但强度高度依赖问法。

同一机制还有另一张面孔:基率忽视。Kahneman & Tversky (1973) 给被试看『从 100 名专业人士中随机抽出』的性格速写:一组被告知样本是 70 名工程师+30 名律师,另一组反过来是 30:70。按贝叶斯推理,同一份描述在两组给出的『此人是工程师』概率应显著不同;实际两组判断几乎相同——被试只看描述『像不像工程师』,基率被无视。最刺眼的对照是刻意零信息量的『Dick』(30 岁、已婚无子女、能力强动机高、同事喜欢他):两组的中位数概率都是 0.50。有了废话描述,反而扔掉基率;而完全不给描述时,被试能正确使用 70%/30%。

⚠️一句话记住:『像』不等于『是』。细节越多的故事越生动、越『像』,但每加一个『且』,概率只会更低。下次听到『他是 X,而且肯定还 Y』时,先问一句:只算 X,概率是多少?基率是多少?
合取谬误:『出纳且女权』是『出纳』的子集,子集的概率不可能超过全集

你以为在检验,其实在证实——2-4-6 与四张卡片

再来一局。实验者心中有一条规则,数列 2, 4, 6 符合它。你可以随便报三元组,每报一个,实验者告诉你『符合』或『不符合』;自认确定后就宣布规则。想一想:你会先报哪个数列?

多数人心里已经冒出假设——『每次加 2』——然后开始报 8, 10, 1220, 22, 24……全都『符合』,信心越来越足,宣布规则:每次加 2。错。真规则简单到过分:『三个递增的数』。Wason (1960) 的 29 名心理系本科生里,只有 6 人(21%)第一次宣布就正确,13 人先错一次,9 人错两次以上,还有 1 人始终没能宣布任何正确规则。

典型失败模式:形成『每次加 2』这类比真规则更窄的假设后,只生成符合自己假设的正例去『证实』,几乎不报违背假设的三元组(比如 1, 2, 3)去『证伪』。Wason 称之为『未能消除假设』(failure to eliminate hypotheses)——这是确认偏误的首个实验演示。

但注意别把它讲歪:被试对一条数字规则毫无利害立场,没有什么『愿意相信的东西』,却仍系统性地只测正例。确认偏误的核心是『正例测试策略』(positive test strategy)这种认知默认,不是动机性自欺。Klayman & Ha (1987) 进一步指出:正例测试在多数真实环境里其实高效、甚至近似最优;它只在『真规则比你的假设更宽』时才致命——而 2-4-6 恰好是故意构造的这种陷阱:真规则『递增』完全包含假设『每次加 2』,正例永远报『是』。解药:主动设计『若我错了,会看到什么』的负例测试。报一个 1, 2, 3,如果也『符合』,你的假设当场破产——这一步比一百个正例都值钱。

第三局:桌上四张卡片 E、K、4、7,每张一面字母一面数字。规则:『如果卡片一面是元音,那么另一面是偶数。』必须翻开哪些卡片才能检验规则真伪?先选,再往下看。

逻辑正确答案是 E 和 7:只有『元音+奇数』的组合能证伪规则——E 背面若是奇数、7 背面若是元音,规则就破了;而 4 的背面无论是什么都不违反规则(规则没说偶数背面必须是元音)。实际表现(Wason 1968 及后续复制):几乎人人选 E,60–75% 的人误选 4(肯定后件),只有少数人选 7;标准抽象版正确率通常不足 10%,Dawes (1975) 报告 5 位数学心理学博士里只有 1 人做对。可是把同构问题换成熟悉内容,结果立刻逆转:Griggs & Cox (1982) 的饮酒年龄版——规则『喝啤酒的人必须年满 19 岁以上』,卡片=喝啤酒/喝可乐/16 岁/22 岁——正确率 74%。逻辑结构一模一样,内容与经验决定成败,这就是『内容效应』:你缺的往往不是逻辑,而是把抽象规则翻译成『该去查谁违规』的直觉。

2-4-6 与四卡片:证伪一次,胜过证实一百次

想得起来≠常发生——字母 K 与被高估 350 倍的死因

最后一局,送分题(吗?):从一段英文文本里随机抽一个词,字母 K 出现在词首的可能性大,还是出现在第三个字母位置的可能性大?

Tversky & Kahneman (1973) 问了 152 名被试(K、L、N、R、V 五个辅音逐一问,并让他们估计比值)。这五个辅音实际都是第三位更常见,约两倍;但 105 人(69%)判断『多数字母在词首更常见』,中位数估计比约 2:1 偏向词首——方向整个反了。机制赤裸裸:按词首检索单词(K 开头的词)远比按第三个字母检索容易,『检索的容易程度』被当成了『客观频率』——这就是可得性启发(availability heuristic)的定义性演示。

可得性不止在实验室坑你。Lichtenstein、Slovic、Fischhoff、Layman & Combs (1978) 用 5 个实验、约 660 名成人,对 106 对死因做两两比较:『哪个每年在美国杀死更多人?』并估计倍数。两大系统偏差浮出水面:其一,高估罕见戏剧性死因、低估常见死因——肉毒杆菌中毒、龙卷风这类画面感强的罕见死因被大幅高估,中风、糖尿病这类常见死因被大幅低估(龙卷风被判为比哮喘更常见的死因,实际哮喘致死远多于龙卷风);其二,判断的倍数离谱——车祸致死实际只约为糖尿病的 1.5 倍,被试平均判断成 350 倍。媒体报道多、易回忆易想象的死因,其『心理可得性』冒充了真实频率。你脑中的『世界危险排行榜』,很大程度上是新闻编辑排的。

⚠️两个交代+一张处方。交代一:字母实验别夸大——T&K 特意只挑了第三位更常见的例外字母(多数辅音其实词首更常见),Sedlmeier 等 (1998) 重做发现被试对『词首更常见』的字母判断得相当准;正确结论是『检索易度会系统性带偏频率判断』,不是『人对字母频率一无所知』。交代二:这些陷阱没一个能靠『聪明』免疫——统计博士生照样栽。处方四条,对症下药:① 听到『而且』就默念合取铁律 P(A且B)≤P(A);② 估概率先找基率,再看描述像不像;③ 检验假设时主动设计『若我错了会看到什么』的负例测试,优先翻能证伪的那张卡;④ 判断风险看统计数据,别看画面感。先中招,再免疫——你已经完成了第一步。
可得性启发:易回忆度冒充真实频率——车祸 vs 糖尿病,实际约 1.5 倍,被判成 350 倍

自测 · 学完检查一下

想真正动手做题、记进度、攒连胜?到互动课里练。

琳达,31 岁,单身,直言,非常聪明,主修哲学;学生时代深切关注歧视与社会正义议题,还参加过反核游行。下面哪个更可能?

答案:琳达是银行出纳

合取规则:P(出纳且女权) ≤ P(出纳)——『出纳且女权』是『出纳』的子集,每一个『出纳且女权』的琳达首先得是『出纳』,所以无论描述多『像』,合取选项都不可能更可能。在最直白的二选一版本里,142 名 UBC 本科生中 85% 选了『出纳且女权』——这就是代表性启发在作祟:合取选项更像琳达(概率排序与代表性排序相关高达 .98),大脑用相似度替代了概率。(出处:Tversky & Kahneman 1983 — Extensional versus intuitive reasoning, Psychological Review 90(4))

老周,55 岁,烟龄三十年,常年咳嗽。下面哪个更可能?

答案:老周明年会住院

这就是琳达问题的同构变体:『因肺部疾病住院』是『住院』的子集——老周无论因为什么住院都算『住院』,所以 P(因肺病住院) ≤ P(住院),铁律不看描述。『烟龄三十年、常年咳嗽』的描述让『肺部疾病』显得极有代表性,诱导你用『像不像』替代『是不是』——识别办法:听到『而且/因为/具体是』这类往事件上加细节的措辞,先默念合取规则,再问『只算大类,概率多少?』(出处:Tversky & Kahneman 1983 — 合取谬误的代表性机制,Psychological Review 90(4))

判断:琳达问题的八项概率排序版里,修过统计课的研究生违规率 90%、斯坦福决策科学博士生 85%,与统计小白的 89% 几乎没有差别——统计训练几乎不能消除合取谬误。

答案:正确

正确。按统计背景分组的结果是:统计小白 89%、修过统计课的研究生 90%、斯坦福决策科学博士生 85%,直接测验总体违规 88%——训练带来的差别小到可以忽略,说明合取谬误不是『没学过概率』的知识缺口,而是代表性启发这种直觉机制在自动运转。真正能大幅压低谬误率的是改问法:换成频数格式(『100 个像琳达的女性里有多少……』),谬误率从约八成锐减到两成上下。(出处:Tversky & Kahneman 1983;Hertwig & Gigerenzer 1999;Fiedler 1988)

有人为琳达问题辩护:『被试只是把「银行出纳」理解成了「出纳但不是女权者」——这是误读,不是谬误。』下面哪项证据最能直接反驳这个辩护?

答案:T&K 让另一组 119 人用 9 点量表给两个选项逐项打概率分——逐项评分没有理由做排他性解读,结果 82% 仍给『出纳且女权』更高分(均值 5.6 vs 3.5)

误读辩护说的是:被试把 T 排他性地解读成『T 且非 F』,所以选 T&F 不算违反合取规则。直接反驳它的是逐项评分对照实验:119 人分别给 T 和 T&F 打 9 点量表概率分——这种任务里没有理由做排他性解读,结果 82% 仍给 T&F 更高分(均值 5.6 vs 3.5),误读救不了直接透明版的谬误。但问法确实关键:频数格式能把谬误率从约八成压到两成上下——所以结论要说全:谬误真实存在,强度高度依赖『单一事件概率措辞』还是『频数措辞』。其余选项:博士生数据说明训练无效、相关 .98 说明机制,都不直接回应『是否误读』。(出处:Tversky & Kahneman 1983;Fiedler 1988;Hertwig & Gigerenzer 1999)

2-4-6 任务:实验者心中有一条规则,『2, 4, 6』符合它。你猜规则是『每次加 2』。下一步测试哪个三元组最有信息量?

答案:1, 2, 3

前三个都是『每次加 2』的正例——如果真规则比你的假设更宽(比如真规则是『三个递增的数』),正例永远得到『符合』,你测一百个也发现不了自己错了。『1, 2, 3』违背『每次加 2』但仍然递增:若实验者回答『符合』,你的假设当场被证明太窄——一次负例测试的信息量胜过一百次证实。Wason (1960) 的被试正是败在只测正例:29 人只有 6 人(21%)第一次宣布就猜中真规则『三个递增的数』。(出处:Wason 1960 — On the failure to eliminate hypotheses, QJEP 12(3);Klayman & Ha 1987)

判断:2-4-6 实验里被试只测正例,是因为他们对自己的假设有情感投入、只想证明自己愿意相信的东西——确认偏误本质上是一种动机性自欺。

答案:错误

错误。被试对一条数字规则毫无利害立场,没有任何『愿意相信的东西』,却仍系统性地只测正例——确认偏误的核心是『正例测试策略』这种认知默认,不是动机性偏袒或自欺。Klayman & Ha (1987) 进一步指出:正例测试在多数真实环境里其实高效、甚至近似最优;它只在『真规则比你的假设更宽』时才致命——2-4-6 恰好是故意构造的这种陷阱(真规则『递增』完全包含假设『每次加 2』,正例永远报『是』)。解药不是『别有立场』,而是主动设计『若我错了会看到什么』的负例测试。(出处:Klayman & Ha 1987 — Psychological Review 94(2);Wason 1960)

桌上四张卡片:E、K、4、7,每张一面是字母、另一面是数字。规则:『如果卡片一面是元音,那么另一面是偶数。』必须翻开哪些卡片才能检验规则真伪?

答案:E 和 7

只有『元音+奇数』的组合能证伪规则,所以必须翻 E(背面可能是奇数)和 7(背面可能是元音);4 的背面无论是什么都不违反规则——规则没说偶数背面必须是元音,翻 4 和 K 都是无信息量的多余动作,『四张全翻』自然也不是『必须翻开哪些』的答案。实际表现:几乎人人选 E,60–75% 的人误选 4(肯定后件),只有少数人选 7;标准抽象版正确率通常不足 10%,Dawes (1975) 报告 5 位数学心理学博士里只有 1 人做对。检验『如果 P 则 Q』,永远去找 P 和非 Q。(出处:Wason 1968 — Reasoning about a rule, QJEP 20(3);Griggs & Cox 1983)

判断:四卡片任务换成逻辑结构完全相同的饮酒年龄场景——规则『喝啤酒的人必须年满 19 岁以上』,卡片=喝啤酒/喝可乐/16 岁/22 岁——正确率就从抽象版的不足 10% 跃升到 74%:抽象版答错,不等于不懂『如果…那么…』的逻辑。

答案:正确

正确。Griggs & Cox (1982) 的饮酒年龄版与抽象版逻辑结构完全同构:该查的还是 P 与非 Q——『喝啤酒的』(背面可能未满 19)和『16 岁的』(背面可能在喝啤酒);『喝可乐的』和『22 岁的』无论背面是什么都不违规。同一批人在抽象字母数字版上通常不足 10% 答对,在这里 74% 答对——内容与经验决定成败,这就是『内容效应』:人缺的往往不是逻辑能力本身,而是把抽象规则翻译成『该去查谁违规』的直觉。(出处:Wason 1968;Griggs & Cox 1982, British Journal of Psychology 73;Griggs & Cox 1983)

从一段英文文本里随机抽一个词:字母 K 出现在词首的可能性大,还是出现在第三个字母位置的可能性大?

答案:第三位——实际约是词首的两倍

K 实际在第三位更常见,约是词首的两倍。Tversky & Kahneman (1973) 用 K、L、N、R、V 五个辅音问了 152 名被试——这五个字母实际都在第三位更常见,但 105 人(69%)判断『多数字母在词首更常见』,中位数估计比约 2:1 偏向词首,方向整个反了。机制:按词首检索单词远比按第三个字母检索容易,『检索的容易程度』被当成了『客观频率』——可得性启发。同一机制在真实世界的版本:媒体报道多、画面感强的死因被大幅高估——车祸致死实际只约为糖尿病的 1.5 倍,被试平均判断成 350 倍。注意别夸大:T&K 特意挑了第三位更常见的例外字母(多数辅音其实词首更常见),Sedlmeier 等 (1998) 复做发现被试对『词首更常见』的字母判得相当准——正确结论是『检索易度会系统性带偏频率判断』,不是『人对字母频率一无所知』。(出处:Tversky & Kahneman 1973 — Availability, Cognitive Psychology 5(2);Lichtenstein et al. 1978;Sedlmeier et al. 1998)

Kahneman & Tversky (1973) 给两组被试看同一份『从 100 名专业人士中随机抽出』的性格速写:一组被告知样本是 70 名工程师+30 名律师,另一组被告知是 30 名工程师+70 名律师。速写主角 Dick:30 岁、已婚无子女、能力强、动机高、同事喜欢他——刻意写成零信息量。两组判断『Dick 是工程师』的概率,结果如何?

答案:两组的中位数都是 0.50——一段废话描述,就让两组把 70%/30% 的基率整个扔掉

两组中位数都是 0.50。按贝叶斯推理,同一份描述在 70:30 与 30:70 两组给出的概率应显著不同;实际上被试只看描述『像不像工程师』(代表性),基率被无视——最刺眼的是:有了零信息量的废话描述反而扔掉基率,而完全不给描述时,被试能正确使用 70%/30%。代表性启发=用相似度替代概率:琳达问题的合取谬误与这里的基率忽视,是同一机制的两张面孔。识别办法:拿到任何『画像+判断概率』的问题,先问基率,再看描述。(出处:Kahneman & Tversky 1973 — On the psychology of prediction, Psychological Review 80(4);median 0.50 数据另见 Gigerenzer 1991 转述)

想边练边学,而不只是读?

到互动课里答题、记进度、攒连胜——游客即可试学,无需注册。

进入互动课程 →

Learn something new — don't miss updates

New courses, features and learning tips. Occasional emails, unsubscribe anytime.

Linda Problem & Wason Tasks: Classic Logic Traps Explained · PurrLearn