认知偏差是由人们在不确定情况下做决策时使用的心理捷径所产生的系统性、可预测的判断错误。现代研究项目始于阿莫斯·特沃斯基和丹尼尔·卡尼曼1974年在《科学》杂志上发表的论文,该论文描述了三种启发式——代表性、可得性和从锚点调整——并得出结论认为这些启发式非常经济且通常有效,但它们会导致系统性和可预测的错误。卡尼曼因将心理学研究融入经济科学而获得2002年瑞典国家银行经济科学奖;特沃斯基于1996年去世,该奖项不授予追授。三个术语通常被混淆。启发式是捷径本身,通常是适应性的。认知偏差是捷径产生的系统性错误。逻辑谬误是论证结构中的缺陷,而不是判断中的缺陷。而噪声,即卡尼曼、希博尼和桑斯坦2021年书中的主题,是对同一问题判断中的不良变异——散布而非方向性错误——他们的保险研究发现,针对相同虚构客户的中位保费变化达55%。对组织决策最重要的偏差包括确认偏差、锚定、可得性、过度自信和过度精确、规划谬误、现状偏差、框架效应、事后偏见、对应偏差或基本归因错误、沉没成本、基率忽视,以及邓宁-克鲁格效应。这些偏差的证据在强度上差异显著,诚实的处理方式很重要:来自随机数字的偶然锚定在Many Labs 2中未能复制,Sedlmeier、Hertwig和Gigerenzer在1998年削弱了可得性的字母频率演示,基率忽视在很大程度上依赖于格式,而邓宁-克鲁格效应在很大程度上是回归均值的统计伪影,而非元认知缺陷。自我耗竭、通过笔在嘴里反馈的面部反馈、社会启发和权力姿态都未能在大规模复制中成功。在补救措施方面,仅仅意识并不起作用:Pronin、Lin和Ross发现参与者在阅读了影响他们的偏差描述后,仍坚持认为他们的自我评估是准确的。有效的措施是结构性的——在Grove及其同事对136项研究的荟萃分析中,机械聚合判断的表现优于临床判断,去偏训练结合实践和反馈能持续数月并转移到专业环境中,考虑相反的观点即使在专家中也能减少锚定,而参考类预测足够有效地对抗规划谬误,以至于英国财政部要求明确的乐观偏差调整。Argumentree从结构上解决这些问题,而不是通过劝说:在讨论前独立提交去除锚定和观众,每个论点都携带其证据,并可以根据其优点而非作者进行评分,带时间戳的决策记录允许后续根据当时已知的信息来评判决策。

认知偏差是判断中的一种系统性、可预测的错误——不是随机的马虎,而是每次都朝同一方向倾斜的错误。这种可预测性是好消息:你可以预见的错误是你可以设计规避的错误。
最后更新: 2026-08-25
偏见源于启发式——Tversky和Kahneman将其描述为“高度经济且通常有效”,正是因为它们在大多数情况下都有效。以下是对组织决策最重要的十二种偏见,每种偏见都有其经典研究、商业实例和诚实的复制状态——因为一些著名的发现未能在过去十年中存活,而隐藏这些信息的参考页面并不是一个真正的参考页面。有效的解决方案是结构性的,而不是动机性的:告知人们关于偏见的知识是文献中最弱的干预措施。
这些术语可以互换使用,但实际上并不可以。将它们区分开来是本页大部分实际价值所在。
研究项目始于阿莫斯·特沃斯基和丹尼尔·卡尼曼1974年在《科学》杂志上发表的论文,该论文提出了三种启发式方法——代表性、可得性和从锚点调整——并得出了至今仍然影响该领域的结论:“这些启发式方法非常经济,通常有效,但会导致系统性和可预测的错误。”卡尼曼因这项工作获得了2002年诺贝尔经济学奖;特沃斯基于1996年去世,诺贝尔奖不授予追授。
每个条目:它是什么,决策的影响,证据实际上支持什么,以及当推理结构化时会发生什么变化。复制状态被明确说明——其中几个的可信度低于它们的声誉,而两个在相邻心理学领域最著名的发现则完全失败。
寻求和权衡支持你已有观点的证据。问题所在:在某人私下决定后组建的供应商候选名单中,每个参考电话都在确认而不是测试。
证据:Wason的1960年规则发现任务是起源,尽管他自己的结论适用于在两次或更多错误后仍然存在的子组。Klayman和Ha(1987)将其重新框架为一种在大多数环境中规范上合理的积极测试策略——你在寻找你期望找到的东西时并不是不理性。Hart及其同事在心理学公报中的2009年元分析将亲和性偏见定为d = 0.36,而当反驳信息确实有用时,它会逆转。
在Argumentree中:反对分支不是可选的。没有记录反例的主张显然是不完整的,而不是默默无挑战的,问题链将挑战附加到它所争议的确切主张上。
提到的第一个数字设定了每个人争论的范围。影响所在:谁先说出预算数字、估值或交付日期,就会影响后续的每一个估计。
证据:Tversky和Kahneman在1974年的实验中,对于同一数量的中位估计分别为25与45,在锚点为10和65的情况下。许多实验室1强有力地复制了锚定效应——但使用的是提供的锚点。随机数字的偶然锚定在许多实验室2中失败(d = 0.04,p = .09,N = 6,826)。所以:故意的锚点会影响人们;环境中的任意数字大多不会。
在Argumentree中:各方在讨论前独立提交立场,因此没有第一个数字可以作为锚点。锚点需要观众,而异步输入则消除了这一点。
通过一个例子在脑海中浮现的容易程度来判断某事的可能性。问题所在:上个季度的故障主导了风险登记,而没有人有故事可讲的缓慢、较大风险则未被列出。
证据:分裂,值得知道哪一半。著名的字母频率演示被 削弱 — Sedlmeier、Hertwig 和 Gigerenzer(1998)发现判断通常遵循实际比例。检索的容易性机制依然存在:Weingarten 和 Hutchinson 在2018年对263项研究的元分析发现中等效应,尽管出版偏差将其缩小了三分之一。
在 Argumentree 中:论点携带其证据,因此生动的轶事和基准率并排而坐,并分别进行评分 — 时间线显示每个论点何时进入讨论。
摩尔和希利在2008年发表的论文《心理学评论》中将其分为三类:高估你的分数、将自己与他人进行过度比较,以及过度精确——对你的估计过于自信。影响所在:交付范围过于狭窄,因此下游的每个计划都继承了虚假的精确性。
证据:过度精确是一个稳健的现象。索尔和克莱曼发现置信区间“有时仅为必要大小的40%以达到良好的校准。”高估和过度比较随着任务难度的变化而翻转——困难任务产生高估但低比较——而难易效应本身部分是回归伪影(贾斯林等,2000年)。
在Argumentree中:评分基于论点,而不是主张,因此自信的主张如果证据薄弱,其评分就像薄弱的证据一样。
低估自己完成时间的同时,现实地评估他人。影响所在:你曾设定的每一个迁移、整合和启动日期。
证据:在该领域表现强劲。Flyvbjerg及其同事(2002)研究了258个价值约900亿美元的交通项目,发现大约九成的成本被低估——铁路+45%,固定连接+34%,公路+20%。Buehler、Griffin和Ross(1994)是实验室的起源,值得注意的是,当参与者被迫将估计与过去经验联系起来时,偏见被消除。值得注意的警告:Halkjelsvik和Jørgensen在2012年的回顾发现,低估在工程和管理文献中占主导地位,但在心理学文献中并不如此。
在Argumentree中:估计成为附有证据的主张——包括参考类别——而不是在规划会议中声称的数字。
更倾向于当前的安排,并将“什么都不做”视为中立,而不是有后果的选择。影响所在:现任供应商续约,因为更换需要理由,而继续则不需要。
证据:在这里是最强的之一。Samuelson和Zeckhauser(1988)对486名受试者进行了研究,发现只有28%的TIAA-CREF参与者曾改变过他们的分配。Jachimowicz及其同事在2019年对58个数据集(n = 73,675)进行的默认效应的元分析报告d = 0.68 [0.53, 0.83],而Madrian和Shea发现401(k)参与率仅因默认更改从37%上升到86%。
在Argumentree中:“保持我们所拥有的”作为一个选项被列入,具有其自身的利弊,因此它在证据上竞争,而不是通过不在议程上而获胜。
相同的事实被描述为收益或损失会产生不同的选择。影响所在:“90%的成功率”和“10%的失败率”是相同的数字,但其影响却不同。
证据:方向明确,约为原始幅度的一半。许多实验室1复制了特维斯基和卡尼曼的亚洲疾病项目:原始d = 1.13 → 复制d = 0.62(N = 6,271)。许多实验室2复制了同一1981年论文中的一个不同项目——原始OR 4.96 → OR 2.06(N = 7,228)。这两个项目常常被混淆;它们是不同的研究。库赫伯格对136篇论文的元分析称框架效应是可靠的,且效应大小为小到中等。
在Argumentree中:决策标准在选项被框定之前就已写好,声明可以在两种框架中陈述一次并受到挑战,而不是依赖于呈现。
一旦你知道了结果,你会相信自己早就知道了。痛点:事后分析变成了寻找应该看到这一点的人,这教会了每个人下次要更安静。
证据:稳健,规模有争议。Fischhoff(1975)显示结果知识提高了判断的可能性,而人们在很大程度上对这种变化并不知情。元分析对规模存在分歧:Christensen-Szalanski和Willham(122项研究)报告r = .17;Guilbault及其同事(95项研究)报告中位数约为.39——并发现去偏见的操控大多无效。
在Argumentree中: 决策记录是有时间戳的,因此审查可以根据当时存在的证据来判断决策,而不是根据后来出现的结果。
通过性格解释行为,同时忽视情境。问题所在:项目失败是因为领导力不足——而不是因为流程给他们设定了一个由锚定决定的截止日期和一个经过共识批准的计划。
证据:在范式中是可靠的。Jones和Harris(1967)发现,即使论文立场是分配而非选择的,态度归因仍然存在。Many Labs 2成功复制了一项对应偏见研究——原始d = 1.75,复制d = 1.82,是该组中更为稳健的结果之一。跨文化上,它减弱而非消失。
在Argumentree中:论点被评估,人们则不然。这是整个设计原则,也是对这种偏见的直接结构性回答。
在当前决策中计算不可恢复的过去支出。影响所在:因为已经消耗的资源而辩护的项目。
证据:真实但适度,且这些措施受到质疑。Arkes 和 Blumer(1985)发现85%的人选择完成一架已知劣质的飞机。Sleesman 和同事的元分析将沉没成本的相关性定为ρ = .243——与个人责任相当,而不是更大。2025年的分析发现经典的沉没成本情境内部一致性差(ω = 0.14–0.57),因此对单一情境的发现要谨慎对待。还要注意,在 Arkes 和 Blumer 自己的剧院研究中,这种效应在赛季的前半部分存在,而在后半部分基本上消失。
在 Argumentree 中:当项目获得批准时,可以记录退出标准,因此审查时阅读的是文件,而不是重新审理同事的判断——请参见 承诺升级。
根据一个案例与刻板印象的匹配程度来判断,而忽略了该事物的实际普遍性。问题所在:“这个交易感觉像是我们赢的那些”——没有考虑胜率。
证据:作为演示非常有力,并且强烈依赖于格式,这是可操作的部分。Casscells及其同事(1978年)发现只有18%的医务人员给出了正确答案,而45%的人错误的程度接近五十倍;Manrai及其同事在36年后重复了这一实验,结果几乎相同(23%正确,44%给出了相同的错误答案)。但Gigerenzer和Hoffrage显示,当同样的问题以自然频率而非概率的形式提出时,正确回答的比例从大约16%上升到46–50%。
在Argumentree中:证据与其支持的主张相连,因此基准率作为论据存在,而不是由恰好知道它的任何人记住——或不记住。
声称能力最差的人最自信。问题所在:房间里最响亮的确定性属于最没有依据的人。
证据 — 这需要谨慎。描述性模式重复出现:低表现者确实高估了自己。解释在很大程度上并不成立。Nuhfer及其同事从随机数字中再现了经典图形;Gignac和Zajenkowski(2020年,N = 929)发现这种关系基本上是线性的,效果远小于报告的;McIntosh及其同事发现,当任务难度相等时,这种模式被消除——表现水平,而不是元认知缺陷,是驱动因素。公平地说,Pennycook和Jansen及其同事确实发现低表现者更难评估自己的答案。
诚实总结:人们高估了自己,但大部分著名图表是回归均值加上优于平均水平。不要将其引用为定律。
在Argumentree中:自信不是评分输入。评分附加在论据的证据上,因此确定性没有获得的分量。
这就是大多数企业偏见工作的错误所在,因为直观干预在文献中是最弱的。证据清晰地分开。
购买最多的干预措施却得到最少的支持。Pronin、Lin和Ross(2002)发现参与者“坚持认为他们的自我评估是准确和客观的,即使在阅读了可能受到相关偏见影响的描述后。”人们更容易在他人身上看到偏见,而不是在自己身上——这就是偏见盲点,而意识培训正好与之相撞。
Nemeth及其同事(2001)发现,指定的辩护者促进了“主要旨在增强初始观点的认知”的思考,并且真实的少数派优于所有三个角色扮演的变体。真实的异议无法通过指派某人来复制——尽管给予真正的异议者保护是一个不同且更好的做法。
在任何人听到其他人之前,单独收集书面意见。这是页面上最便宜的结构性修复,能够一步解决锚定、社会证明和权威顺从的问题——每一个都需要观众和发言顺序才能发挥作用。
这里证据最充分的项目。Grove及其同事对136项研究的荟萃分析发现,机械预测的准确性平均比临床判断高出约10%,而且这种优越性在“无论判断任务、评审类型、评审经验的多少或所结合的数据类型”上都是一致的。结合结构化评分优于以感觉结束的讨论。
积极地争论对方的观点胜过劝说人们要公平——Lord、Lepper和Preston(1984)发现,这种方法的效果优于尽量保持公正的指示,而Mussweiler及其同事通过列出反对锚点的论据,在一个与专家相关的真实环境中减少了锚定效应。从结构上看,这就是反方的本质。
与单纯的意识不同,实际的训练是有效的。Morewedge及其同事(2015)发现,单次干预产生的改善在两个月后仍然持续,而Sellier、Scopelliti和Morewedge(2019)则显示出转移到真实的专业环境——经过训练的参与者选择确认但劣质选项的可能性降低了19%。
针对规划谬误,预测应基于可比的已完成项目,而不是基于该项目的计划。英国财政部的《绿色书》指导明确要求:评估者“往往过于乐观”,因此调整“应基于过去或类似项目的数据。”
如果你的两个评审对同一提案的评分不同,那么无论如何消除偏见都无济于事——这就是噪音,它需要共享的标准和独立的评分,而不是更好的意图。直到有人故意将同一案例交给两个人评审,这种情况才会显现出来。
注意工作列表的形状:没有任何一项要求任何人更加客观。每个有效的项目都改变了事情发生的顺序、被记录下来的内容或被结合的内容——这正是结构化论证树的定义。Argumentree的贡献不是去偏见的研讨会;而是独立提交、附加于主张的证据、对论证而非论证者进行评分,以及带时间戳的记录,这四个结构性干预措施是证据实际支持的,默认运行而不是按学科进行。
在不确定性下,人们使用的心理捷径所产生的系统性、可预测的判断错误。其定义特征是它始终朝一个方向倾斜,而不是随机分散,这使得设计一个能够补偿这种错误的过程成为可能。特沃斯基和卡尼曼在1974年发表在《科学》上的论文确立了这一框架:启发式方法高度经济且通常有效,但它们会导致系统性和可预测的错误。
启发式是心理捷径本身,通常是适应性的。认知偏差是这种捷径产生的系统性错误。逻辑谬误是论证结构中的缺陷,而不是判断中的缺陷——虚假的二分法是一种谬误,而锚定效应是一种偏差。第四个术语,噪音,是变异性而非错误:对同一问题的判断之间的不良不一致性。
偏差是方向性错误——你的射击总是落在目标的左侧。噪声是散布——它们落在各处。卡尼曼、希博尼和桑斯坦在2021年的书中指出,组织在偏差上花费巨大,却忽视了噪声,而噪声通常更大且更容易修复。在他们的保险研究中,为同五个虚构客户独立设定的中位保费差异达55%,大约是承保人和高管预期的五倍。
本页上的十二个:确认偏误、锚定效应、可得性、过度自信和过度精确、计划谬误、现状偏见、框架效应、事后偏见、对应偏见、沉没成本、基准率忽视,以及邓宁-克鲁格效应。它们之所以占有一席之地,是因为每一个都映射到一个反复出现的组织失败——仅仅确认的候选名单、设定范围的第一个数字、没有人辩解的续约、寻找罪魁祸首的事后分析。
这个模式是真实的;流行的解释却不然。表现不佳者确实会高估自己,但著名图表中的大部分是由回归到均值和优于平均水平效应所产生的——Nuhfer及其同事通过随机数字生成了相同的图形,Gignac和Zajenkowski发现这种关系基本上是线性的,且效果要小得多,而McIntosh及其同事通过平衡任务难度消除了这种模式。将其视为一种描述性倾向,而不是一种元认知法则。
是的,任何诚实的参考页面都应该这样说。自我耗竭未能通过注册复制(23个实验室的d = 0.04)。口中含笔的面部反馈范式未能通过17个实验室的复制。社会启发和权力姿势都失败了。随机数字的偶然锚定在Many Labs 2中失败,而1998年的字母频率可用性演示也被削弱。更广泛地说,开放科学合作复制了100个心理学研究中的36%,而Many Labs 2复制了28个中的15个,效应大小的中位数从0.60降至0.15。
几乎是独立存在的——这是这里最重要的实际发现。Pronin、Lin 和 Ross 发现参与者坚持认为他们的自我评估是准确的,即使在阅读了影响他们的确切偏见的描述之后。包括实践和反馈的培训是不同的:它可以持续数月并转移到真实的专业环境中。但列出偏见的幻灯片演示接近于最弱的干预措施。
结构性变化而非动机性变化。在讨论之前独立收集判断,以便锚定和社会证明没有听众。机械地结合结构化评分——Grove对136项研究的元分析发现,机械预测比临床判断准确约10%。要求明确反方论点。使用参考类别而非新鲜的乐观进行预测。并保持带时间戳的记录,以便根据当时已知的信息来评判决策。
通过默认运行四项有证据支持的结构性干预措施。论点可以在讨论之前独立提交,这样就消除了锚定效应和观众的影响。每个主张都有其证据,因此基本数据和生动的轶事可以并排显示。评分附加在论点上,而不是个人身上,因此信心和资历不会影响他们未获得的权重。决策记录带有时间戳,因此后续审查可以根据当时可用的信息来评估过程,而不是根据结果。
卡尼曼,D.,& 特沃斯基,A.(1979)。前景理论:风险下决策的分析。《计量经济学》,47(2),263–291。
分配给收益和损失的价值,而不是最终资产;概率被决策权重所取代。
View source →卡尼曼,D.,西博尼,O.,& 桑斯坦,C. R. (2021)。噪音:人类判断中的缺陷。
噪声作为对同一问题判断中不希望出现的变异性——这是大多数偏见研究所忽略的区别。
Flyvbjerg, B., Holm, M. S., & Buhl, S. (2002). 低估公共工程项目的成本. 美国规划协会杂志.
258个项目,约900亿美元:成本在大约九成的情况下被低估。
Jachimowicz, J. M., Duncan, S., Weber, E. U., & Johnson, E. J. (2019). 默认何时以及为何影响决策:默认效应的元分析。行为公共政策。
d = 0.68 [0.53, 0.83] 在58个数据集中,n = 73,675。
Klein, R. A. 等 (2014)。调查可复制性中的变异:一个“多个实验室”的复制项目。《社会心理学》。
复制了亚洲疾病框架项目:原始 d = 1.13 → 复制 d = 0.62 (N = 6,271)。
View source →Klein, R. A., 等. (2018). 多实验室 2. 心理科学方法与实践进展, 1(4), 443–490.
28项发现中有15项得到了重复验证;中位数d从0.60降至0.15。偶然锚定失败(d = 0.04)。
View source →Hagger, M. S., 等. (2016). 自我耗竭效应的多实验室预注册复制研究. 心理科学的视角.
d = 0.04,95% CI [−0.07, 0.15] 在23个实验室中。
Gignac, G. E., & Zajenkowski, M. (2020). 达宁-克鲁格效应(主要)是一个统计伪影。智力, 80, 101449。
基本上是线性关系;效果远小于报告的。
View source →Pronin, E., Lin, D. Y., & Ross, L. (2002). 偏见盲点. 人格与社会心理学公报, 28(3), 369–381.
即使在阅读了相关偏见的描述后,自我评估仍然受到辩护。
View source →Grove, W. M., Zald, D. H., Lebow, B. S., Snitz, B. E., & Nelson, C. (2000). 临床预测与机械预测:一项元分析。心理评估, 12(1), 19–30。
136项研究;机械预测的准确性大约高出10%,在任务和评判类型上始终如一。
View source →Sellier, A.-L., Scopelliti, I., & Morewedge, C. K. (2019). 去偏见训练改善了现场决策。心理科学。
经过训练的参与者选择确认但劣质选项的可能性降低了19%。
View source →Nemeth, C., Brown, K., & Rogers, J. (2001). 魔鬼代言人与真实异议。欧洲社会心理学杂志。
指定的辩护增强了最初的观点;真实的异议击败了所有三个变体。
View source →独立提交讨论前的证据,附加在每个主张上,基于论点而非作者的评分,以及带时间戳的记录——这四项结构性干预措施得到证据的支持,默认运行。
免费开始 — 无需信用卡