
决策智能洞察力、结构化思维框架和最佳实践,适用于对决策非常严肃的组织。

在1785年,孔多塞通过数学证明,当观点得到适当汇总时,群体的表现优于个人。谷歌的阿里斯多德项目证实了这一点:心理安全感比团队成员的组成更能预测团队的有效性。以下是科学的结论——以及何时不应合作。

厌倦了那些人们在会议上空谈却没有实质内容的场合吗?了解如何通过会议前的论点准备、实时评分和完整的决策可追溯性,将浪费的会议时间转化为集中、高效的决策——这一切都基于关于会议浪费的已发布研究。

从18世纪的法国数学家到麻省理工学院人工智能实验室,群体智能的科学经历了六个时代的演变。以下是完整的历史。

研究表明,多元思维的团队表现优于高智商专家团队。这里是科学依据——以及为什么它比头条新闻所暗示的更为复杂。

在2018年,谷歌创造了一个新的职位名称:首席决策科学家。为什么?因为拥有数据并不等于善用数据。决策智能——由洛里恩·普拉特提出,由卡西·科齐尔科夫实施——弥合了洞察与影响之间的差距。以下是680亿美元市场背后的框架。

在2018年,杰夫·贝索斯揭示了他的决策哲学:“你获得报酬是为了做少量高质量的决策。”他归功于沃伦·巴菲特的方法。以下是完整的采访、10点规则,以及为什么“直觉决策”并不是你想的那样。

杰夫·贝索斯将他的决策哲学归功于沃伦·巴菲特。但巴菲特本人实际上是怎么说的呢?他的20个插槽打卡规则、泰德·威廉姆斯的甜蜜点类比、“接近懒惰的倦怠”,以及他为什么每天阅读500页。9000亿美元背后的真正哲学。

在最近的一次Lex Fridman对话中,埃隆·马斯克大声计算道:“一个好决策的边际价值在一个小时内很容易就能达到一亿美元。”贝索斯每天计算决策数量。巴菲特阅读500页以做准备。马斯克则为每小时定价。这就是为什么这个数字不是虚张声势——以及它对每个规模的每个组织意味着什么。

在皮克斯作为上市公司的十年期间,史蒂夫·乔布斯罢免了两名董事会成员——不是因为他们无能,而是因为他们从未与他意见相左。艾德·卡特穆尔的第一手叙述:分歧的领域、《玩具总动员2》重启、滚石机隐喻,以及为什么“现实扭曲场”的 caricature 错误地反映了乔布斯实际的决策方式。

弗朗西斯·高尔顿参加了一个乡村集市,原本想证明普通选民是无望的。然而,787个对一头牛的净重的猜测的中位数竟然在真实值的1%以内——比牛类专家的猜测还要准确。这是建立群体智慧的实验的完整故事:方法论、统计数据、注意事项,以及这对今天团队决策的意义。

1785年,一位法国数学家证明了如果每位选民正确的可能性大于错误的可能性,那么多数人几乎总是正确的。这个定理现在为集成AI提供了动力。

产生智慧的相同人群动态也可以产生疯狂。从郁金香狂热到推特暴徒,这里是集体失败的科学——以及如何防止它。

在2013年,沃伦·巴菲特在自己的年度会议上邀请了一位做空伯克希尔的卖空者上台——以最有力的方式反对他。这就是钢铁人辩论法。拉波波特的规则、模拟法庭、麦肯锡红队、真实的研究——以及使表演性的魔鬼辩护适得其反的陷阱。

贝索斯用六个字批准了他并不相信的节目:“我不同意,但我承诺”——并希望它能成功。麦肯锡的异议义务、桥水的可信度加权、亚马逊的六页文档:这三者共同拥有的五个结构要素,以及如何在下次会议中实施它们。

1958年,一位哲学家出版了一本关于推理的书,拒绝将其视为形式逻辑,并被告知他已经偏离了主题。六十年后,所有能够读取记录并告诉你争论内容的系统都使用了他的词汇。论证挖掘的弧线:图尔敏的担保,沃尔顿的关键问题,弗里曼的削弱,使其可测量的语料库,以及那一半从未变得更容易的部分。

给两个训练有素的注释者同一段文字,并询问哪一句是主张。他们常常意见不合——这一单一事实塑造了将论证挖掘从理论转变为可测量任务的十年。为什么注释者之间的一致性是真正的上限,为什么体裁比数量更重要,以及为什么更多的数据从未解决关系检测的问题。

分歧在注释数据中占少数——在某些语料库中不到十分之一的关系。因此,模型学习到猜测一致性通常是安全的,这正是你部署模型的原因的反面。有三个结构性原因使得攻击检测难以解决,以及为什么稀有类别是决策所依赖的。

二十年来,“我们能在我们的数据上进行论证挖掘吗?”的答案是另一个问题:你们首先会标注多少千份文档?大型语言模型使这个问题不再被提问。语料库瓶颈的崩溃实际上改变了什么,它又留下了什么,以及以解决方案的名义出现的新陷阱。

将预算会议输入提取引擎并询问哪个论点最重要,它会给你一个统计数据——这正是错误的。高层次地看我们如何应用论点挖掘:为什么讨论被归类为单词类别,为什么每个类别恰好一个论点成为主要主张,为什么模型自身的信心是选择错误的方式,以及为什么没有任何内容能幸存下来,除非是从你的来源中引用的。

逻辑并不是一次性发明的。在公元前6世纪到4世纪之间,印度、中国和希腊独立发展了复杂的结构化论证系统——后来,伊斯兰学者将希腊逻辑与本土辩论传统进行了综合。这就是《推理的根源》系列的核心:平行出现的重要性、每个传统的贡献,以及全球历史教会我们如何进行有效辩论的知识。

印度辩论理论古老、制度化,并且惊人地程序化:《Nyāya-sūtra》列出了22种输掉辩论的方式。五人三段论是为公共辩论而构建的,而非私人证明。Dignāga的理由之轮是一个九格矩阵,用于区分好的证据和坏的证据。佛教的prasaṅga、四难题和耆那教的七重资格构成了一个西方大体上未曾建立的工具包。

古代中国思想在没有正式三段论的情况下发展了论证。墨家学派精确地分析了辩论(辩)、类比和名称的正确应用,而这些在西方传统中大多缺乏。当希腊逻辑问“这是否成立?”时,墨家逻辑问“这个名称是否正确应用?”——这是一个不同的问题,使用了不同的工具。这就是为什么中国逻辑走上了不同的道路,以及它今天所提供的内容。

伊斯兰哲学不仅仅是保留了希腊逻辑——它将其与本土的神学和法律辩论传统相结合,创造出了新的东西。卡拉姆(神学)、基亚斯(法律类比)、贾达尔(辩证法),最终是ʿilm al-munāẓara(争论科学):为结构化辩论制定的正式规则,预示着现代论证协议。这就是传承亚里士多德并改造他的传统。

亚里士多德在西方传统中创立了逻辑的正式研究。他的《工具论》涵盖了范畴、三段论、证明、辩证法和谬误,成为了两千年来逻辑教育的基础。《修辞学》增加了三种诉求(伦理、情感、逻辑)。但亚里士多德实际上建立了什么,他之前有什么,以及他遗漏了什么?理解主导框架对于看到其局限性至关重要。

印度的五成员三段论、希腊的三成员三段论、墨子的类比论证、伊斯兰的qiyās以及佛教的四难题——五个文明发展出了五种不同的有效论证结构。对它们的比较揭示了亚里士多德逻辑的强大但不完整,以及全球论证史提供的推理工具比任何单一传统更为丰富。

超级碗历史上最糟糕的进攻战术可以说是一个好的决定——而这种混乱有一个名字。决策质量,斯坦福血统的框架由卡尔·斯佩茨勒正式化,通过六个要素在决策时进行评判:框架、替代方案、信息、价值观、推理、承诺。链条法则(质量 = 最弱环节)、由此产生的陷阱、15分钟的最弱环节检查,以及如何通过改善决策过程机械地提高决策质量。

在商业中使用最广泛的框架——SWOT——没有经过验证的发明者,这从来都不重要:框架之所以传播是因为它们是有用的容器。这个选择器根据决策情况对它们进行分类:战略定位(SWOT、PESTLE、五力模型、BCG)、资金(CBA、NPV、决策树、真实期权)、不确定性(情景规划、ERM)、执行(平衡计分卡、7S、PDCA)、群体思维(六顶思考帽、前景理论)和角色(RAPID)。还有那个主框架何时使用的表格——以及每个模板跳过的步骤。

在特维斯基和卡尼曼1981年的实验中,将生死选择从“拯救的生命”改为“失去的生命”使大多数人的选择发生了翻转——在一个框架中,72%的人选择了安全,而在另一个框架中,78%的人选择了冒险。结果相同,决策相反。翻转背后的理论,它在商业中的影响(加倍下注、处置效应、禀赋效应)、复制辩论的真实状态,以及捍卫你决策的框架翻转技巧。

在1994年,默克的首席财务官告诉《哈佛商业评论》,公司使用期权数学为其研究管道定价——因为一个药物项目是一系列继续权,而不是一次全有或全无的赌注。真实期权思维:你路线图中隐藏的六种期权类型,为什么不确定性在下行风险被限制时从敌人转变为资产,互联网泡沫破裂后对该方法的滥用使其声名受损,以及保持其诚实的杀死标准纪律。

大约四分之三的首席财务官使用净现值(NPV)和内部收益率(IRR)(Graham & Harvey, 2001)——这两个指标可能会从同一项目列表中选出相反的赢家。IRR的再投资幻想和规模盲点,NPV的隐性判断(折现率、终值、赞助商撰写的基准案例),为什么放弃折现现金流(DCF)是错误的教训,以及三假设审计如何在十五分钟内将任何模型转变为一个可争辩的案例。

一份记录和一份人工智能摘要捕捉了所说的内容——而不是达成的共识及其原因。从一份记录中提取的四个要点、二十年来关于会议发言研究的难点,以及如何通过人机协作的人工智能提取来建立记录,而不是另一个总结。

山姆·阿尔特曼将首席执行官的工作分为5%决定“什么”,和95%实现它——并且用他的话来说,OpenAI的运营没有超越优秀模型和好产品的总体规划。经过验证的2018年引用及其2025年续集,成为ChatGPT的Playground故事,四个使分工有效的实践,以及罗杰·马丁和明茨伯格的反对意见。

角色不是记录:RAPID、DACI 和 RACI 指定谁来决定——它们都没有保留决定的内容和原因。明确的操作方法:七字段决策记录、它所基于的 ADR 实践、使其有效的习惯,以及导致其失败的错误。

会议记录按会议组织;决策日志按决策组织——这种差异决定了您的组织一年后能回答哪些问题。会议记录真正胜出的地方,日志胜出的地方,以及如何在不重复记账的情况下同时管理两者。

一个行动项在工作完成时关闭;一个决策则会持续承载多年。团队仔细保存一次性工件,却失去了耐用的工件——任务级边界、为什么票据线程不是记录,以及那一行修复。

猪湾顾问并不愚蠢——而且十八个月后,同样的人做出了本世纪经过深思熟虑的最佳决策之一。五项结构性对策(领导最后发言、对指定的反对者进行真实的异议、红队、预先评估、记录异议),加上研究所真实支持的内容。

自我耗竭在23个实验室的复制中失败,而饥饿法官研究则存在一个活跃的方法论争议——这篇文章诚实地告诉你,然后展示团队为何仍然能修复工作:首先做出重大决策,将琐碎选择分批处理,并且在超时会议的最后五分钟内绝不做重大决定。

果酱研究使选择过载变得著名;一项包含50个实验的元分析发现平均效应接近于零;第二项元分析在四种条件下发现它是真实的——这些条件正好描述了你们团队的重要决策。诚实的研究弧线、一个正确归属的驴子,以及五个延迟修复方案。

共识询问你是否同意;同意询问你是否能反对它——而反对与关注的区别是使这种差异有效的机制。此外,框架所忽略的尴尬事实是:Sociocracy 3.0 和 Holacracy 对反对测试的定义不同,因此请将你的定义写下来。

只有20%的高管表示他们的组织在决策方面表现出色——而一半的高管花费三分之一的时间在决策上。差距在于过程,而不是智力:五个步骤——按可逆性排序、在选择之前框定、结构化讨论、按协议决策、记录和回顾——每个步骤都有其深入的链接。

Beanstalk 通过按编码运作的治理损失了 1.82 亿美元;Tornado Cash 被一个提案捕获;Compound 的鲸鱼投票以 51/49 通过——而经验记录表明,静默的失败成本更高。文档攻击所写的五大支柱,每个主张都有来源。

1978年的经济学诺贝尔奖颁给了证明教科书中理性决策者并不存在的那个人。三个约束、组织作为认知架构,以及2025年的研究显示大型语言模型(LLMs)也有其局限。

求职最大化者的收入高出20%,但对此感到更糟。如何故意满足:五步框架、37%的最佳停止规则,以及何时选择最大化的一道门/双道门测试。

1956年1月:一位经济学家告诉他的班级,他在圣诞节期间发明了一台思维机器。逻辑理论家,这个让伯特兰·罗素感到高兴的证明——以及深度学习是否证明西蒙错误的诚实评分。

著名的偏见故事大多讲错了:权威的诺基亚研究发现的是恐惧,而不是盲目。12种偏见、过程胜于分析的六项研究、真实的预先死亡数字——以及为什么不应该任命一个反对者。

带有可以大声说出的计数器的14种模式现场指南、谬误谬误陷阱、亚里士多德的原始目录——以及2025年发现的AI也会犯这些模式。

雅典因一个人要求人们证明他们所声称的知识而处决了他——这种方法超越了判决。六种问题类型、Netflix对异议的挖掘、芒格的反转,以及苏格拉底会议的两条规则。

2025年卸载警告——重度AI用户在批判性思维方面得分最低——以及反制方案:八种让你更好推理的工具,以论证映射及其约0.8标准差的提升为首。

在挑战者号发射前的晚上,反对发射的论点存在——但结构并不存在。五步过程、约0.8标准差的证据、三项著名决策重新解读为论证结构,以及何时不进行映射。

七个模型及其主要来源、证据状态——只有一个有测量的效应大小——以及关于为什么知道这个列表没有任何改变的诚实发现。来源的反列表文章。

在那次会议上没有发生任何需要大家同时在场的事情——这就是实际的抱怨,并且它有一个测试。四个问题,五种几乎总是失败的格式,为什么可通过电子邮件安排的会议仍然被安排,以及没人注意到的反向错误。

原则是正确的;格式存在问题。经过验证的贝索斯引用、阅读速度科学(238字每分钟,Brysbaert 2019)、可及性批评——以及如何在修复排除的同时保持严谨性。

1944年的静电复印,1980年的DOS交易,2000年代的云计算回购。十三个记录在案的解雇,背后的偏见,以及对商业历史上最昂贵模式的深入探讨。

被检查的数字(盖洛普,Panopto),那些在检查中不成立的著名数字,波兰尼的隐性知识理论——以及可扩展解决方案为何在决策时捕捉决策推理。

在贝索斯禁止使用PowerPoint的一年前,哥伦比亚号事故调查委员会指责了一张幻灯片。亚马逊、谷歌、桥水和麦肯锡的书面优先会议——真实的HBR数据,以及任何团队都可以运行的4步版本。

对抗、开场、论证、结论——将分歧转化为记录决策的务实辩证模型,保持公正的十条规则,以及谬论为何只是破坏规则。此外,2024年《科学》中的人工智能调解研究对结构化审议的看法。

公平过程研究自1997年以来就指出:当过程明显公正时,人们会承诺他们不同意的决定。实际上,建立认同感的因素包括:早期参与、透明的推理、展示意见被考虑的过程,以及将其操作化的六步序列。

决定书面决策的五步计划:带有背景的提案、一个窗口和一个指定的决策者、结构化的论点、明确的异议处理以及记录。此外,诚实的交易(异步决策每个决策较慢,但每个团队较快)以及哪些决策保持同步。

隐藏的个人资料(群体出现正确答案的可能性低八倍)、计算机媒介沟通的元分析,以及微软的61,182名员工网络研究——证据真正显示了什么,为什么距离会放大群体失败,以及GitLab在大规模运行的结构性解决方案。

一个被风险评分算法推翻的政府,一个非法的自动福利计划,一个因未监控的计算错误而导致的错误止赎。真实案例,三种失败在差距中,规则从布鲁塞尔到纽约的汇聚——以及结构性修复。

模型日志并不是决策。可辩护的AI辅助决策的五个领域——输入、AI输出、人类判断、理由、时间戳——每一个领域的重要性,以及欧盟AI法案将对2027年12月起最高风险系统的要求。

日志让您今天重新运行管道;追踪让您展示三月份发生的事情。包含真实日期的监管地图(包括数字综合法案)、决策追踪的四个支柱,以及如何在第三方模型上保持可证明性。

NBIM 每年已经发布超过 10,000 次会议的投票理由,而特拉华州自范·戈尔科姆以来就有评分董事会流程。增强 AI 的治理实际是什么样子,诚实的监管情况——包括取消的授权——以及董事会现在的五个举措。

五个实际上并不竞争的类别——会议助手、结构化决策平台、研究助手、决策矩阵和“让AI决定”的应用——根据人机协作、推理捕捉、可审计性和适配性进行评估。基于自动化偏见研究的标准。

调查提供给你数据,而不是决策。五步法——阅读、主题、权衡、决定、记录——加上关于你收集的输入为何不明显权衡的伪声音研究,实际上适得其反。

调查并没有错——它不够。五个替代类别在计数→听到→权衡的阶梯上公正评判,盖洛普参与度的背景,以及有效的模式:保持温度计,增加治疗。

螺纹板在结构上失败——没有形状、仅仅是满足指标的激励、重复堆积、被埋没的安静学生。替代方案进行了公平比较,最强的一个背后有论证映射证据(约0.7-0.8标准差的批判性思维提升)。

Vroom和Yetton在1973年展示了正确的决策风格是情境性的,而非个人性的:从专制到小组共识的五种风格,七个诊断问题,一个决策树——包括从泰诺召回到阿波罗13号的文献案例,以及该模型的诚实局限性。

博伊修斯传承了亚里士多德,阿贝拉尔将矛盾转化为方法,大学将辩论纳入课程,而义务论——这一没有希腊先例的一致性游戏——悄然成为了论文答辩。拉丁传统,500年至1662年。

Reddit的波士顿爆炸“调查”在大规模上证明了这一点:点赞衡量的是一致性、时机和从众,而不是论点质量。反对票的恐惧如何使沉默螺旋游戏化,为什么相同的物理规律在Slack和会议中运行,以及用评分论点而不是人会带来什么变化。

高尔顿的牛和2008年的泡沫使用了相同的统计工具,但结果却截然相反——因为群体智慧是条件的属性,而不是人群的属性。独立性、多样性、适当的聚合;平台如何破坏这三者;以及纳瓦哈斯发现小型结构化辩论胜过庞大人群。

每个公司都声称最佳创意获胜;几乎没有公司有机制使其成为现实。为什么非结构化评估会判断穿着创意的人(HiPPO效应),为什么匿名创意不足以解决问题,以及在挑战下生存的优点是什么样的工作机制。

Meta的新闻降权使得对新闻的反应在520万条帖子中减少了78%——这是排名如何制造信息现实的最清晰示范。受欢迎程度偏见、过滤气泡循环、为什么“只需忽略算法”失败,以及设计修复:将动量信号与质量信号分开。

希腊人使论证成为可见的结构;评论线程抹去了这一点。图尔敏1958年的解剖(主张、依据、担保、反驳)、范·赫尔德的证据表明论证映射在可测量上提升批判性思维、线程在结构上失败的原因——以及一种讨论格式,其中地图就是媒介。

在为生计而销售的行业中,三年的卧底工作产生了七个能够获得肯定回答的杠杆。它们也是会议在不评估论点的情况下达成一致的七种方式——与七个论点陷阱相对应,包含了失败的复制。

1976年的实验确定了原因:不是失败,而是签署的人。1986年世博会,166个样本的元分析,以及为什么“忽视沉没成本”能解决问题的一小部分。

议程控制是任何组织中管理最少的权力。什么能在启动的复制危机中存活,什么不能,以及在框架修复你之前修复框架的四个步骤。

社会证明和权威背后的两个实验,这次被正确引用——以及阿希发现的一个设计参数,它使效果崩溃:一个盟友。

笨手笨脚的人、侦探和走私者——加上选择性淘汰发现、11,000个网站的黑暗模式爬虫、DSA第25条和25亿美元的亚马逊和解。

涉及金钱的互惠关系:JAMA餐饮研究、像采购一样构建的AER实验、偏见盲点,以及为何披露可能适得其反。

内部偏袒是真实存在的(d=0.32),它是对内部人的温暖,而不是对外部人的敌意,而每个人所寻求的干预可能解决的问题比他们想象的要小。

这位哲学家列出了38种策略,用于在争论中获胜,无论真相如何——延伸、转移和针对个人作为最后手段——然后将手稿搁置。1831年的论文成为现代辩论不当行为指南的基础。

在1632年,哥白尼辩论以三位发言者之间为期四天的对话形式进行,几乎涵盖了当时所有可用的论点——塔楼、船桅、炮声、鸟类、金星的相位、缺失的恒星视差。每天的讨论中,包括了一个显然错误的潮汐论点,以及一个帮助将其作者送上审判的收尾论点。

目标与关键结果。Grove在1971年于英特尔建立了它们;批评者称它们是德鲁克的MBO(目标管理)在更好实施下的表现。证据来自目标设定理论,而反对目标的最强论文在同一卷中被其作者的对手反驳。存活下来的重新框架是:关键结果是你在任何人开始工作之前所达成的对“好”的定义的记录。

一项预注册的科学实验有5734名参与者,几乎没有人报告的对照组:仅仅阅读彼此意见的群体根本没有趋同(P = 0.64)。对相同意见进行结构化使他们的分数提高了八分。研究结果、局限性以及批评者的正确之处。