集体智能,正如Thomas Malone和Michael Bernstein在《集体智能手册》(麻省理工学院出版社,2015年)中定义的,是“以看似智能的方式集体行动的个体群体。”该领域从Condorcet陪审团定理(1785年)和Francis Galton的1906年牛称重实验延伸到现代实验室科学:Anita Williams Woolley及其同事(《科学》,2010年)发现了一个一般集体智能因子的证据——c因子——它解释了群体在任务中的表现方差约43%,并与社会敏感性、对话轮流的平等性以及群体中女性的比例相关性高于成员智商。c因子一直存在争议(Credé和Howardson,2017年),并得到了对22项研究和1,356个群体的元分析(Riedl等人,PNAS,2021年)的支持。《集体智能基因组》(Malone、Laubacher和Dellarocas,2010年)映射了智能群体的构建模块,涵盖了Who、Why、What和How。当前麻省理工学院集体智能中心的研究(2026年)专注于生成性人工智能与集体智能、超级智能设计和设计人类-人工智能团队;2024年的一项元分析(Vaccaro、Almaatouq和Malone,《自然人类行为》)发现,人类-人工智能组合并不自动优于单独的最佳表现——真正的协同需要故意设计任务分配和互动。当前的CCI系统包括超级智能创意者,它将大型语言模型包裹在结构化的创意问题解决支架中,以及一项2026年PNAS的竞赛,研究了超过180,000次自主人工智能对人工智能的谈判。在决策生命周期中——关注、框架、生成、调查、聚合、审议、分配、选择、实施、监控——集体智能研究主要关注聚合和审议阶段:群体如何汇聚分散的知识并共同推理。Argumentree通过独立的异步论证提交、平等参与结构、多维评分聚合成共识分数以及小组推理的完整审计跟踪来实现这些发现。

集体智能是群体——人类、机器或两者——以看似智能的方式行动的能力。这不是一个隐喻:研究已经测量、辩论并展示了如何为此设计。本指南涵盖了从康多塞(1785)到麻省理工学院的人类-人工智能团队研究(2026)的科学。
最后更新: 2026-07-18
群体可以被测量为聪明。Woolley等(《科学》,2010)发现了一个集体智能因子(c),它预测了群体在不同任务中的表现——这主要是由社会敏感性、平等轮流和过程驱动,而不是成员的智商。这个发现受到争论(Credé & Howardson,2017),但得到了1,356个群体的元分析的支持(Riedl等,PNAS,2021)。现代的前沿是人类-人工智能集体智能:麻省理工学院2024年的元分析显示,增加一个人类并不会自动改善人工智能系统——协同效应取决于任务分配和过程设计。Argumentree建立在这个教训上:结构化推理、聚合判断,让人类做决定。
标准的学术定义来自于Thomas Malone和Michael Bernstein的集体智能手册(麻省理工学院出版社,2015):集体智能是'群体以看似智能的方式共同行动的个体群体。' 这个定义故意很宽泛。它涵盖了市场设定价格、维基百科社区撰写百科全书、陪审团权衡证据、蚁群寻找食物的最短路径——而且,越来越多地,混合的人类和人工智能团队。
集体智能比群众智慧更广泛,后者关注的是许多独立判断的统计聚合。集体智能还包括真正的合作和审议——互动、争论并建立在彼此推理基础上的群体。它不同于群体智能,后者的协调是通过简单的地方规则而非审议产生的。它还与邻近领域研究的机制相关:投票系统聚合偏好,预测市场聚合概率信念,结构化审议聚合理由——三种不同的答案,解决如何将许多思想转化为一个决策的同一问题。
在决策生命周期内——关注、框架、生成、调查、聚合、审议、分配、选择、实施、监控——集体智能研究集中于聚合和审议阶段:分散的知识如何被汇聚,群体如何共同推理而不受信息级联和群体思维的病态影响。
该领域根植于启蒙时代的数学、统计学、经济学、生物学和计算机科学。贯穿其中的主题是:在适当的条件下,群体的表现优于其成员——而这些条件可以被设计出来。
康多塞侯爵证明,如果每位投票者的表现稍微好于随机,且独立投票,随着群体规模的增长,绝大多数正确的概率接近于确定——这是集体智能的基础数学结果。
弗朗西斯·高尔顿分析了1906年乡村博览会上787个对牛的穿衣重量的猜测。中位数猜测(1,207磅)在真实重量(1,198磅)内的1%之内——比牛专家更准确。发表于《自然》。
弗里德里希·哈耶克在《社会中的知识使用》(《美国经济评论》)中论证,市场通过价格聚合分散的地方知识——这是预测市场的理论基础。
詹姆斯·苏罗维基总结了群众智慧的四个条件(多样性、独立性、分散化、聚合)。同年,洪和佩奇在PNAS上发表了他们有争议的“多样性胜过能力”模型。
Woolley、Chabris、Pentland、Hashmi和Malone(《科学》)发现699名在小组中工作的人的普遍集体智能因子的证据——群体层面的个体智商的类比。
Malone、Laubacher和Dellarocas(麻省理工学院斯隆管理评论)对集体智能系统的构建模块——“基因”——进行了分类,围绕四个问题:谁、为什么、做什么和如何。
Malone和Bernstein的麻省理工学院出版社手册整合了该领域及其标准定义:群体以看似智能的方式共同行动的个体群体。
Thomas Malone的《超级智能》描述了五种持久的集体智能类型——等级制度、民主、市场、社区和生态系统——并询问计算机如何使每种类型更智能。
Riedl、Kim、Gupta、Malone和Woolley(PNAS)分析了22项研究,涵盖1,356个群体,发现所有群体中都有集体智能因子的证据,包括学生、军人、在线工作者和游戏玩家。
Vaccaro、Almaatouq和Malone的106项实验的元分析(《自然人类行为》,2024)发现,人类-人工智能组合的平均表现低于单独的人类或人工智能的最佳表现——协同效应必须被设计,而不是假设。
Burton和27位合著者(《自然人类行为》)绘制了大型语言模型如何增强集体智能——以及它们如何冒着同质化观点和制造虚假共识的风险。
麻省理工学院集体智能中心追求三个领域:生成性人工智能与集体智能、超级智能设计以及设计人类-人工智能团队——包括一项关于180,000多个人工智能对人工智能谈判的PNAS研究。
在2010年,Anita Williams Woolley及其同事提出了一个简单的问题,背后有一个世纪的个体心理学:就像一个一般因子(g)预测个体在许多认知任务中的表现一样,是否存在一个针对群体的普遍因子?他们测试了699名在两到五人小组中工作的人的广泛任务(《科学》,330,686–688)。答案是肯定的:一个单一的统计因子——c——解释了大约43%的群体在不同任务中的表现差异。
群体成员的平均智力和最高智力与c的相关性仅为微弱。雇佣最聪明的人并不一定能使群体变得聪明。
群体在“阅读眼睛中的思想”测试中的平均得分——从面部线索推断心理状态的能力——是c的一个重要预测因子(r = 0.26)。
成员对话贡献更平等的群体具有更高的c;发言轮次的方差与c呈负相关(r = -0.41)。由一两种声音主导的群体的集体智能较低。
在2010年的研究中,女性比例较高的群体在c上得分更高(r = 0.23)——这一效应作者在统计上与女性更高的平均社会敏感性相关,即与过程相关,而非人口统计学本身。
像大多数心理学中的重要发现一样,c因子经过了压力测试——读者有权了解证据的真实状态:
Credé和Howardson(《应用心理学杂志》)重新分析了六个样本,认为对单一一般群体因子的实证支持很弱——群体表现可能更好地用任务特定能力来描述,而不是一个c因子。
Woolley、Kim和Malone回应称,批评基于的评分程序和模拟假设与群体实际执行的任务不匹配。
Riedl、Kim、Gupta、Malone和Woolley(PNAS)聚合了22项研究,涵盖1,356个群体——学生、军人、在线工作者、游戏玩家——并发现所有群体中都有c因子的证据,协作过程和成员的社会敏感性是其最强的相关因素。
底线:一项大型元分析支持可测量的集体智能因子的存在,而其确切结构和普遍性仍在积极辩论中。没有争论的是实际教训:群体过程——谁被听到,如何结合判断——比成员的聪明更能预测群体表现。
实际上有两种集体智能,它们依赖于不同的燃料:
许多独立的估计,通过机械方式聚合——平均、投票、市场价格。这是加尔顿的公平以及自那以来的每一个预测市场。成功依赖于独立性和多样性;这个过程通常是一次性的。
人们相互影响以建立共同理解——讨论、审议、协作。这是维基百科,一个科学社区,一个设计团队。成功依赖于沟通质量和发言的安全性;工作是持续的。
这两种模式朝相反的方向拉扯:独立性有助于统计众包,但使互动众包陷入困境。一个从不交谈的团队可以很好地聚合,但无法创造新的东西;一个总是交谈的团队可以建立共同理解,同时悄悄破坏其判断所需的独立性。
结构化审议是试图同时获得两者。在Argumentree中,贡献和评分是独立提交的——统计模式——而它们所落入的论证树是一个共享的、不断发展的对象,供小组进行审议——互动模式。结构决定了每种模式何时适用,而不是让最响亮的模式获胜。
如果集体智能可以被测量,那么它可以被设计吗?Malone、Laubacher和Dellarocas(麻省理工学院斯隆管理评论,2010)对集体智能系统的重复构建模块——“基因”——进行了分类,围绕四个问题组织。任何系统,从维基百科到企业战略过程,都是这些基因的组合:
一个定义明确的等级制度分配任务,或者一个开放的群体自我选择。群体带来规模和多样性;等级制度带来问责和协调。
动机基因:金钱(支付、奖金)、爱(内在享受、社区)和荣耀(认可、声誉)。可持续的系统将激励与贡献对齐。
创造(生成新东西——设计、想法、论点)或决定(评估和选择替代方案)。大多数实际过程将两者结合在一起。
独立(贡献在没有互动的情况下聚合——竞赛、投票、平均)或依赖(协作,贡献相互建立)。选择决定了你继承哪些失败模式。
在超级智能(2018)中,Malone描述了人类社会不断重新发明的五种持久的集体智能形式——并认为关于人工智能的真正问题不是“它会取代我们吗?”而是“它如何使每个超级智能更聪明?”:
决策在权威链条上向上和向下委托。快速且负责任;易受顶部信息瓶颈的影响。
通过投票做出决策。合法且包容;投票如何聚合偏好本身就是一门深奥的科学(社会选择理论)。
通过价格和交易做出决策。出色的分散信念聚合者——预测市场背后的机制。
通过规范、声誉和非正式共识做出决策。推动开源和维基百科;缓慢但有韧性。
根本没有共享的决策机制——结果源于权力和生存。当没有其他超级智能被设计时的默认选择。
麻省理工学院CCI的超级智能设计方法将基因组转化为创造性问题解决实践。六个“步骤”系统地重新构建问题,以提出新的设计方案,适用于人类和计算机的群体:
退后一步,关注问题所处的更广泛的系统或目的。
将问题分解为可以重新设计的部分和过程。
询问其他领域——自然、其他行业、历史——如何解决结构上类似的问题。
询问一个不同的超级智能——市场、社区、民主——将如何处理现在由一个人或一个等级制度处理的任务。
询问解决方案需要哪些认知过程(感知、记忆、决策、学习),以及谁或什么应该执行每个过程。
询问技术——包括人工智能——可以在哪里执行、连接或增强这些过程。
麻省理工学院集体智能中心(CCI)由Thomas Malone创立,是该领域的旗舰实验室。其早期项目——气候合作实验室、CI设计实验室、测量集体智能、集体预测——现在已完成,成为遗产工作。截至2026年,CCI的研究分为三个领域:
使用人工智能增强人类创造力——包括像超级智能创意者和DesignAID这样的工具,支架人类-人工智能的创意生成。
设计人类与计算机的创新组合,基于基因组和六个设计步骤。
在人工智能团队中设计和分配任务——“人类与机器”的继任问题。通过新加坡-麻省理工学院M3S项目,CCI正在建立任务分配的系统科学:哪些子任务分配给人类,哪些分配给人工智能,谁负责监督和验证,以及人工智能作为工具、助手、同伴还是管理者的角色。
Supermind Ideator将大型语言模型包裹在创意问题解决的支架中(包括六个步骤)。在一项实验研究中,用户生成的创新想法显著多于单独使用ChatGPT或无辅助工作的人员;测试者使用该系统创造了超过10,000个想法(ACM集体智能会议,2024年)。
Vaccaro、Almaatouq和Malone对106个实验和370个效应大小的元分析(《自然人类行为》,2024年)发现,人类-人工智能组合的平均表现不如单独人类或人工智能的最佳表现——损失集中在决策任务中,收益集中在内容创作任务中。CCI现在区分强协同(组合优于单独人类和单独人工智能)与弱增强(优于单独人类但不优于人工智能)——并发现强协同需要故意设计的任务分配,而不仅仅是添加一个人类。
2026年PNAS的一项研究进行了一场国际竞赛,其中被提示的人工智能代理进行了超过180,000次谈判。经典的人类谈判科学得到了验证:温暖——积极、感激、提问——与达成交易和创造价值始终相关,而主导策略则预测僵局。
2026年MIT的一份工作论文(arXiv 2603.20619)将美国O*NET数据库中的大约20,000项工作活动重新组织成深层本体,并对其进行了13,275个人工智能应用的分类——发现前1.6%的活动占据了超过60%的人工智能市场价值。一个系统地推理人类-人工智能任务分配的工具。
AGI-Elo(NeurIPS 2025,arXiv 2505.12844),由包括Malone在内的CCI相关研究人员开发,像棋手一样对人工智能模型和个别测试案例进行评分——将模型的能力和任务的难度放在一个可比较的尺度上,这是人类-人工智能团队中原则性任务分配的前提。
大型语言模型正在成为集体智能的参与者,而不仅仅是工具。Burton和27位跨学科的合著者(《自然人类行为》,2024)绘制了双刃剑的后果:
大型语言模型可以翻译、总结和起草——让更多人能够参与集体过程,无论语言或写作技能如何。
大型语言模型可以综合大量文本——会议记录、开放式调查回应、公共咨询——这些以前让人类聚合者感到不堪重负。
人工智能可以提出反驳、聚类相似立场并结构化讨论——增强审议阶段而不是取代它。
如果许多人咨询相同的模型,他们的输出会趋同——侵蚀集体智能所依赖的观点多样性。
流畅的人工智能生成文本可以制造出不存在于实际人类之间的协议或多数意见的表象。
一个越来越通过少数模型过滤的信息环境,冒着使群体变得集体愚蠢而非聪明的相关错误风险。
设计的启示与Vaccaro的发现相呼应:当人工智能被分配到它显然擅长的子任务——转录、提取、翻译、总结——时,它改善集体智能,而判断、评估和决策本身则留给负责任的人类。这是人类-人工智能系统的前沿(自动化偏见、信任校准、有意义的人类控制),决策科学现在正在绘制。
Argumentree是一个协作决策平台,直接建立在这些发现之上。每个设计选择都与文献中的结果相对应:
参与者在自己的时间内添加论点,然后群体汇聚——保护聚合研究显示群体所需的独立性和多样性条件。
Woolley的研究将集体智能与平等轮流联系在一起。在论证树中没有底线:每个参与者的论点进入相同的结构,并以相同的方式进行权衡。
论点根据有用性、清晰性、准确性和完整性进行评分,评分聚合成共识分数——一个明确的聚合机制,因此集体判断是被测量而非假设的。
四步链条的问题、妥协和审查让参与者探讨和完善论点——在基因组术语中是依赖协作,但在保持推理可见的结构内。
人工智能提取将会议记录和文档转化为草拟的论证树——人工智能擅长的内容处理工作——而评估和决策则留给人类,与2024年人类-人工智能协同效应的证据一致。
完整的审计轨迹(草稿、开放、关闭生命周期与版本控制)保留了群体的推理,因此组织可以从自身的集体智能中学习,而不是在会议结束时失去它。
集体智能是群体——人、机器或两者——以看似智能的方式集体行动的能力(Malone & Bernstein,《集体智能手册》,2015年)。它涵盖了统计众包智慧、维基百科等协作生产、审议团队、聚合信念的市场以及现代人类-人工智能团队。
c因子是Woolley等人(《科学》,2010年)识别的一个一般集体智能因子:一个单一的统计因子,解释了群体在许多不同任务中的表现方差约43%,类似于个体的智商g因子。它与群体的社会敏感性和对话轮流的平等性相关性远高于与成员的个体智力。
它得到了支持,但存在争议。Credé和Howardson(2017年)认为单一一般因子的证据较弱,而Woolley及其同事在2018年发表了详细的回复。Riedl等人(PNAS,2021年)对22项研究和1,356个群体的元分析发现了跨多样化人群的c因子的证据。实际的结论是——群体过程比成员智商更好地预测表现——在争论中是稳健的。
众包智慧是一个更狭窄的现象:许多独立的判断,统计聚合,趋向于准确答案(如加尔顿1906年的牛实验)。集体智能是一个更广泛的领域:它包括众包智慧,但也包括真正的协作、审议、市场、社区和人类-人工智能团队——任何一个群体以智能的方式行动的系统。
群体智能是从许多简单代理遵循局部规则中产生的协调——蚂蚁群、鸟群、机器人群——没有审议和明确的推理。人类集体智能涉及交换和评估理由。它们共享深层原则(去中心化、地方知识、聚合),这就是为什么决策平台借鉴两者的原因。
超级智能,在Thomas Malone 2018年同名书中,是任何一群个体以看似智能的方式共同行动。Malone识别出五种反复出现的类型——等级制度、民主、市场、社区和生态系统——并认为计算机使超级智能更聪明,主要是通过使它们的新组合成为可能,而不是取代它们。
麻省理工学院集体智能中心(cci.mit.edu),成立于麻省理工学院斯隆管理学院,由Thomas Malone领导,研究如何组织人群——越来越多的是人类与人工智能——以比任何个体更智能地行动。其早期的众包时代项目(气候协作实验室和CoLabs,测量集体智能)现在是遗留工作;截至2026年,其研究分为三个领域:生成性人工智能与集体智能、超级智能设计和人类-人工智能团队设计,工具如超级智能创意者和DesignAID,以及与新加坡-麻省理工学院M3S项目一起,建立人类-人工智能任务分配的系统科学。
并不自动。2024年对106个实验的元分析(Vaccaro、Almaatouq和Malone,《自然人类行为》)发现,人类-人工智能组合的平均表现不如单独人类或人工智能的最佳表现,损失集中在决策任务中。组合在内容创作任务中帮助最大。有效的人类-人工智能集体智能需要故意分配子任务给最擅长的那一方。
证据指向过程设计:平等参与(结构化或异步输入而非开放讨论),在小组收敛之前保护独立判断,招募认知多样性和社会敏感性,使用明确的聚合机制,如评分或投票,并保留推理记录,以便小组可以学习。像Argumentree这样的工具默认构建这些机制。
Condorcet, M. de (1785). Essai sur l'application de l'analyse à la probabilité des décisions rendues à la pluralité des voix.
创始数学结果:独立的、优于随机的投票者的多数趋向于真相。
Hayek, F. A. (1945). The Use of Knowledge in Society. American Economic Review, 35(4), 519–530.
市场作为分散知识的聚合者。
Surowiecki, J. (2004). The Wisdom of Crowds. Doubleday.
四个条件:多样性、独立性、去中心化、聚合。
Woolley, A. W., Chabris, C. F., Pentland, A., Hashmi, N., & Malone, T. W. (2010). Evidence for a Collective Intelligence Factor in the Performance of Human Groups. Science, 330(6004), 686–688.
c因子:699人,2-5人的群体,一个因子解释了约43%的表现方差。
Malone, T. W., Laubacher, R., & Dellarocas, C. (2010). The Collective Intelligence Genome. MIT Sloan Management Review, 51(3), 21–31.
集体智能系统的Who/Why/What/How构建模块。
View source →Malone, T. W., & Bernstein, M. S. (Eds.) (2015). Handbook of Collective Intelligence. MIT Press.
该领域的标准参考和定义。
Credé, M., & Howardson, G. (2017). The structure of group task performance — A second look at "collective intelligence." Journal of Applied Psychology, 102(10).
对c因子普遍性的主要批评。
Malone, T. W. (2018). Superminds. Little, Brown.
五种超级智能类型以及计算机如何使它们更聪明。
Riedl, C., Kim, Y. J., Gupta, P., Malone, T. W., & Woolley, A. W. (2021). Quantifying collective intelligence in human groups. PNAS, 118(21).
元分析:22项研究,1,356个群体,跨人群的c因子证据。
Vaccaro, M., Almaatouq, A., & Malone, T. W. (2024). When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour, 8, 2293–2303.
106个实验:人类-人工智能组合并不自动优于单独的最佳表现。
View source →Burton, J. W., et al. (2024). How large language models can reshape collective intelligence. Nature Human Behaviour, 8, 1643–1655.
28位作者讨论LLM对集体智能的机会和风险。
View source →Advancing AI Negotiations: A Large-Scale Autonomous Negotiations Competition. PNAS (2026).
超过180,000次人工智能代理谈判;温暖在机器对机器中也能获胜。
View source →Cai, A., et al. (2026). Where can AI be used? Insights from a deep ontology of work activities. arXiv 2603.20619.
一个关于人类-人工智能任务分配的深层本体,涵盖约20,000项工作活动。
View source →MIT Center for Collective Intelligence. Research (2026).
当前的研究领域:生成性人工智能与集体智能、超级智能设计、设计人类-人工智能团队。
View source →MIT Center for Collective Intelligence. Supermind Design methodology.
六个设计步骤:放大、缩小、类比、分组、认知、技术化。
View source →Sun, S., et al. (2025). AGI-Elo: How Far Are We From Mastering A Task? NeurIPS 2025.
对人工智能模型和测试案例难度的联合Elo风格评分;CCI相关的共同作者包括Malone。
View source →集体智慧是一个设计问题:平等参与,保护独立判断,明确聚合,并保持推理。Argumentree将这些机制构建到每个决策中——AI处理繁琐的工作,而你的团队进行判断。
开始免费试用