Deliberation

分享意见并没有改变任何事情:一项科学研究发现了关于结构化审议的内容

AT
Argumentree Team
Deliberation & Decision Science
September 2, 2026
12 min 阅读
分享意见并没有改变任何事情:一项科学研究发现了关于结构化审议的内容

结构化的深思熟虑真的会改变一个群体的想法吗?

一项于2024年10月在《科学》杂志上发表的预注册实验(Tessler et al., Science 386, eadq2852)直接测试了这一点,参与者为5734名英国人。一组参与者阅读了彼此在有争议问题上的书面意见;小组一致性完全没有变化(b = -0.005,P = 0.64)。而另一组参与者的意见被综合成一个候选小组声明,经过排名、批评和重写后,达成一致的比例提高了约八个百分点,从22.8%上升到38.6%。两种情况之间的差异具有统计学意义(P = 0.0058)。综合工作由作者称为哈贝马斯机器的人工智能系统执行,其声明在56%的情况下比受过培训、获得经济激励的人类调解者的声明更受欢迎。批评回合后产生的声明给予少数意见比其在小组中的比例更多的权重,而不是更少。作者明确指出了限制:参与者均为英国居民,小组仅包含五人,该系统无法进行事实核查或调解,探索性分析发现人类调解者也有类似的趋同,表明这一效果可能来自于调解的审议过程,而不是特定于人工智能。对于任何进行讨论的人来说,实际发现是,交换观点并不是产生一致的机制;而是对观点进行结构化,并进行明确反对的回合。

Share:
简而言之

在2024年10月,《科学》杂志发表了一项预注册实验,参与者有5734人,其中包括一个几乎没有人注意到的对照条件。一组参与者只是阅读彼此对有争议的政治问题的看法。他们的意见一致性没有任何变化。而那些将相同意见结构化为候选人小组声明、进行排名、批评和重写的群体,其一致性提高了八个百分点,几乎翻倍。自由的观点交流并不是产生共同立场的原因,结构才是。

  • 控制结果就是发现。 互相阅读意见使小组达成一致的程度变化为 b = -0.005 (P = 0.64)。结构化相同意见使其变化了 八个百分点 (在所有三个队列中 P < 0.001)。
  • 一致性从22.8%上升到38.6%,66.6%的参与者表示小组声明比他们自己原来的措辞更好地表达了他们的观点。
  • 批评回合是因果关系,而不是伪影。 在一个由245人组成的独立队列中,真正利用批评意见的重写版本优于那些秘密忽视批评意见的重写版本(P = 0.0039)。
  • 结构保护了少数派。 后批评声明将少数派观点的权重设定为0.36,而真实比例为0.29。这并不是多数规则。
  • 诚实的限制:仅限英国参与者,五人一组,不进行事实核查,人类调解员在他们赢得的回合中产生了类似的收敛。这个机制可能是由结构本身而不是人工智能来调解的。

五个陌生人被问了一个有争议的问题。国家健康服务是否应该私有化?投票年龄是否应该降到16岁?他们每个人都在私下里用自己的话诚实地写下了自己的立场,字数适中。然后,他们阅读了其他四个人的观点。在此之前和之后,他们的立场被测量。

没有任何变化。没有一点,没有朝错误的方向,没有微不足道的变化。群体一致性的测量变化为负0.005,p值为0.64,这在实验中可以说是接近于完全没有变化。

这是在2024年10月18日发表在《科学》上的一项研究中的对照条件。可比组在相同的问题和相同的时间内,书面意见被综合成候选组声明,进行排名、批评和重写,收敛了约八个百分点。达成一致的组的比例从22.8%上升到38.6%。这项研究通常被报道为一个关于人工智能击败人类调解者的故事。更有用的结果却没有得到任何头条新闻:交换观点并不会产生共同点。结构化观点才会。

让人们阅读彼此的意见使得小组达成一致的比例下降了0.5个百分点。
将这些相同的观点进行结构化,使其移动了八个位置。

Tessler 等人,《科学》386, eadq2852 (2024) — 意见暴露队列与主要任务队列

研究实际上做了什么

这篇论文是由Michael Henry Tessler、Michiel Bakker及谷歌DeepMind、牛津大学和哈佛大学的同事们撰写的,标题为人工智能可以帮助人类在民主审议中找到共同点。它报告了在2023年1月至8月之间进行的七个实验,共有5,734名英国参与者。样本大小、排除标准和主要分析在数据收集之前已注册,并且代码已公开发布。在这个领域,预注册、真实的对照条件、在Science上发表以及开放代码的结合是相当罕见的,值得明确指出。

参与者分成大约五人的小组,讨论了三个问题,时间大约为一个小时。每个问题的程序都是固定的。每个人首先私下写下自己的观点,字数在10到200字之间,平均约为65字。这些书面意见被传递到一个系统中,作者将其命名为哈贝马斯机器,以纪念这位哲学家,他认为在公平条件下,人们共同推理时会产生共识。该系统起草了几个候选声明,代表小组的共同立场。参与者对这些声明进行排名,获胜者通过一种每位参与者的投票权重相等的排名选择选举产生。获胜声明返回给小组,每个人私下写下对其的批评,系统根据这些批评生成修订草稿。参与者再次进行排名,最终在原始版本和修订版本之间进行选择。

有两个细节值得注意。参与者被告知这些陈述是机器生成的,因此没有涉及欺骗。而问题本身是故意有争议的,涵盖了移民、退休年龄、监狱人数、脱欧、气候目标和最低工资。这些并不是为了让达成一致而选择的热身话题。

程序执行的四件事

去掉机器学习后,该过程包含四个步骤。任何拥有共享文档和一定纪律的团队都可以使用这些步骤。

每个人在听到其他人之前都会先坚持自己的立场。

意见是私下书写的,使用完整的句子,并附有理由。没有人首先发言并主导房间,也没有人可以选择默默同意听起来最自信的人的观点。在任何社会压力作用之前,每个人实际想法的书面记录已经存在。

这些位置被合成到一个工件中,而不是堆叠在列表中。

这是对照组没有得到的步骤。他们收到了完全相同的信息,所有五个意见的完整内容,以一堆独立的文本形式呈现。治疗组则以一份草拟的声明形式接收这些信息,说明该小组的实际立场。相同的信息,不同的结构,只有两者中的一个产生了变化。

选择是一种具有相等权重的排名投票。

获胜的陈述是通过汇总每位参与者的排名来选择的,每人一票。没有人的偏好因为更响亮、更快速、更资深或更善于表达而更具分量。这部分描述起来非常简单,但在现场会议中始终难以做到。

有一个正式的反对回合,草案必须修改。

每位参与者私下对获胜声明进行了批评,这些批评被纳入了修订中。反对并不是一种干扰或社交风险;它是每个人都要执行的一个预定步骤。在三个小组中,68%、64%和66%的参与者更喜欢修订后的声明而不是原始声明。

为什么控制条件是重要的结果

对任何类似研究的合理反对意见是,人们之所以趋同,仅仅是因为他们最终听到了其他人所想的。作者预见到了这一点并进行了测试。另一个由372名参与者组成的75个小组进行了相同的练习,只是他们评估的是彼此的个人观点,而不是对草拟的群体声明进行评分。完全接触小组中的每一种观点,没有综合。

在这种情况下,群体协议没有变化(b = -0.005,t(230) = -0.46,P = 0.64),而两个条件之间的差异本身在统计上是显著的(P = 0.0058)。这是一个经过控制的、预注册的结果,发表在Science上,显示传播每个人的意见并不能使群体达成一致。这是文献中对评论线程的直接测试,评论线程未能通过该测试。

机制的另一半也经过了同样仔细的测试。修订后的陈述可能更受欢迎,仅仅是因为人们在投入更多努力后第二次看到它们。因此,作者进行了进一步的实验,招募了245名参与者,他们撰写了批评意见,然后被展示了是否实际采纳了这些意见的重写版本。真正基于批评意见的版本仍然获胜(P = 0.0039)。反对意见的回合确实发挥了作用。

结构并没有压平少数群体,而是放大了它。

对任何寻求共识的过程,显而易见的担忧是它变成了更有礼貌的多数统治。作者通过将每个观点和每个陈述嵌入向量空间,并在每个问题上沿着从同意到不同意的轴线定位它们,来测量这一点,而不是简单地断言。

在大约 77% 的回合 中,团队最初确实存在分歧。初始 的团队声明对少数意见的权重为 0.29,而真实的平均少数份额为 0.29,几乎是完全的比例代表。经过批评回合后,修订 的声明将其权重提高到 0.36。相对于其规模,少数群体的代表性过高,而且团队无论如何更倾向于这些修订后的声明。96% 的团队声明都在团队自身意见实际涵盖的范围内,因此系统并没有创造出没人持有的立场。

支持确实整体上向多数立场转变,作者也这样说。多数在29%到32%的回合中增长,而少数在20%到26%中增长。但当他们测试人们是否仅仅因为看到了倾向于多数的陈述而向多数移动时,他们发现没有任何关系(P = 0.37)。无论是什么促使人们变化,都是论点的内容,而不是反复接触它。

机器的初稿与大多数完全一致。
经过一轮反对,它过度代表了少数群体。

少数民族加权从0.29上升至0.36,而真实的少数民族份额为0.29

它击败了人类调解者,这一点最不重要。

头条结果是与人进行的面对面比较。在75个小组中,一名成员被指定为调解员,接受了撰写小组声明的培训,并为每个小组偏好的声明提供高达其基本工资50%的奖金。在这些回合中,机器的声明被偏好56%的时间,而人类的为44%,并且在支持度和质量上评分更高。一个由155名独立评审组成的单独小组认为它们更清晰、信息更丰富、逻辑性更强,并且不太可能夹带作者自己的观点。

这是一个传播的发现,也是最不值得依赖的发现。作者们在这里非常谨慎:他们称真正的机会不是超人类的调解,而是高效、公平和可扩展的审议。该系统在几秒钟内生成声明,而人类则需要几分钟。在一项探索性分析中,作者发现人类调解者在获胜的回合中也有类似的趋同,这表明这种效果可能来自于调解结构作为一个过程,而不是来自于AI的任何特定因素。如果这种解读是正确的,那么这项研究的价值就更大,而不是更小,因为这种好处对任何愿意采用该程序的团体都是可用的,无论是否有模型参与。

它使用了一个代表性样本进行复制,但并不适用于所有情况。

主要的参与者是通过众包平台便利招募的,这一点值得怀疑。因此,作者与抽签基金会合作,该基金会组织真实的公民大会,以招募200名参与者,这些参与者在年龄、性别认同、种族、社会经济地位和地区上进行了分层,以代表英国。他们在2023年4月和5月的三个每周一小时的会议中,就九个问题进行了讨论。支持程度和小组一致性增加的情况都得到了重复。

有趣的是它没有奏效的部分。在九个问题中,立场集中在五个上。支持减少监狱人口的比例从60%上升到75%,支持放宽庇护入境的比例从39%上升到51%。在脱欧问题上没有任何变化。关于普遍免费的儿童保育,意见则朝相反方向发展,反对意见从33%上升到41%。一个在每个问题上都能达成一致的过程,无论主题如何,都会是出现问题的证据。而这个过程则使固执的立场依然固执,这大致上是诚实审议应该做到的。

限制,明确说明

任何基于单一研究的主张都应包含该研究自身的警告,而这项研究确实存在一些真实的警告。作者自己列出了其中的大部分。

每个人都是英国人,讨论英国问题。

所有参与者都是英国居民,讨论英国政策。作者表示,他们没有特别理由认为这些发现是特定于英国的,但他们并没有进行测试。这里没有任何内容被证明在不同的政治文化中适用。

五个一组,而不是五十个

每组大约有五个人。作者认为该方法在原则上可以与更长上下文的模型扩展,但并未测试规模。小组结果并不自动适用于与一百名参与者的接触,验证合成是否忠实的问题在输入量增加时变得更加困难。

它无法进行事实核查、管理或让任何人保持在主题上。

在作者自己的话中,如果人类的观点是错误的或有害的,那么输出可能也是错误的或有害的。该系统合成它所接收到的信息。它对这些信息的真实性没有看法,并且研究的问题经过预先审查,以减少有害讨论的风险。

训练样本不具代表性

该模型是在众包参与者中进行调优的,其中65岁以上的人群代表性不足。组装复制针对的是评估样本,而不是系统学习偏好的数据。

它假设每个人都在真诚地争论。

该程序将每个书面立场视为表面价值。故意歪曲自己观点以使综合结果朝向偏好结果的人在任何地方都没有被建模,而在该程序下什么算作理性的战略行为仍然是一个开放的研究问题。

人工智能可能不是活性成分。

作者们自己的探索性分析发现,人类调解人在他们赢得的回合中表现出可比的收敛性。诚实的解读是,这项研究展示了结构化、调解的审议的价值,并表明一个模型可以有效且迅速地发挥调解作用。它并没有证明模型是成功的原因。

批评者的观点所在

这篇论文受到了审议民主学者的严厉批评,其中一些批评是有道理的。最尖锐的批评来自阿尔瓦罗·奥莱阿特和尼古拉斯·帕洛莫·埃尔南德斯,他们在《审议民主杂志》中指出,在这个程序中参与者实际上从未相互辩论。他们私下写作,然后对机器输出进行排名。没有反驳,没有人之间的理由交流,也没有一个人的论点直接改变另一个人的想法的时刻。他们称之为没有公民的审议,并指出这个名称的讽刺:哈贝马斯将达成一致视为真正话语的前提,而不是优化的目标。

贝丝·西蒙·诺维克提出了另一个异议:共识并不是治理的难点。群体更常常在问题是什么上达不成一致,而不是在该如何处理它上,而一台在明确问题上能够产生共识的机器并不能帮助解决模糊的问题。奈特第一修正案研究所的研究人员补充了监督问题,即一旦从千条意见中得出综合结论,就没有人能够验证它是否忠实地代表了这些意见。

我们认为第一个批评是最重要的,我们对此表示赞同。优化一个过程以达成一致并不等同于帮助人们共同推理,而一个通过绕过人类争论来产生共识的系统,已经去除了使审议本身有价值的东西。需要继续推进的发现不是让模型来写出你们小组的立场。它更狭窄且更持久:立场必须明确,结构胜过流通,正式的反对回合会改变结果。 无论合成是由模型、主持人还是小组本身完成,这些原则都适用。

周一该怎么处理这个

这四种机制都不需要人工智能,而且这四种都是大多数会议常常出错的地方。在讨论之前收集书面意见,而不是在讨论期间。 研究参与者每人写了大约65个字的理由,这大约需要五分钟的工作,是最便宜的单一改变。综合而不是传播。 转发每个人的评论正是导致没有任何进展的条件;必须有人起草出小组实际上共同持有的观点,并将其提交修正。通过平等权重排名来决定,而不是根据谁在最后还在发言。并且安排反对意见环节,使得表达不同意见成为每个人都要执行的任务,而不是某人必须承担的社交风险。

如果您进行在线讨论,控制结果值得特别关注,因为讨论板或评论线程就是控制条件。它传播意见而不进行任何综合。这是讨论板替代方案中提出的结构性案例,现在有一个预注册的实验作为支持。在如何构建辩论中,四阶段结构通过手动方式强制执行相同的步骤,而在同意与共识中涵盖了同意与仅仅不反对之间的区别。

这对Argumentree的意义和不意义是什么

我们应该对此保持准确,因为过度声明的诱惑显而易见。哈贝马斯机器并不是我们所构建的。它使用个性化奖励模型生成候选共识声明,该模型预测每个参与者将如何对每个草案进行排名,并通过模拟选举在它们之间进行选择。Argumentree 并不这样做,而这项研究并没有测试我们的产品。

它测试的是我们产品所建立的机制。在讨论达成共识之前,立场会被明确地写下来,并附上其理由。论点被结构化为一个共享的文档,而不是作为一堆帖子进行传播。反对意见是一种优先行动,有地方可以附加,而不是一种干扰。少数立场保持可见和可归属,而不是溶解为多数观点。这四点是研究所孤立出来的,也是结构化论证图默认具备的四点。不同之处在于我们的综合结果保持可检查:每个主张都有其作者、反对意见和支持,因此没有人需要信任他们无法核实的摘要,这正是批评者提出的监督问题。

测试

在你们下次讨论后,询问是否有人立场实际上发生了变化。如果每个人都阅读了所有内容而没有人改变立场,那么你们并没有进行深思熟虑的讨论。你们进行了控制条件。

值得记住的结果

去掉模型、公民大会以及关于人工智能是否应该参与政治过程的争论,剩下的只有一个数字。五个人,完全访问彼此在他们关心的问题上的书面推理,测量前后:P = 0.64。群体达成共识的最常见方式是将所有观点展示给每个人并让人们阅读,但现在经过对照测试后并未产生可测量的效果。

这个有效的条件并没有增加新的信息。每个参与者已经有了所有的观点。改变的是,这些观点被赋予了形状,以相等的权重进行排名,并经过一次正式的反对轮次。这是一个程序性的发现,而不是技术性的发现,任何愿意以不同方式进行讨论的人都可以获得这一点。

这个小组已经有了所有的论点。它缺少的是一个将这些论点组织起来的结构。

运行结构,而不是线程

Argumentree 为每个立场提供了一个明确的位置,为每个反对意见提供了一个附加的地方,并为每个少数意见提供了一个在讨论中得以保留的记录。

来源

常见问题

2024年关于人工智能介导的审议的科学研究实际上发现了什么?

研究发现,将小组的书面意见整理成候选小组声明,通过平等权重投票进行排名,进行批评和重写,使小组一致性提高了约八个百分点,而仅仅让同样的参与者阅读彼此的意见则没有任何变化(P = 0.64)。以这种方式产生的声明比由受过培训、获得经济激励的人类调解员撰写的声明更受欢迎,比例为56%。该研究涉及5734名英国参与者,并进行了预注册。

这项研究是否证明了人工智能在进行讨论方面比人类更优秀?

不,作者并没有声称这一点。AI在几秒钟内生成了陈述,而不是几分钟,且其偏好比例为56%对44%,但同一篇论文中的探索性分析发现人类调解者在他们赢得的回合中也有类似的趋同。最合理的解读是,调解结构是有效的,而模型可以胜任并快速地执行调解角色。该过程本身并不需要AI。

这个过程是否只是将大多数人的观点强加给每个人?

最初的团体声明将少数派立场的权重设定为0.29,而真实的少数派份额为0.29,批评后的声明将其权重设定为0.36,过度代表了少数派相对于其规模的比例。96%的声明落在团体实际持有的意见范围内。总体上,支持确实向多数派立场转移,但人们看到倾向于多数派的声明的频率与他们的变化程度之间没有关系(P = 0.37),因此仅仅是曝光并没有推动这一变化。

这项研究的主要局限性是什么?

参与者均为英国居民,讨论英国政策问题;小组仅包含约五人,因此没有在集会规模上进行测试;该系统无法进行事实核查、调解或保持讨论主题,作者指出,信息不足的输入会产生信息不足的输出;训练样本中65岁以上的人群代表性不足;而且该程序假设参与者真诚地表达他们的观点。作者还承认,人工智能可能不是关键因素,因为人类调解者在他们赢得的回合中产生了类似的趋同。

哈贝马斯机器是什么?

这是研究人员给他们的系统起的名字,源于尤尔根·哈贝马斯,他认为在公平条件下,人们共同推理时会达成一致。该系统结合了一个生成模型,该模型根据参与者的书面意见起草候选小组声明,以及一个个性化奖励模型,该模型预测每个参与者将如何对每个草案进行排名,然后通过模拟的平等权重选举选择一个赢家。它建立在经过微调的Chinchilla 70B模型之上,该模型在同一任务中优于提示的Gemini 1.5 Pro。

我如何在没有任何人工智能的情况下应用这个?

运行程序隔离的四个步骤。让每个人在讨论之前私下写下他们的立场和理由;大约65个字就足够了。让某人将这些内容综合成一个小组共同持有的单一草稿,而不是直接传播各自的意见,因为传播意见是导致无效的条件。通过平等权重的排名选择草稿,而不是根据谁最后发言。然后进行正式的回合,每个人写下一个反对意见,并根据这个反对意见修订草稿。

相关阅读