Argument Mining

How Argumentree Turns a Transcript Into an Argument Tree

AT
Argumentree Team
Decision Science
July 29, 2026
9 min 阅读
How Argumentree Turns a Transcript Into an Argument Tree

Argumentree如何将文字记录转化为论证树 | Argumentree

Argumentree使用论点挖掘将非结构化的转录文本或文档转换为支持和反对的论点树。提取过程有四个步骤:找到包含主张或理由的文本范围,标记每个文本的类型,确定哪个理由与哪个主张相关联,并决定每个链接是支持还是攻击其上方的内容。两个设计选择影响输出。首先,论点被分组为单词类别,如成本、风险、时间线或法律,并且每个类别中恰好有一个论点被提升为该类别的主要主张。其次,主要主张不是由模型自身的置信度分数选择的。置信度衡量提取的确定性,而不是论点的中心性,已知口头化的LLM置信度校准不佳。相反,主要主张是从多个信号中同时选择的,其中最强的信号是中心性——有多少其他论点与之相关联——以及抽象性,因为主要主张是一个一般立场,而其支持证据是具体的。包含百分比、货币数字或命名研究的论点被视为主张的证据,而不是主张本身。每个提取的论点必须逐字引用来源;在树形结构显示之前,任何无法在原始文本中找到的内容都会被删除。输出是供人们纠正、重新归类和评分的草稿,而不是最终裁决。

Share:
简而言之

提取是简单的一半。困难的一半是结构——决定什么是主要观点,什么仅仅是证据,什么实际上是反对的论据。

  • 论点被分为单词类别 — 成本、风险、时间表、法律 — 每个类别中恰好有一个成为该类别的主要主张。
  • 主要的主张并不是模型最有信心的那个。置信度衡量的是提取的确定性,而不是重要性。
  • 主要主张是一般性的;证据是具体的。带有百分比或命名研究的论点被视为对主张的支持,而不是主张本身。
  • 每个论点必须逐字引用来源。任何在原文中找不到的内容在你看到之前都会被删除。
  • 结果是一个草稿。人们进行修正、重新组织和评分——机器构建结构,群体保持判断。

最自信的答案是错误的

将一个九十分钟的预算会议输入到提取引擎中,并询问哪个论点最重要,它通常会给你一个统计数据。类似于"财务模型预测运营支出减少20%"——准确、证据充分,模型对此非常确定。

这也是错误的答案。那句话不是论点。它是一个论点的证据,这个论点是在四十分钟前提出的,措辞要宽松得多:我们应该合并这两个团队,因为这将节省资金。 模糊的句子是主张。精确的句子是支撑它的依据。

这个区别是将对话转化为结构的整个问题,值得在下次阅读自己的会议记录时牢记。看起来最值得引用的句子通常是那些做最少论证工作的句子。

提取必须正确处理的事项

论证挖掘——这一研究领域由约翰·劳伦斯和克里斯·里德在2019年进行的调查——通常分为四个任务,随着进展难度逐渐增加。

  • 找出争论的部分。 真实会议中的大多数句子都是后勤、问候或重述。只有一些句子包含主张或理由。
  • 标记每个部分是什么。 主张是一个立场。前提是其理由。证据是支持该理由的数据。同一句话在一个文档中可以是主张,在另一个文档中可以是前提。
  • 弄清楚什么与什么相对应。 一个理由与一个特定的主张相关;一个反对意见与一个特定的理由相关。这就是将列表转变为树的原因。
  • 决定支持还是攻击。 对于每个链接:这是否增强了它所附加的内容,还是削弱了它?

前两个问题在很大程度上已经解决。最后两个问题尚未解决,发布的基准测试清楚地显示了差距:在Christian Stab和Iryna Gurevych注释的说服性论文语料库中,组件检测的F1值约为73%,而关系检测的F1值接近48%。在Joonsuk Park和Claire Cardie构建的CDCP语料库中,关系检测的F1值降至大约34%。

有趣的设计决策不在于发现,而在于结构化——这就是类别发挥作用的地方。

为什么论点会被分类

真正的讨论并不是关于一件事。合并两个团队的决定同时涉及成本、士气、法律风险以及所需时间。这些是在同一个房间里进行的不同辩论,将它们压缩成一个列表会产生没人能读懂的东西。

因此,每个提取的论点都被标记为一个单词类别——成本、风险、时间线、法律、安全、范围。单词,故意如此。当类别变成短语时,同样的主题就会碎片化为近乎重复的内容:预算影响成本考虑财务风险是同一个辩论戴着三顶帽子,而树木分裂成本应为一的枝干。

约束是强制执行的,而不是请求的。类别被规范化为单一的标准形式,类别是分支顶部的一个属性——主主张下的所有内容都继承该主主张的类别。成本论点不会在风险类别中获得子项;如果子项确实与风险有关,它应该归属于风险主主张。

每个类别一个主要论点

在每个类别中,恰好有一个论点被提升为主要论点——即该类别中其他所有内容所支持或攻击的中心立场。该类别中的其他所有内容都直接或间接地成为它的子项。

这是整个过程中的唯一一个最重要的选择。做对了,这个分支就像一个论证:这里是关于成本的立场,这里有三个理由支持它,这里是对第二个理由的反对意见。做错了,你就会得到本文开头的颠倒——一个统计数据位于分支的顶部,而它本应支持的主张却悬挂在下面,仿佛只是一个细节。

显而易见的方法不起作用

直观的答案是推广模型最有信心的论点。这是失败的,原因值得理解。

置信度衡量提取结果是否确定找到了一个真实的论点。它并不衡量该论点在辩论中的中心性。一个措辞清晰、来源明确的统计数据是一个简单的、高置信度的提取。而一个模糊、含糊其辞的句子,恰好是实际的论点,则是一个困难的、低置信度的提取。按置信度排名系统地提升证据,降低主张。

在第一个问题之下还有第二个问题。Saurav Kadavath及其在Anthropic的同事们的研究发现,语言模型的口头信心比原始的标记概率更好地进行了校准——但随后的评估反复表明,它在绝对意义上仍然没有很好地校准。这是一个可用的信号,但不是一个可靠的排名。

实际决定主要主张的是什么

不是一个信号,而是多个信号的结合——其中最强的信号是结构性的,而不是语言性的。

  • 中心性。 还有多少其他论点与这个论点相关?几乎总是其他一切回应的主张是中心主张。这是最接近可靠信号的东西,因为它是论点在辩论中位置的属性,而不是其措辞。
  • 抽象性。 主要主张是一般性的;证据是具体的。这一点直接来自于图尔敏:在他1958年的论述中,主张是结论,而依据是其下的具体事实。
  • 争论性语言。 话语标记 — 因此关键问题是我认为 — 表明说话者是在陈述一个立场,而不是提供细节。
  • 简洁。 中心论点往往很简短。长句通常包含修饰成分,这正是支持材料的作用。
  • 位置。 一个微弱的信号,但是真实的:这些倾向于早期出现。

抽象性通过寻找具体性的指纹来衡量。一个百分比、一笔货币金额、一个量化的实体、一句引用短语、一个命名的机构——每一个都使得一个论点不太可能是主要主张,因为每一个都是依据的标志,而不是结论的标志。远程工作提高了生产力是一个主张。对500名工人的调查显示78%的满意度是当有人问你为什么时你所说的。

结合多个微弱信号胜过信任一个看似强大的信号——这也是一个拥有多元视角的团队优于一个自信个体的原因,这一模式在为什么多样性胜过能力中得到了探讨。

在你最后一次会议上自己试试这个

回顾你们团队做出的最后一个决定。你能否指出反对该决定的最有力的论据,并且能说出是谁提出的?如果你做不到,那不是记忆问题。这是一个结构问题:你的记录捕捉了所做的决定,但没有记录争论的内容,这正是提取所试图弥补的差距。

没有任何东西能在源中存活。

一个听起来合理但实际上从未提出的论点比缺失的论点更糟——它是对你团队所说内容的错误记录。因此,每个提取的论点都保留了其来源的确切措辞,任何在源文档中无法找到引用证据的论点在树状图展示给任何人之前都会被删除。

这并不光鲜亮丽,但它是使其余部分可用的部分。一个无法追溯到成绩单的树就是一个多了额外步骤的摘要。

但这不就是带有额外步骤的总结吗?

这是显而易见的反对意见,答案在于每个人扔掉了什么。

摘要是压缩的。它大致告诉你会议讨论了什么,如果做得好,还会告诉你做出了什么决定。它无法保留的是分歧的形状——即这个特定的反对意见是针对那个特定的理由提出的,得到了回应,而第二个反对意见则从未被提及。摘要恰恰失去了在八个月后重新审视决策时重要的部分,那时没有人能记得为什么明显的替代方案被拒绝。

这种区别还将论证挖掘与情感分析区分开来,后者测量的是态度而不是推理。一个句子可以以消极的方式表达,同时支持它所附加的观点——"时间压力增加了风险" 强化了项目风险的主张。按语气评分,你每次都会得出相反的结果。

输出是草稿,这正是重点。

提取出来的是一个提议:这是我们认为被争论的内容,这是我们认为它如何结合在一起。然后人们会纠正它——重新归类一个与错误主张相关的论点,拆分一个合并了两个观点的论点,提升一些评分错误的内容,并评估他们认为令人信服的东西。

这种划分是故意的。手工构建结构是一项繁琐的工作,阻止团队完全进行这项工作。判断一个论点是否有任何价值——证据是否成立,未表述的假设是否可接受——并不是繁琐的。这是真正的思考,并且它会留在团队中。

如果您正在阅读自己的会议记录,这意味着什么

  • 可引用的句子通常不是主张。 精确、来源可靠的句子通常是证据。它们所支持的主张往往更模糊,更容易被忽视。
  • 计算什么附着于什么。 每个人回应的要点是那个重要的要点,无论是谁最自信地说出来的。
  • 命名类别。 如果你无法说出一个决定涉及哪两个或三个主题,那么讨论就没有结构——它只是被转录了。
  • 寻找没有人回答的反对意见。 这是任何争论记录中最有用的内容,而扁平的总结首先会破坏这一点。

模糊的句子就是论点

这个统计数据从来不是重点。它是对某个关于已经提出的主张的问题的回答——大致上,早期,以及以那种从未记录在会议纪要中的句子形式。

构建讨论意味着将该句子放回它所属的分支顶部,下面是其证据,具体反对意见附在他们争议的理由上。这就是树的用途。这也是为什么最自信的答案往往是错误的原因。

论证挖掘系列

这篇文章介绍了我们如何应用论证挖掘。系列的其余部分涵盖了该领域的起源以及其难题为何如此困难。

常见问题解答

Argumentree如何将文字记录转换为论证树?

它应用了论证挖掘:找到包含主张或理由的文本范围,标记每个内容是什么,确定哪个理由与哪个主张相关,并决定每个链接是支持还是攻击其上方的观点。结果是一个正反树,供人们审查和修正。

什么是论证类别,为什么是单个词?

类别将讨论分成不同的辩论——成本、风险、时间表、法律。它们限制为单个词,因为短语长度的类别会造成碎片化:预算影响、成本考虑和财务风险是一个辩论戴着三顶帽子,而树分裂成本应为一个的分支。

每个类别一个主要论点是什么意思?

在每个类别中,恰好有一个论点被提升为中心主张,其他所有内容都附属于它。这使得一个分支可读为一个论证——一个立场、支持该立场的理由以及对这些理由的反对意见——而不是一个相关句子的平面列表。

为什么主要论点不只是置信度最高的那个?

因为信心衡量的是提取的确定性,而不是论点的中心性。用简洁的措辞表达的统计数据是一个简单且高信心的提取;而模糊的句子才是真正的论点,这个提取则比较困难。按信心排名系统性地提升了证据,降低了主张。

这与会议总结有什么不同?

摘要压缩并告诉你所涵盖的内容。它无法保留分歧的形状——即这个反对意见是针对那个理由提出的,它得到了回应,而另一个则没有。摘要正是失去了在后续重新审视决策时重要的部分。

是什么阻止人工智能发明没有人提出的论点?

每个提取的论点都保留了其来源的确切措辞,任何在源文档中无法找到引用证据的论点在树形结构显示之前会被移除。一个听起来合理但从未提出的论点比缺失的论点更糟。

我可以更改提取结果吗?

是的——这就是预期的工作流程。输出是一个草稿。人们会重新归类附加到错误主张的论点,拆分合并的观点,提升评分错误的内容,并对他们认为有说服力的内容进行评分。机器构建结构;小组保持判断。

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.

将您的下一个会议转变为争论树

构建推理,而不仅仅是记录——这样六个月后仍然可以看到没有人回答的异议。

开始免费

相关阅读