当大型语言模型遇上论证挖掘:改变了什么,没改变什么 | Argumentree
在其大部分历史中,计算论证挖掘需要为每个新领域提供手工标注的语料库。这个要求是该领域的约束条件:标注工作量大,指导方针存在争议,并且针对学生论文调优的系统在会议记录或公众评论中表现不佳。大型语言模型消除了这一约束。通用模型可以从提示中执行组件检测和关系分类,而无需特定领域的训练数据,已发布的评估发现,经过提示的通用模型在基于关系的论证挖掘中与微调的编码器基线相比具有竞争力,甚至在某些情况下表现更好。这改变了论证挖掘的用途:它可以用于普通的组织文本,而不仅仅是经过整理的研究语料库。它没有改变的是困难问题的结构。类别不平衡反映了人们的写作方式,而不是模型的训练方式。一个贡献是支持还是攻击取决于其父项,而不是其措辞。而且反对意见通常针对文本中未明确说明的担保。大型模型还引入了自身的新难题:口头表达的信心比原始的标记概率更好地校准,但作为排名信号仍然不可靠,因此模型的确定性不能用来决定哪个提取的论证最重要。
语料库的瓶颈消失了。结构性问题没有丝毫变化——而一个新的问题出现了,伪装成解决方案的样子。
- 论证挖掘过去需要每个领域都有手工标注的语料库。现在的通用模型不再需要,这使得它可以应用于普通的商业文本。
- 发布的评估发现,经过提示的通用模型在关系分类上与微调的编码器基线具有竞争力,有时甚至表现更好。
- 不平衡、上下文依赖和未明言的担保是语言和任务的特性,而不是模型规模的特性。
- 模型置信度比原始概率更好地进行了校准,但仍然不是一个可靠的排名信号——这是一种新陷阱,而不是新工具。
- 有帮助的是在确定标签之前,强迫将关系用语言表述出来。
定义该领域的约束简单地不再适用
二十年来,我们能在我们的数据上进行论证挖掘吗?的答案是另一个问题:你愿意先手动标注多少千份文档,谁来编写指导方针?
这不是一个技术细节。这是论证挖掘停留在研究实验室而情感分析在每个产品中都能发布的原因。注释要求使每个新领域成为一个项目而不是一个配置,正如本系列的第二篇文章所描述的,指导方针本身在专家之间也存在争议。
然后通用语言模型出现了,这个问题不再被提问。现在你可以将其指向一个在某个领域从未被注释过的会议记录,并获得一个可用的初步结果。如果你曾经想知道为什么这种能力突然出现在产品中而不是逐渐出现,那就是原因。
零样本是整个故事
具体的变化是去除了特定领域的监督。一个经过提示的模型具备一般的语言能力,可以在推理时的提示中被告知什么是主张,什么是前提。
关于基于关系的论证挖掘的已发布工作发现,通用模型通过少量提示在多个数据集上与微调的编码器基线竞争,甚至在某些情况下超越了它们。对于一个其整个评估体系建立在针对标注语料的监督训练之上的领域来说,这确实是一个真正的断裂。
随之而来的是三个实际后果。领域适应变成了提示切换,而不是重新训练。长文档变得可处理,因为上下文窗口增大了。证据字段可以携带解释,因为模型可以在同一次调用中被要求自我辩护——这实际上比听起来更重要。
三个没有变化的问题
在上一篇文章中提到的一切仍然适用,值得明确说明为什么规模并不能解决其中的任何问题。
- 类别不平衡是写作的特性,而不是训练的特性。 建立论点的人主要写支持性句子。一个阅读过整个互联网的模型也主要读到了赞同的内容。
- 上下文依赖是任务的一个特性。 支持和攻击是关系,而不是句子属性。相同的句子在不同的父节点下有不同的标签,而任何世界知识的变化都无法改变这一点。
- 未陈述的担保是文本的一个属性。 如果将证据与结论联系起来的原则从未被写下,那么它就不在输入中。更大的模型读取同样缺失的句子。
还有一个更微妙的第四种情况。流利的模型产生流利的输出,因此它的错误表现得措辞得当且内部一致。来自编码器的错误关系标签看起来像噪音。来自语言模型的错误关系标签看起来像一个论点。
新的陷阱:信任模型自身的确定性
因为这些模型可以报告它们的自信程度,所以使用这个数字是很有诱惑的——用来对提取的论点进行排名,决定哪些论点重要,以及控制展示的内容。
Saurav Kadavath及其同事的研究发现,口头自我评估的校准效果明显优于原始的标记概率。这个结果常常被引用为信任数字的依据。然而,随后的评估一直不那么令人鼓舞:比替代方案更好并不等同于可靠,而校准在你最需要的地方,尤其是困难和不寻常的案例中,正好会下降。
在实践中还隐藏着一个类别错误。置信度衡量模型对找到真实论点的确定性。它并不说明该论点是否对辩论是核心的。措辞清晰的统计数据是一个简单且高置信度的提取;而恰好是实际论点的模糊句子则是一个困难的提取。按置信度排名促进了证据,贬低了主张——这正是本系列最后一篇文章开头所提到的失败。
在你熟悉的成绩单上测试它
选择一个你记得清楚结果的会议,并问任何AI工具主要论点是什么。如果它给你的是最精确、证据最充分的句子,而不是实际上推动决策的松散句子,那么你刚刚目睹了信心代替重要性——你现在知道不要信任那个排名。
帮助:首先说明原因是什么
这些模型提供的最可靠的改进几乎简单得令人尴尬。先询问推理,再询问标签。
要求模型写出一个贡献对其父项的影响——这加强了上述反对意见,因为它提供了另一个理由说明该反对意见成立——在做出支持或攻击的裁决之前,书面步骤显著改善了裁决。书面步骤将父项关系强制纳入模型的工作上下文,这正是句子措辞未能提供的信息。
这是一个彻底人性化技术的机器版本。这就是钢铁人论证有效的原因:在判断一个论点之前,阐明它实际上在做什么,会改变判断。
那么论证挖掘解决了吗?
不,现在剩下的形状比以往任何时候都更清晰。
从实际角度来看,解决的问题是访问。任何组织今天都可以在自己的文本上进行论证挖掘,而无需注释程序,这在几年前是不可想象的。这是一个真正且重大的变化。
未解决的是结构:哪个贡献对应于哪个,以及方向是什么,当连接原则未说明且数据已训练每个人——人类和机器——期望一致时。诚实的立场是,提取现在在任何领域都能产生一个良好的草稿,而人仍然需要检查分歧。这比没有人建立结构的情况要好得多。
如何正确使用这个
- 不要按信心排名。 它衡量的是提取的确定性,而不是重要性,并且系统地促进证据而非主张。
- 询问关系,而不是情感。 有用的问题是这对其父母有什么影响——而不是它对这个话题的感受。
- 在给出之前使其证明标签的合理性。 书面的理由是将父母关系置于上下文中的关键所在,也是你发现错误的地方。
- 将您的审查时间花在分歧上。 这就是模型最薄弱的地方,也是决策价值集中的地方。
一个更好的草案,而不是裁决
阻碍论证挖掘停留在实验室的瓶颈已经消失,并且不会再回来。这一点需要清楚认识:这就是研究技术与可以在自己会议上指向的事物之间的区别。
但在1958年困难的问题现在仍然困难。令状仍然没有写成,分歧仍然很少,标签仍然取决于父母而不是措辞。改变的是谁可以拥有这个问题——对于一个花了二十年等待注释者的领域来说,这已经是足够的变化。
论证挖掘系列
五篇关于机器如何学习阅读论证的文章——这个领域的起源、为什么它的难题很难,以及我们如何应用它。
来源与进一步阅读
该领域的预LLM状态 — 作为衡量转变的基准非常有用。
口头自我评估胜过原始的标记概率——结果通常被过度解读为信任这个数字的许可。
与LLM方法进行比较的监督基准结果。
授权——这一未成文的步骤是规模所无法提供的,因为它缺失于文本而非模型。
常见问题
大型语言模型如何改变了论证挖掘?
他们取消了每个新领域需要手工注释语料库的要求。一个经过提示的通用模型可以在没有特定领域训练数据的情况下识别主张、前提和关系,这使得论证挖掘从一种研究技术转变为可以在普通组织文本中使用的工具。
LLM在论证挖掘方面是否优于微调模型?
在基于关系的论证挖掘方面,已发布的评估发现,通用模型在多个数据集上与微调的编码器基线相比具有竞争力,甚至在某些情况下表现更好。更大的实际优势在于,它们根本不需要针对新领域的标注训练数据。
LLMs没有解决哪些问题?
三个结构性的问题。类别不平衡反映了人们的写作方式,而不是模型的训练方式。支持与反对取决于父母,而不是措辞。而反对意见通常针对文本中缺失的未表述的理由,因此无论模型能力多强都无法提供它。
你能信任模型的置信度评分吗?
不是作为排名信号。口头表达的信心比原始的标记概率更为精准,但在绝对意义上仍然不可靠,并且它衡量的是提取的确定性而不是重要性——因此,基于它的排名系统性地促进了有充分证据的细节,而忽视了那些承载实际主张的松散句子。
什么实际上可以改善与大型语言模型的关系分类?
要求模型用语言表述一个贡献对其父项的作用,然后再决定支持或攻击标签。书面步骤将父关系强制纳入工作上下文,这正是句子自身措辞未能提供的信息。
论证挖掘现在是一个解决的问题了吗?
访问问题已解决——任何组织都可以在自己的文本上运行它,而无需注释程序。结构问题仍然存在。决定哪个贡献对应于哪个,以及方向是什么,仍然很困难,因此提取产生了一个良好的草稿,但仍然需要一个人来审查分歧。
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
您可以修改的草稿
提取生成结构;您审查分歧。粘贴一份记录,查看分工。
