議論を読む機械の教育:注釈付きコーパスの10年 | Argumentree
議論マイニングは、測定可能な計算タスクになる前に数十年にわたって理論として存在していました。それを変えたのはアノテーションでした。人々が何千もの文書に向き合い、手作業でどの部分が主張で、どれが前提で、どれがどの主張を支持または攻撃しているのかをマークしました。クリスチャン・スタブとイリーナ・グレヴィチは、この方法で説得力のあるエッセイにアノテーションを行い、通常AAECと呼ばれるコーパスを作成しました。アンドレアス・ペルツスとマンフレッド・ステーデは、議論の構造を研究するために特に短い議論的マイクロテキストのコーパスを構築しました。ジュンスク・パクとクレア・カーディは、米国のルールメイキングに提出された公的コメントにアノテーションを行い、はるかに混沌としたジャンルを扱いました。困難だったのはラベリングの労力だけではなく、人間のアノテーターが議論とは何かについて意見が一致しないことでした。人間が合意できないタスクは信頼性のあるスコアを付けることができません。したがって、アノテーター間の合意はこの分野全体のゲートキーパーとなりました。それは機械のパフォーマンスの実際の上限を定義します。なぜなら、モデルはそれが評価されるアノテーションよりも一貫性があるとは測定できないからです。コーパスはまた、この分野の永続的な非対称性を明らかにしました。議論の構成要素を特定することは扱いやすいことが証明されましたが、それらの間の関係を特定することはそうではありませんでした。
機械に議論を見つける方法を教えることはできません。人間が何が議論であるかに合意できるまで。それが難しい部分であり、その後の分野のすべての測定に影響を与えました。
- 議論マイニングは、人々が数千の文書—主張、前提、およびそれらの間のリンク—に手動で注釈を付けたときに初めて実際の分野となりました。
- アノテーターは、特に関係について意見が一致しません。アノテーター間の合意は、モデルのスコアリングの上限を制限するため、ゲートキーパーとなりました。
- この10年を形作ったのは、説得力のあるエッセイ、議論のあるマイクロテキスト、そして公的なルール作成に関するコメントの3つのコーパスです — クリーンからメッシーまで。
- すべてのコーパスはジャンルです。学生のエッセイで訓練されたモデルは会議のトランスクリプトには適用できず、長い間、誰も会議のトランスクリプトコーパスを持っていませんでした。
- コーパスは永続的な非対称性を明らかにしました:コンポーネントを見つけることは扱いやすいが、関係を見つけることはそうではありません。
二人の専門家、一つの段落、二つの異なる答え
同じ学生のエッセイの段落を2人の訓練を受けた注釈者に与え、簡単な質問をします:どの文が主張で、どの文がその理由ですか?彼らはしばしば意見が異なります。トピックについてではなく、議論が良いかどうかについてでもなく、どこにあるかについてです。
これは計算論争マイニングの最初の10年間を形作った事実であり、過小評価するのは簡単です。すべての下流はこれに依存しています:人々が一貫して実行できないタスクのベンチマークを構築することはできず、人間が共有しない判断においてモデルが人間のパフォーマンスを上回ると主張することはできません。
最後のメールスレッドで自分で試してみてください。主張をマークするのは通常簡単です。どの文に対して各反論が向けられたのかをマークすることが、あなたがためらい始めるところです — そのためらいがこの10年の全ての物語です。
なぜその理論は20年間使われなかったのか
1990年代初頭までに理論的枠組みは完成していた。トゥールミンはこの分野にその解剖学を与え、ウォルトンは推論パターンのカタログを提供し、フリーマンは結論を攻撃することとそれに対する推論を攻撃することの区別を示した。このシリーズの最初の投稿で述べたように、議論はラベル付きグラフとして再定義された。
ラベル付きグラフは、原則としてコンピュータがスコアを付けられるものです。実際には、何かに対してスコアを付ける必要があります。注釈付きデータがなければ、異なる結果を主張する二つの研究グループはそれを解決する方法がなく、結果を比較できない分野は分野とは言えません。それはデモの集まりです。
したがって、議論マイニングを学問に変えた10年は、アルゴリズムの10年ではありませんでした。それはアノテーションガイドラインの10年でした。
タスクを定義した三つのコーパス
異なる研究グループが異なるジャンルを注釈付けし、ジャンルの選択は誰もが最初に予想していたよりも重要でした。
- 説得力のあるエッセイ (Stab & Gurevych). 主張、前提、およびそれらの間の支持/攻撃関係に注釈を付けた学生の論争的エッセイ。明確に議論しようとした人々による構造化された文章 — テキストが得られる中で最も好意的なものです。
- 議論的マイクロテキスト(Peldszus & Stede)。 議論の構造を研究するために特別に構築された短い制御されたテキストであり、それぞれが意図的な形を持つコンパクトな議論です。小さく、クリーンで、構造的な質問に対する答えがあるように設計されています。
- 公的ルール作成に関するコメント(パーク&カーディ) 米国の規制に関する公的な相談に対して一般から提出されたコメント。実際の、編集されていない、しばしば長々とした内容 — 組織が実際に持っているテキストに非常に近い。
クリーンからメッシーへのその進行は、注目すべき有用な点です。リストを下に移動するにつれてパフォーマンスは低下し、特に関係において最も低下します。エッセイは友好的なケースでしたが、そこでも関係の数は控えめでした。
インターアノテーター合意が本当の限界です
注釈プロジェクトは、独立した注釈者がどれくらいの頻度で合意するかを報告し、議論マイニングにおいてその数は脚注ではありません。それは上限です。
もし同じガイドラインに従っている2人の訓練を受けた人間が、どの前提がどの主張に関連しているかについて中程度にしか合意しない場合、1人の人間に対してスコアを付けたモデルは、もう1人の人間に対して勝っていると意味的に説明することはできません。測定自体がモデルよりも先に不安定になります。
合意は関係よりも要素において一貫して高い — 人々はどの文が主張であるかについては主に一致し、何に応答しているのかについては意見が分かれます。その単一の非対称性は、後にベンチマークが示すすべてを予測しました。
自分のチームでアノテーションテストを実施してください。
決定に関するメールスレッドを取り、2人の同僚に別々に、最も強い反対意見を示し、それがどの具体的な理由に向けられていたのかを言うように頼んでください。もし彼らが異なる対象を選んだ場合、あなたの意見の不一致は事実に関するものではなかったということです — そして、要約ツールではそれを明らかにすることはできません。なぜなら、要約は言われたことを記録するものであり、何に向けられていたのかを記録するものではないからです。
ガイドラインは理論であり、実行可能にされたものです。
注釈ガイドラインは事務作業のように聞こえます。それは仕様に近いものです。理論が残したすべての曖昧さは、アノテーターが作業を始める前に解決されなければならず、各解決は実際のコミットメントです。
修辞的な質問は主張ですか?結論での再表現は新しい要素としてカウントされますか、それとも同じ要素ですか?1つの文が同時に2つの主張を支持する場合、それは両方に付随しますか、それとも近い方に、またはより一般的な方に付随しますか?誰かが反論する前にポイントを認める場合、その認めることは自分の立場への攻撃ですか?
これらのどれも明確な答えはなく、各コーパスはそれに対してわずかに異なる回答をしました。だからこそ、モデルはコーパス間でうまく転送されないのです。モデルは部分的にジャンルを学び、部分的にその質問に対する1つのチームの回答を学んでいるからです。
しかし、もっとデータに注釈を付けることはできませんか?
それは自然な反応であり、コンポーネント検出には広く機能しました。より多くの注釈付きスパンがより良いスパン検出を生み出しました。その分野のその部分は着実に予測可能に改善されました。
関係についてはそうではなく、その理由は量の問題ではなく構造的なものです。関係は文の外の文脈に依存しており、一貫して注釈を付けるのは高コストです。意見の不一致の関係は稀であるため、コーパスを拡張すると不均衡も一緒に拡大します。そして、接続のステップはしばしば明示されていないため、注釈者はテキストに見えるものをマークしているのではなく、それを再構築したものをマークしています。
より多くのデータは、問題を解決するのではなく、3つの問題を増幅させます。その議論は次の投稿の主題です。
10年間が残したもの
二つのもの、どちらもまだ荷重を支えています。
最初はタスク定義そのものです。現在、すべての議論マイニング論文が冒頭で示す四部構成 — コンポーネントを見つけ、ラベルを付け、リンクし、リンクを分類する — は、これらの注釈プロジェクトの産物であり、哲学の産物ではありません。トゥールミンはパイプラインを提案したことはありません。
第二の基準は設定されたベンチマークです。現代のシステムが数値を報告する際、それは通常、この10年に注釈が付けられたエッセイやマイクロテキストに基づいています。これは、論文間で数値を比較する際に覚えておく価値があります:異なるコーパス上の同じメトリック名は同じ測定ではなく、多くの公開された比較はそれを静かに無視しています。
実験室の外での意味
- 人間が議論の所在に合意できない場合、どんな道具も確実性を提供することはありません。 抽出された構造は受け入れるべき判決ではなく、修正すべき草案として扱ってください。
- ジャンルは量よりも重要です。 整理されたエッセイに調整されたシステムは、途切れや未完成の考えで満ちた会議の議事録という非常に異なる問題に直面します。
- 目標に関する意見の不一致が本当の信号です。 二人が異なるものに対して異議が向けられたと考えるとき、そのギャップが実際に決定が停滞している場所です。
- コーパス内でのみベンチマーク数値を比較してください。 異なるデータセットでの同じ指標は、ラベルがどれほど似ていても異なる測定値です。
議論の所在
注釈の10年は、この物語の中で最も華やかでない部分であり、他のすべてが依存している部分です。どんなに大きなモデルでも、スコアボードは時には互いに意見が異なる人々によって構築されたという事実から逃れることはできません。
自分の会議に持ち込むと役立つことです。書かれたガイドラインを持つ2人の訓練を受けた注釈者にとって議論を見つけるのが難しい場合、あなたのチームが決定を再度争っているという事実は、規律の問題ではありません。それはガイドラインなしの同じ問題です。
議論マイニングシリーズ
機械が議論を読む方法を学んだ5つの投稿 — この分野の起源、なぜその難しい問題が難しいのか、そしてどのようにそれを応用しているのか。
出典とさらなる参考文献
説得力のあるエッセイ注釈プロジェクトとそのガイドライン — タスクを測定可能にしたコーパス。
同じコーパスの完全な構文解析処理で、通常はそこから引用される構成要素と関係の結果が含まれています。
自動化された議論マイニングのためのフリーマンモデルの運用化 — 理論から注釈スキームへの架け橋。
CDCPの公的ルール作成コメントのコーパス — 実際の、混沌とした、そしてエッセイよりもはるかに難しい。
10年間を統合した調査 — タスク定義、コーパス、評価実践。
よくある質問
議論マイニングコーパスとは何ですか?
人々が手で論証構造をマークした文書のコレクション:どの範囲が主張で、どの範囲が前提で、どの前提がどの主張を支持または攻撃しているか。これは、競合するシステムを同一のデータで比較できるようにし、アイデアを研究分野に変えるものです。
AAECコーパスとは何ですか?
Argument Annotated Essays Corpusは、クリスチャン・スタブとイリーナ・グレヴィッチによって学生の説得力のあるエッセイから構築されました。これは、論証の構成要素とそれらの関係を注釈し、論証マイニングの標準的なベンチマークの一つとして残っています。
なぜインターアノテーターの合意がそれほど重要なのですか?
測定の上限を設定するからです。同じガイドラインに従う2人の訓練を受けた人間が、どの前提がどの主張に関連しているかについて意見が異なる場合、モデルがそのうちの1人に対してスコアを付けられても、もう1人に対して意味のある勝ちを示すことはできません。評価はモデルが不安定になる前に不安定になります。
なぜ、あるコーパスで訓練されたモデルは別のコーパスでパフォーマンスが悪くなるのか?
各コーパスはジャンルと一連のガイドラインの決定から成り立っています。学生のエッセイは構造的で意図的ですが、公共のコメントはだらだらとしています。モデルは部分的にジャンルを学び、部分的に曖昧なケースに対する1つのアノテーションチームの回答を学びますが、どちらもクリーンに移行することはありません。
関係検出を修正するために、もう少しデータに注釈を付けてもらえますか?
コンポーネントの検出にはかなり役立ちましたが、関係の検出にはあまり役立ちませんでした。関係は文を超えた文脈に依存し、意見の不一致の関係は稀であるため、コーパスを拡大すると不均衡も拡大します。また、接続のステップはしばしば明示されていないため、アノテーターは目に見えるものではなく再構築をマークしています。
今日、どのコーパスがベンチマークとして使用されていますか?
説得的エッセイと論証的マイクロテキストは最も一般的であり、より難しい評価には公共コメントコーパスが使用されます。それぞれが異なるアノテーションの決定を使用するため、2つのコーパス間で同じメトリック名が使われていても、同じ測定ではありません。これは誤解を招く比較の頻繁な原因となります。
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
注釈ステップをスキップする
トランスクリプトを貼り付けて、修正可能な構造化された賛否ツリーを取得します — 草案は自動ですが、判断はあなたのものです。
