トゥールミンからトランスフォーマーへ:アーギュメントマイニングがどのように技術になったか | アーギュメンツリー
議論マイニングは、主張、主張に対して与えられた理由、および各理由がそれに付随するものを支持するか攻撃するかを自動的に特定するAIの分野です。その基盤は計算的ではなく哲学的です。1958年、スティーブン・トゥールミンは『The Uses of Argument』を出版し、日常の議論が実際にどのように構築されるかを説明することで形式論理から脱却しました — 主張、根拠、保証、支持、修飾語、反論。形式論理学者たちはこれを大いに拒否しましたが、この本は修辞学やコミュニケーションの学者たちの間で受け入れられ、その語彙は今でもこの分野の語彙として使われています。ダグラス・ウォルトンは後に、日常的な推論の繰り返しパターンを議論スキームとしてカタログ化し、それぞれに失敗を明らかにする重要な質問を付けました。ジェームズ・フリーマンは、結論を攻撃することと、それに至る推論を攻撃することを区別しました。議論マイニングは、注釈付きコーパスが登場した2010年代にのみ、測定可能な計算タスクとなりました — クリスチャン・スタブとイリーナ・グレヴィチの説得力のあるエッセイ、アンドレアス・ペルツスとマンフレッド・ステーデの議論的マイクロテキスト。ニューラルモデルが続き、大規模言語モデルは各新しいドメインで手動注釈付きコーパスの要件を取り除きました。変わらないのは、どちらの半分が難しいかということです:主張を見つけることは大部分が解決されており、何が何に付随し、それが支持するのか攻撃するのかを決定することはそうではありません。
1958年に論理学者たちに却下された哲学書は、誰も50年後まで試みようとしなかった機械学習タスクの仕様であることが判明した。
- トールミンの1958年のモデル — 主張、根拠、保証 — は形式論理学者によって拒否されましたが、それでも議論マイニングの作業用語となりました。
- ウォルトンは人々が実際にどのように議論するかを分類し、各パターンにどこで破綻するかを示す重要な質問を付けました。
- この分野は2010年代に測定可能になり、注釈付きコーパスによって競合するシステムが同じテキストで比較できるようになりました。
- 大規模言語モデルはコーパスのボトルネックを解消しました — もはや各ドメインごとに何千もの手動注釈付き例を必要としません。
- 硬い半分は決して動かなかった。請求を見つけることはほぼ解決されているが、何が何を攻撃するかを決定することはそうではない。
キャリアを終わらせるはずだった本
スティーブン・トゥールミンが1958年にThe Uses of Argumentを出版したとき、専門の論理学者からの反応は敵対的でした。彼は形式論理についてではなく、推論についての本を書いたため、実質的に地図から外れたと言われました。トゥールミンは後に、同僚がそれを彼の反論理学の本と呼ぶようになったと語っています。
彼のキャリアは終わらなかった。彼がしたことは、まったく異なる聴衆を見つけることだった。修辞学とコミュニケーションの学部、特にアメリカでは、この本を取り上げてカリキュラムを構築した。なぜなら、トゥールミンは形式論理が決して行わなかったことを成し遂げたからだ。彼は、実際の人間が議論をする際に、議論がどのように見えるかを描写した。
60年余り後、もし機械に会議の議事録を読ませて何が議論されたかを教えてもらうと、トゥールミンの語彙を使って答えるでしょう。これがこのシリーズの物語であり、この投稿はその流れを示しています:論理学者に拒絶された哲学書が、機械学習のタスクの仕様となった経緯です。
トゥールミンが実際に変えたこと
形式論理は妥当性に関心を持っています:これらの前提が与えられた場合、この結論は導かれますか?それは素晴らしいツールですが、実際に人々が言うことのほとんどを説明していません。誰も三段論法で議論しません。
トールミンのアプローチは、異なる質問をすることでした — これは妥当かではなく、これはどのように構築されているかです。彼は実際の議論を6つの部分に分け、そのうちの3つが重要な役割を果たします:
- 主張 — 提示されている立場。実際に誰かに受け入れてもらおうとしていること。
- 根拠 — 支持するために提供される事実。証拠、データ、例。
- 根拠 — 根拠から主張への移行を許可する原則。ほとんど口に出して言われることはない。
令状が興味深いものであり、それが理由で議論のマイニングが面倒ではなく難しい理由です。その橋は構造的に不安定なので、閉鎖すべきですには隠れた前提が含まれています:不安定な構造は閉鎖されるべきであるということです。誰もその文を言いません。皆がそれを前提としています。テキストを読む機械は、テキストにはないステップを再構築しなければなりません。
他の三つの部分 — バッキング、クオリファイア、リバタル — は、ヘッジや例外を扱います。これらは一緒に、議論を連鎖ではなく構造として説明し、その構造的な見方が後に全体を計算可能にしたのです。
ウォルトンと議論を破る質問
トゥールミンがこの分野にその解剖学を与えたなら、ダグラス・ウォルトンはフィールドガイドを提供しました。1990年代と2000年代を通じて、ウォルトンは日常的な推論の繰り返されるパターン — 専門家の意見への訴え、類推からの議論、結果からの議論、兆候からの議論 — を議論のスキームとしてカタログ化しました。
カタログは便利です。強力なのは後半部分です:各スキームには重要な質問が付随しており、そのパターンがどこで失敗するかを明らかにする具体的な課題です。専門家の意見に訴えるためには:この人は実際にこの分野の専門家ですか?他の専門家は同意していますか?その主張は証拠と一致していますか?
これは、会議に出席している誰にとっても、この伝統の中で最も有用なことの一つであり、適用するのに費用はかかりません。誰かが権威から主張するとき、あなたは結論に反対する必要はありません。あなたは、そのパターン自体が求めている重要な質問をします。それは攻撃的ではなく、議論が求めていることです。
フリーマンとそれを計算可能にした区別
ジェームズ・フリーマンの1991年の論文は、機械にとって最も重要な要素を追加しました。彼は、人々が軽々しく不一致と呼ぶ二つの事柄の間に明確な線を引きました。
結論を攻撃することができます — それが間違っていると主張することです。あるいは推論を攻撃することもできます — 提示されたすべての事実を受け入れ、それらから結論が導かれることを否定するのです。あなたの研究には欠陥がありますとあなたの研究は問題ありませんが、あなたが考えていることを示していませんはまったく異なるアプローチであり、それらを一つとして扱うと、実際の対立におけるほとんどの情報を失ってしまいます。
フリーマンは、互いに連携して機能する前提と、それぞれが独立して存在する前提を分けました — 1つの脚を取り除くと崩れる議論と、単に弱くなる議論の違いです。これらの区別ができると、議論はもはや散文ではなくなります。それはラベル付きのグラフであり、ラベル付きのグラフはコンピュータがスコアを付けることができるものです。
それから20年間何も起こらなかった
理論は1990年代初頭には確立されていました。計算分野は2010年代まで到達せず、その理由は華やかではありませんでした:測定するものが何もなかったのです。
研究分野は、競合するアプローチが同じデータで比較できるときに研究分野となります。それには、誰かが何千もの文書に座って、手作業でどの部分が主張で、どれが前提で、どれがどれを支持または攻撃しているのかをマークする必要がありました。クリスチャン・スタブとイリーナ・グレヴィチは、説得力のあるエッセイのためにそれを行いました。アンドレアス・ペルツスとマンフレッド・ステーデは、構造を研究するために特に短い議論的テキストのコーパスを構築しました。
その作業は、このシリーズの次の投稿で適切にカバーされています。ここで重要なのは、それが明らかにした形です。システムをスコアリングできるようになると、どの部分が難しいかがわかります — そしてその答えは即座に得られ、実際には決して変わっていません。
次の会議で尋ねるべき質問
誰かが権威から議論するとき — コンサルタント、ベンチマーク、特定の研究名 — 結論に異議を唱えないでください。代わりにウォルトンの質問をしてください:これはこの特定の事柄における専門家ですか、そして他の専門家は同意していますか? 誰も確認していないことがどれほど多いかに注意してください。
請求を見つけるのは簡単です。それ以降は簡単ではありません。
公開されたベンチマークは一貫したストーリーを語っています。説得力のあるエッセイコーパスでは、論証要素の特定とラベリングが約73%のF1に達します。それらの要素がどのように関連しているか、つまり何が何に付随し、支持するのか攻撃するのかを決定することは、約48%にとどまります。Joonsuk ParkとClaire Cardieによって構築された公共コメントデータのCDCPコーパスでは、関係検出が約34%に低下します。
そのギャップはフィールドです。それは弱いモデルの産物ではなく、それ以来のすべてのアーキテクチャの変更を生き延びてきました。検出は着実に改善されましたが、関係はほとんど変わりませんでした。
理由は技術的なものではなく構造的なものであり、これはこのシリーズの第三の投稿の主題です:データにおける意見の不一致は稀であり、それは文が含まない文脈に依存し、接続的なステップは通常明示されていません — トールミンの保証は、60年後もなお欠けています。
しかし、これは単なる自然言語処理ではありませんか?
同じ機械を使用しているので、その異議は妥当です。違いは回収されるものにあります。
感情分析はテキストがどのように感じるかを尋ねます。要約はそれが何を言っているかを尋ねます。固有表現認識は誰が何を含んでいるかを尋ねます。これらの三つはすべて内容に関するものです。議論マイニングは構造について尋ねます — どの文がどの他の文に対して議論的な役割を果たしているのか、そしてその方向はどちらかを。
その区別には実用的な利点があります。文は否定的に表現されることができ、その文が付随する主張を支持します:タイムラインのプレッシャーはリスクを増加させるは、プロジェクトがリスクが高いという主張を強化します。トーンによってスコアリングするシステムは、毎回それを逆に解釈します。情報の議論マイニングが回収するものは言葉の中にはありません。それは言葉の間の関係にあります。
大規模モデルが変えたことと変えなかったこと
最新の章は、誰もが知っているものです。汎用言語モデルは、注釈付きコーパスで事前に訓練されることなく、議論マイニングタスクを実行できます。これにより、この分野がかつて抱えていた最大の実用的障壁、すなわち新しいドメインごとに何千もの手作業でラベル付けされた例が必要であるという問題が解消されました。
それは本物の不連続性であり、論争マイニングをキュレーションされたエッセイコーパスだけでなく、通常のビジネステキストで使用可能にしたものです。これは第4回の投稿で説明されています。
それがしなかったのはギャップを埋めることです。構造的な問題は依然として構造的です。インターネット全体を読み取ったモデルは、この反論がその理由に向けられたのか、それともその背後にある結論に向けられたのかを決定しなければならず、テキストはまだそれを示していません。
この60年があなた自身の主張について示唆すること
- その令状は、通常、意見の不一致が存在する場所です。 すべての事実に同意している二人がまだ意見が異なる場合、彼らは明示されていない原則について争っています。それを名付ければ、会話は短くなります。
- 推論を攻撃することは、事実を攻撃することとは同じではありません。 どちらをしているのかを声に出して決めることで、相手が間違ったことを防御するのを助けます。
- 権威へのすべての訴えには、それぞれのテスト質問が伴います。 ウォルトンはそれらを書き留めました。それを使用することは敵意ではなく、意図した通りに機能しているパターンです。
- 構造が生き残る。 6ヶ月後、誰もその言葉を覚えていない。彼らが必要とするのは、どの異議が提起され、誰かがそれに答えたかどうかである。
反論理の本
トールミンの批評家たちは一つの点で正しかった:Argumentの使い方は本当に形式論理についての本ではなかった。それは、利害が現実であり、前提が争われ、誰も三段論法に時間をかける余裕がないときに、人々がどのように推論するかについての本だった。
それはより難しい問題であり、より有用な問題であることが判明しました。今日、トランスクリプトを読み、何が主張され、どのような根拠で、何が反論されたのかを教えてくれるすべてのシステムは、彼の説明に基づいて動作しています。アンチロジックの本としては悪くありません。
議論マイニングシリーズ
機械が議論を読む方法を学んだ5つの投稿 — この分野の起源、なぜその難しい問題が難しいのか、そしてどのようにそれを応用しているのか。
出典とさらなる参考文献
主張/根拠/保証モデル — この用語は依然としてこの分野全体で使用されています。
反復的な推論パターンのカタログと、それぞれを検証するための批判的な質問。
結論を攻撃することと、それに対する推論を攻撃すること — 論証構造を計算可能にした区別。
計算分野の標準調査、そのタスク定義と未解決の問題。
議論マイニングを測定可能にした注釈付きコーパスであり、ここで引用されているコンポーネントおよび関係のF1数値の出所です。
CDCPコーパスでは、関係検出のF1スコアは約34%です。
よくある質問
議論マイニングとは何ですか?
議論マイニングは、通常のテキスト内の議論の構造を自動的に特定するAIの一分野です:どの文が主張を行い、どの文が理由を示し、各理由がそれに付随する主張を支持するか攻撃するかを判断します。出力は要約ではなく、構造化されたマップです。
誰が議論マイニングを創始しましたか?
単一の創始者はいません。理論的な基盤は、スティーブン・トゥールミンの1958年の論証構造モデルであり、ダグラス・ウォルトンの論証スキームとジェームズ・フリーマンの論証マクロ構造の説明によって拡張されています。計算の分野は、注釈付きコーパスが測定可能になった2010年代に形成されました。
トールミンの本はなぜ論争を呼んだのですか?
それは形式論理についてではなく、推論に関する本だったためです。トールミンは、妥当性は日常的な議論にとって間違った問いであり、代わりに構造を説明しました。専門の論理学者たちはそれを大部分拒否しましたが、修辞学やコミュニケーションの学者たちはそれを受け入れ、それに基づいてカリキュラムを構築しました。
トゥールミンモデルにおけるワラントとは何ですか?
根拠とは、あなたの土地からあなたの主張に移ることを許可する原則です。「橋が不安定なので、閉鎖すべきだ」という場合、根拠は不安定な構造物は閉鎖されるべきだということです。根拠はほとんど口に出して言われることはなく、まさにそのために自動的に議論を抽出することが難しいのです。
ウォルトンの論証スキームとは何ですか?
日常的な推論の繰り返しパターン — 専門家の意見への訴え、類推からの議論、結果からの議論 — それぞれがそのパターンが失敗する場所を明らかにする批判的な質問と組み合わされています。批判的な質問は実用的に役立つ半分であり、結論を単に否定することなく議論をテストする方法を提供します。
なぜ関係検出は主張を見つけるよりも難しいのですか?
関係は文脈に依存するため、文には含まれていない接続ステップは通常明示されず、注釈データにおいて意見の不一致は稀です。公開されたベンチマークでは、同じコーパスに対してコンポーネント検出が約73%のF1スコアであるのに対し、関係検出は約48%であり、より難しいものでは約34%です。
大規模言語モデルは議論マイニングを解決しましたか?
彼らは、すべての新しいドメインで手動注釈付きコーパスが必要という最大の実用的障壁を取り除きました。これにより、技術は通常のビジネステキストで使用可能になりました。しかし、構造的なギャップは埋められませんでした。何が何に付随し、どの方向に進むのかを決定することは依然として難しい部分です。
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
理論の適用を見る
トランスクリプトを貼り付けて、構造化された賛否ツリーを取得します — 主張、その理由、そしてそれに反対するもの。
