Argumentreeがトランスクリプトをアーギュメントツリーに変える方法 | Argumentree
Argumentreeは、議論マイニングを使用して、非構造化されたトランスクリプトや文書を賛否の議論ツリーに変換します。この抽出は4つのことを行います:主張や理由を持つテキストの範囲を見つけ、それぞれが何であるかをラベル付けし、どの理由がどの主張に関連しているかを特定し、各リンクが上のものを支持するか攻撃するかを決定します。出力を形作る2つのデザイン選択があります。まず、議論はコスト、リスク、タイムライン、法的などの単語カテゴリーにグループ化され、各カテゴリーごとに正確に1つの議論がそのカテゴリーの主要な主張として昇格されます。次に、主要な主張はモデル自身の信頼スコアによって選ばれません。信頼度は抽出がどれだけ確実であったかを測定するものであり、議論がどれだけ中心的であるかを測るものではなく、言語化されたLLMの信頼度は調整が不十分であることが知られています。代わりに、主要な主張は同時にいくつかの信号から選択され、その中で最も強いのは中心性 — それにどれだけ多くの他の議論が関連しているか — と抽象性です。主要な主張は一般的な立場であり、その支持証拠は具体的であるためです。パーセンテージ、通貨の数値、または特定の研究を含む議論は、主張そのものではなく主張の証拠として扱われます。抽出されたすべての議論は、出典を逐語的に引用しなければなりません;元のテキストに見つけられないものは、ツリーが表示される前に削除されます。出力は、人々が修正し、再親子化し、評価するための草案であり、判決ではありません。
抽出は簡単な部分です。難しい部分は構造です — 何が主なポイントで、何がそれに対する証拠に過ぎず、何が実際にそれに反論しているのかを決定することです。
- 議論は単語のカテゴリーにグループ化されます — コスト、リスク、タイムライン、法的 — そして各カテゴリーから正確に1つがそのカテゴリーの主要な主張となります。
- 主な主張は、モデルが最も自信を持っていたものではありません。信頼度は抽出の確実性を測るものであり、重要性を測るものではありません。
- 主張は一般的であり、証拠は具体的です。パーセンテージや特定の研究を伴う主張は、主張そのものではなく、主張の支持として扱われます。
- すべての主張は、出典を言葉通りに引用しなければなりません。元のテキストに見つからないものは、あなたがそれを見る前に削除されます。
- 結果はドラフトです。人々はそれを修正し、再構築し、評価します — 機械が構造を作り、グループが判断を保ちます。
最も自信に満ちた答えが間違っていた
九十分の予算会議を抽出エンジンに入力し、どの議論が最も重要だったかを尋ねると、しばしば統計データが返されます。例えば、"財務モデルは運用費の20%削減を予測しています" — 正確で、十分な証拠があり、そのモデルは非常に確信を持っています。
それも間違った答えです。その文は主張ではありません。それは40分前に誰かが行った主張のための証拠です。そしてそれはずっと緩やかに表現されています:私たちはお金を節約するために2つのチームを統合すべきです。 曖昧な文が主張です。正確な文がそれを支えています。
この区別は、会話を構造に変えるという全体の問題であり、次回自分の会議のメモを読むときには心に留めておく価値があります。最も引用しやすいように見える文は、通常、最も議論の役割を果たしていないものです。
抽出が正しく行うべきこと
議論マイニング — これに関する研究分野で、2019年にジョン・ローレンスとクリス・リードによって調査されました — は通常4つの仕事に分けられ、進むにつれて難しくなります。
- 議論の部分を見つけてください。 実際の会議のほとんどの文は、物流、挨拶、または再表現です。主張や理由を持つものはごく一部です。
- 各部分が何であるかをラベル付けしてください。 主張は立場です。前提はその理由です。証拠はその理由の背後にあるデータです。同じ文がある文書では主張であり、別の文書では前提であることがあります。
- 何が何に反応するかを考えましょう。理由は特定の主張に付随し、反論は特定の理由に付随します。これがリストをツリーに変えるものです。
- 支援するか攻撃するかを決めてください。 すべてのリンクについて:これはそれに付随するものを強化しますか、それとも弱めますか?
最初の2つはほぼ解決されています。最後の2つは解決されておらず、公開されたベンチマークはそのギャップを明らかに示しています。Christian StabとIryna Gurevychが注釈を付けた説得力のあるエッセイのコーパスでは、コンポーネント検出は約73%のF1に達し、関係検出は約48%です。Joonsuk ParkとClaire Cardieが構築したCDCPコーパスでは、関係検出は約34%に低下します。
興味深いデザインの決定は発見にはなく、構造にあります。そして、そこにカテゴリが関わってきます。
なぜ議論がカテゴリーに分類されるのか
本当の議論は一つのことだけではありません。二つのチームを統合する決定は、同時にコスト、士気、法的リスク、そしてどれくらいの時間がかかるかに関するものです。それらは同じ部屋で行われている異なる議論であり、それを一つのリストにまとめると、誰も読めないものが出来上がります。
すべての抽出された引数には単語カテゴリーがタグ付けされています — コスト、リスク、タイムライン、法的、セキュリティ、範囲。単語で、意図的に。カテゴリーがフレーズになる瞬間、同じテーマはほぼ重複に分かれてしまいます:予算への影響とコストの考慮事項と財務リスクは、3つの異なる視点を持つ1つの議論であり、木は1つであるべき枝に分かれてしまいます。
制約は要求されるのではなく、強制されます。カテゴリは単一の標準形に正規化され、カテゴリはブランチの先端のプロパティです — メインの主張の下にあるすべては、そのメインの主張のカテゴリを継承します。コストの議論はリスクカテゴリの子を持つことはなく、もしその子が本当にリスクに関するものであれば、代わりにリスクのメイン主張の下に属します。
カテゴリごとに1つの主要な主張
各カテゴリ内で、正確に1つの主張が主要な主張として昇格されます — それは、そのカテゴリ内の他のすべてが支持または攻撃する中心的な立場です。カテゴリ内の他のすべては、それに直接的または間接的に従属する子供となります。
これはプロセス全体で最も重要な選択です。正しく行えば、ブランチは議論のように読み取れます:ここにコストに関する立場があり、ここにそれに対する三つの理由があり、ここに二つ目の理由への反論があります。間違えると、この記事の冒頭からの逆転が起こります — 統計がブランチの上にあり、それを支えるはずの主張がその下にぶら下がっているかのように詳細として扱われます。
明らかなアプローチは機能しません。
直感的な答えは、モデルが最も自信を持っていた主張を推進することです。しかし、これは理解する価値のある理由で失敗します。
信頼度は、抽出が実際の主張を見つけたことにどれだけ確信があるかを測ります。それは、その主張が議論にどれだけ中心的であるかを測るものではありません。明確に表現された統計と名のある出典は、簡単で高い信頼度の抽出です。あいまいで控えめな文が実際の論文である場合は、難しくて低い信頼度のものです。信頼度によるランキングは、証拠を体系的に促進し、主張を低く評価します。
最初の問題の下には第二の問題があります。AnthropicのSaurav Kadavathと同僚による研究では、言語モデルの言語化された自信は生のトークン確率よりも良くキャリブレーションされていることがわかりましたが、その後の評価では、絶対的な観点からは依然として十分にキャリブレーションされていないことが繰り返し示されています。それは使える信号です。しかし、信頼できるランキングではありません。
実際に主要な主張を選ぶもの
一つの信号の代わりに、いくつかが組み合わされており、その中で最も強いものは言語的ではなく構造的です。
- 中心性。 この主張にどれだけの他の主張が付随していますか? 他のすべてが反応するという主張は、ほぼ常に中心的な主張です。 これは、議論の位置に関する特性であり、その言葉遣いではないため、信頼できる信号に最も近いものです。
- 抽象性。 主な主張は一般的であり、証拠は具体的です。これはトゥールミンの理論に直接関連しています。彼の1958年の説明では、主張は結論であり、根拠はその下にある具体的な事実です。
- 議論的な言語。 論述マーカー — したがって、重要な問題は、私は主張したい — は、話者が詳細を提供するのではなく、立場を述べていることを示します。
- 簡潔さ。 中心となる主張は短い傾向があります。長い文は通常、修飾語を含んでおり、それが支持材料の役割を果たします。
- ポジション。 弱い信号だが、本物の信号:これらは早い段階で現れる傾向がある。
抽象性は具体性の指紋を探すことで測定されます。パーセンテージ、通貨の金額、定量化された実体、引用句、名指しされた機関 — それぞれが主張が主要な主張である可能性を低下させます。なぜなら、それぞれが結論ではなく根拠の特徴だからです。リモートワークは生産性を向上させるは主張です。500人の労働者を対象にした調査で78%の満足度が示されましたは、誰かがなぜそう言うのか尋ねたときに言うことです。
いくつかの弱い信号を組み合わせることは、強そうに見える一つの信号を信頼するよりも優れています — これは、多様な視点を持つグループが自信に満ちた個人を上回る理由と同じであり、このパターンは多様性が能力を上回る理由で探求されています。
最後の会議でこれを自分で試してみてください。
チームが最後に下した決定を考えてみてください。それに対する最も強い反論を一つ挙げられますか?そして、それを言ったのは誰かも挙げられますか?もしできないのであれば、それは記憶の問題ではありません。それは構造の問題です:あなたの記録は決定されたことを捉えましたが、議論されたことは捉えていません。これがまさに抽出が埋めようとしているギャップです。
ソースにないものは何も生き残らない
実際には行われていないがもっともらしく聞こえる議論は、欠落している議論よりも悪い — それはあなたのチームが言ったことの虚偽の記録です。したがって、抽出されたすべての議論は、その出所からの正確な表現を持ち、引用された証拠がソース文書内で見つからない議論は、誰にでもツリーが表示される前に削除されます。
これは魅力的ではなく、残りを使えるようにする部分です。トランスクリプトに遡れない木は、余分なステップを含む要約です。
しかし、これはただの要約に余分なステップを加えただけではありませんか?
それは明らかな反論であり、答えはそれぞれが何を捨てるかにあります。
要約は圧縮されます。それは会議で何が議論されたかを大まかに伝え、もし良いものであれば、何が決定されたかを示します。しかし、要約が保持できないのは、意見の不一致の形です — この特定の異議がその特定の理由に対して提起され、それに対して回答があり、二つ目の異議は決して提起されなかったということです。要約は、決定が8ヶ月後に再検討される際に重要な部分を正確に失います。その時、誰も明白な代替案がなぜ却下されたのかを思い出せないのです。
この区別は、論理的思考を測定するのではなく態度を測定する感情分析からも議論のマイニングを分けます。文は否定的に表現されることがありながら、それが付随する主張を支持することがあります — "タイムラインのプレッシャーはリスクを増加させる" は、そのプロジェクトがリスクが高いという主張を強化します。トーンで評価すると、毎回逆の結果になります。
出力はドラフトであり、それがポイントです。
抽出から出てくるのは提案です:ここに私たちが主張されたと思うことがあります、ここに私たちがそれがどのように組み合わさっていると思うかがあります。人々はそれを修正します — 間違った主張に付随していた議論を再構築し、二つのポイントが合体しているものを分割し、スコアリングで間違ったものを推進し、彼らが説得力があると感じるものを評価します。
その分割は意図的です。手作業で構造を構築することは面倒な作業であり、チームがそれを全く行うのを妨げます。議論がどれほど良いかを判断すること — 証拠が成立しているか、暗黙の前提が受け入れられるか — は面倒ではありません。それは実際の思考であり、グループに残ります。
自分の会議記録を読んでいる場合、これは何を意味するのか
- 引用される言葉は通常、主張ではありません。正確で信頼できる文は通常、証拠です。それが支持する主張はしばしばあいまいで、見落としやすいものです。
- 何が何に付いているかを数えなさい。 他の全員が反応したポイントは、誰が最も自信を持って言ったかに関係なく、重要なポイントでした。
- カテゴリを名付けてください。 もし決定がどの2つまたは3つのテーマに関するものであったかを言えないのであれば、その議論は構造化されていない — それは転写されたものです。
- 誰も答えなかった反論を探してください。 それは、あらゆる議論の記録において最も有用なものであり、平坦な要約が最初に壊すものです。
曖昧な文が議論だった
その統計は決して重要な点ではなかった。それは、すでに行われた主張について誰かが尋ねた質問への答えだった — おおまかに、早い段階で、議事録には決して載らないような文で。
議論を構築することは、その文を適切な枝の先頭に戻し、その下に証拠を置き、異議を具体的な反論に付けることを意味します。それが木構造の目的です。そして、最も自信のある答えがしばしば間違っている理由でもあります。
議論マイニングシリーズ
この投稿では、私たちがどのように議論のマイニングを適用するかについて説明します。シリーズの残りの部分では、この分野の起源と、その難しい問題がなぜ難しいのかについて説明します。
出典とさらなる参考文献
分野の標準調査 — タスクの定義、方法、および未解決の問題。
議論マイニングを測定可能なタスクにした注釈付きコーパスであり、ここで引用されているコンポーネント/関係のF1数値の出所です。
主張/根拠/保証モデル — 主張が一般的であり、根拠が具体的であるという原則の源。
CDCPコーパスは、関係検出スコアが約34% F1であり、公開された範囲の中で難しい方に位置しています。
言語化されたモデルの信頼性について — 生の確率よりは良いが、依然として信頼できるランキング信号ではない。
よくある質問
Argumentreeはどのようにトランスクリプトを議論ツリーに変換しますか?
それは議論マイニングを適用します:主張や理由を持つテキストの範囲を見つけ、それぞれが何であるかをラベル付けし、どの理由がどの主張に関連しているかを特定し、各リンクが上のポイントを支持するか攻撃するかを決定します。その結果、人々がレビューして修正する賛否ツリーが得られます。
引数のカテゴリとは何ですか、そしてなぜ単語だけなのですか?
カテゴリは、議論をそれぞれの討論に分けます — コスト、リスク、タイムライン、法的。これらは単語に制限されています。なぜなら、フレーズの長さのカテゴリは断片化するからです:予算の影響、コストの考慮事項、財務リスクは、3つの異なる側面を持つ1つの討論であり、木は1つであるべき枝に分かれます。
カテゴリごとに1つの主要な主張とは何を意味しますか?
各カテゴリ内で、正確に1つの主張が中心的な主張として昇格され、そのカテゴリ内の他のすべてがその下に付随します。これが、ブランチを関連する文の単なる平坦なリストではなく、主張として読みやすくする要因です — 立場、その理由、そしてその理由に対する反論です。
なぜ主要な主張が最も高い信頼度のものではないのですか?
なぜなら、信頼度は抽出がどれほど確実であったかを測るものであり、議論がどれほど中心的であるかを測るものではないからです。明確に表現された統計は、簡単で高い信頼度の抽出です。一方、実際の主張である曖昧な文は難しいものです。信頼度によるランキングは、証拠を体系的に促進し、主張を低く評価します。
これは会議の要約とはどう違うのですか?
要約は、何がカバーされたかを圧縮して伝えます。それは、異議の形を保持することはできません — この異議があの理由に対して提起され、それに対して回答があり、別の理由には回答がなかったということです。要約は、後で決定が再検討されるときに重要な部分を正確に失います。
AIが誰も作っていない議論を発明するのを何が止めるのですか?
抽出されたすべての主張は、その出所からの正確な表現を持ち、引用された証拠がソース文書内で見つからない主張は、ツリーが表示される前に削除されます。もっともらしく聞こえるが実際には行われなかった主張は、欠落している主張よりも悪いです。
抽出された内容を変更できますか?
はい — それが意図されたワークフローです。出力はドラフトです。人々は間違った主張に添付された議論を再親子化し、統合されたポイントを分割し、スコアリングで間違ったものを昇格させ、説得力があると感じるものを評価します。機械が構造を構築し、グループが判断を維持します。
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
自分の成績証明書で確認してください。
会議の議事録を貼り付けると、修正、評価、構築できる構造化された賛否ツリーが得られます。
