Argument Mining

When LLMs Met Argument Mining: What Changed and What Didn't

AT
Argumentree Team
Decision Science
July 29, 2026
10 min baca
When LLMs Met Argument Mining: What Changed and What Didn't

Apabila LLM Bertemu Perlombongan Argumen: Apa yang Berubah dan Apa yang Tidak | Argumentree

Untuk kebanyakan sejarahnya, perlombongan argumen komputasi memerlukan korpus yang dianotasi secara manual untuk setiap domain baru. Keperluan itu adalah kekangan yang mengikat bidang ini: usaha anotasi adalah besar, garis panduan dipertikaikan, dan sistem yang disesuaikan pada esei pelajar tidak dipindahkan dengan baik kepada transkrip mesyuarat atau komen awam. Model bahasa besar menghapuskan kekangan itu. Model tujuan umum boleh melakukan pengesanan komponen dan pengelasan hubungan dari satu arahan, tanpa data latihan khusus domain, dan penilaian yang diterbitkan telah mendapati model tujuan umum yang diprompt adalah kompetitif dan dalam beberapa kes lebih baik daripada garis dasar pengodok yang disesuaikan dalam perlombongan argumen berasaskan hubungan. Ini mengubah apa itu perlombongan argumen: ia menjadi boleh digunakan pada teks organisasi biasa dan bukan hanya pada korpus penyelidikan yang dikurasi. Apa yang tidak diubah adalah struktur masalah yang sukar. Ketidakseimbangan kelas mencerminkan cara orang menulis, bukan cara model dilatih. Sama ada sumbangan menyokong atau menyerang bergantung pada induknya dan bukannya pada kata-katanya. Dan bantahan sering menyasarkan waran yang tidak dinyatakan yang tidak muncul di mana-mana dalam teks. Model besar juga memperkenalkan kesukaran baru mereka sendiri: keyakinan yang dinyatakan lebih baik dikalibrasi daripada kebarangkalian token mentah tetapi masih tidak boleh dipercayai sebagai isyarat peringkat, jadi kepastian model tidak boleh digunakan untuk memutuskan argumen yang diekstrak mana yang paling penting.

Share:
TL;DR

Bottleneck korpus hilang. Masalah struktur tidak bergerak walau seinci — dan satu lagi muncul, mengenakan kostum sebagai penyelesaian.

  • Penggalian hujah sebelum ini memerlukan korpus yang dianotasi secara manual bagi setiap domain. Model umum yang diprompt tidak memerlukannya, yang menjadikannya boleh digunakan pada teks perniagaan biasa.
  • Penilaian yang diterbitkan mendapati model tujuan umum yang dipromosikan bersaing dengan, dan kadang-kadang lebih baik daripada, asas penyandi yang disesuaikan dalam pengelasan hubungan.
  • Ketidakseimbangan, kebergantungan konteks dan waran yang tidak dinyatakan adalah sifat bahasa dan tugas, bukan saiz model.
  • Keyakinan model lebih baik diselaraskan berbanding dengan kebarangkalian mentah tetapi masih bukan isyarat peringkat yang boleh dipercayai — satu perangkap baru, bukan alat baru.
  • Apa yang membantu adalah memaksa hubungan itu dinyatakan dalam kata-kata sebelum label itu disahkan.

Kekangan yang Mendefinisikan Bidang Itu Secara Sederhana Tidak Lagi Dikenakan

Selama dua puluh tahun, jawapan kepada bolehkah kita menjalankan perlombongan hujah ke atas data kita? adalah satu soalan lain: berapa ribu dokumen anda yang sanggup anda anotasi secara manual terlebih dahulu, dan siapa yang akan menulis garis panduan itu?

Itu bukanlah butiran teknikal. Ia adalah sebab mengapa perlombongan hujah kekal di makmal penyelidikan sementara analisis sentimen dihantar dalam setiap produk. Keperluan anotasi menjadikan setiap domain baru sebagai projek dan bukannya konfigurasi, dan seperti yang diterangkan dalam pos kedua dalam siri ini, garis panduan itu sendiri dipertikaikan bahkan di kalangan pakar.

Kemudian model bahasa umum muncul dan soalan itu tidak lagi ditanya. Anda kini boleh mengarahkan satu kepada transkrip mesyuarat dalam domain yang tidak pernah dianotasi dan mendapatkan hasil awal yang boleh digunakan. Jika anda pernah tertanya-tanya mengapa kemampuan ini muncul dalam produk secara tiba-tiba dan bukannya secara beransur-ansur, itulah sebabnya.

Zero-Shot adalah keseluruhan cerita

Perkara khusus yang berubah adalah penghapusan pengawasan khusus domain. Model yang diprompt membawa kecekapan umum dengan bahasa dan boleh diberitahu apa itu tuntutan dan apa itu premis, dalam prompt, pada waktu inferens.

Karya yang diterbitkan mengenai perlombongan argumen berasaskan hubungan telah menemui model tujuan umum dengan pemicu sedikit yang bersaing dengan garis dasar penyandi yang disesuaikan di pelbagai set data — dan dalam beberapa kes, lebih baik daripada mereka. Bagi satu bidang yang keseluruhan apparatus penilaiannya dibina berdasarkan latihan terawasi terhadap korpus yang dianotasi, itu adalah satu pemisahan yang sebenar.

Tiga akibat praktikal berlaku. Penyesuaian domain menjadi pertukaran arahan daripada latihan semula. Dokumen panjang menjadi lebih mudah diurus, kerana tetingkap konteks berkembang. Dan medan bukti boleh membawa penjelasan, kerana model boleh diminta untuk membenarkan dirinya dalam panggilan yang sama — yang ternyata lebih penting daripada yang disangka.

Tiga Masalah Yang Tidak Bergerak

Semua yang terdapat dalam pos sebelumnya masih relevan, dan adalah penting untuk menjelaskan mengapa skala tidak menyelesaikan sebarang isu tersebut.

  • Ketidakseimbangan kelas adalah sifat penulisan, bukan latihan. Orang yang membina kes kebanyakannya menulis ayat sokongan. Model yang telah membaca seluruh internet juga kebanyakannya telah membaca persetujuan.
  • Kebergantungan konteks adalah sifat tugas. Sokongan dan serangan adalah hubungan, bukan atribut ayat. Ayat yang sama di bawah ibu yang berbeza mempunyai label yang berbeza, dan tiada jumlah pengetahuan dunia yang dapat mengubahnya.
  • Waran yang tidak dinyatakan adalah harta teks. Jika prinsip yang menghubungkan bukti kepada kesimpulan tidak pernah ditulis, ia tidak terdapat dalam input. Model yang lebih besar membaca ayat yang sama yang tiada.

Terdapat satu lagi yang keempat, yang lebih halus. Model yang fasih menghasilkan output yang fasih, jadi kesilapannya muncul dengan ungkapan yang baik dan konsisten secara dalaman. Label hubungan yang salah dari pengkod kelihatan seperti bunyi bising. Label hubungan yang salah dari model bahasa kelihatan seperti hujah.

Perangkap Baru: Mempercayai Kepastian Model Itu Sendiri

Kerana model-model ini boleh melaporkan sejauh mana mereka yakin, adalah menggoda untuk menggunakan nombor itu — untuk menyusun argumen yang diekstrak, untuk memutuskan yang mana yang penting, untuk mengawal apa yang ditunjukkan.

Kerja oleh Saurav Kadavath dan rakan-rakan mendapati bahawa penilaian diri yang diucapkan adalah lebih baik diselaraskan berbanding dengan kebarangkalian token mentah. Hasil itu sering dipetik sebagai lesen untuk mempercayai nombor tersebut. Penilaian seterusnya secara konsisten kurang menggalakkan: lebih baik daripada alternatif tidak sama dengan boleh dipercayai, dan penyelarasan merosot tepat di tempat yang anda perlukan, pada kes-kes yang sukar dan luar biasa.

Terdapat juga kesilapan kategori yang tersembunyi dalam amalan ini. Keyakinan mengukur sejauh mana model yakin bahawa ia telah menemui satu hujah yang sebenar. Ia tidak mengatakan apa-apa tentang sama ada hujah itu adalah pusat kepada perdebatan. Statistik yang ditulis dengan jelas adalah pengambilan yang mudah dan mempunyai keyakinan tinggi; ayat yang berhati-hati yang kebetulan merupakan tesis sebenar adalah sukar. Peringkat mengikut keyakinan mempromosikan bukti dan menurunkan tuntutan — yang merupakan kegagalan yang tepat dibuka oleh pos terakhir dalam siri ini.

Uji pada transkrip yang anda kenali dengan baik.

Ambil satu mesyuarat yang hasilnya anda ingat dengan jelas dan tanya mana-mana alat AI apa hujah utama. Jika ia memberikan anda ayat yang paling tepat dan berasaskan bukti terbaik berbanding yang longgar yang sebenarnya mendorong keputusan, anda baru sahaja menyaksikan keyakinan menggantikan kepentingan — dan anda kini tahu untuk tidak mempercayai penarafan itu.

Apa Itu Bantuan: Membuatnya Mengatakan Kenapa Terlebih Dahulu

Peningkatan yang paling boleh dipercayai yang tersedia dengan model-model ini adalah hampir terlalu mudah. Minta penjelasan sebelum label.

Memerlukan model untuk menuliskan apa yang sumbangan lakukan kepada induknya — ini menguatkan bantahan di atas, kerana ia memberikan satu lagi alasan mengapa bantahan itu sah — sebelum membuat keputusan sokongan atau serangan secara ketara meningkatkan keputusan. Langkah yang ditulis memaksa hubungan induk ke dalam konteks kerja model, yang merupakan maklumat yang tepat tidak disediakan oleh penggubalan ayat tersebut.

Ini adalah versi mesin bagi teknik yang sepenuhnya manusia. Inilah sebabnya steelmanning berfungsi: menyatakan apa yang sebenarnya dilakukan oleh satu hujah, sebelum menilainya, mengubah penilaian.

Jadi, Adakah Perlombongan Argumen Sudah Diselesaikan?

Tidak, dan bentuk apa yang tinggal kini lebih jelas daripada sebelumnya.

Apa yang diselesaikan, dari segi praktikal, adalah akses. Mana-mana organisasi boleh menjalankan perlombongan hujah ke atas teks mereka sendiri hari ini tanpa program anotasi, yang tidak terfikir beberapa tahun yang lalu. Itu adalah perubahan yang nyata dan besar.

Apa yang tidak diselesaikan adalah struktur: sumbangan mana yang menjawab kepada yang mana, dan dalam arah mana, apabila prinsip penghubung tidak dinyatakan dan data telah melatih semua orang — manusia dan mesin — untuk mengharapkan persetujuan. Kedudukan yang jujur adalah bahawa pengambilan kini menghasilkan draf yang baik dalam mana-mana domain, dan bahawa seseorang masih perlu memeriksa ketidaksetujuan. Ini adalah pembahagian kerja yang jauh lebih baik daripada yang di mana tiada siapa yang membina struktur sama sekali.

Cara Menggunakan Ini Dengan Baik

  • Jangan pangkat mengikut keyakinan. Ia mengukur kepastian pengambilan, bukan kepentingan, dan ia secara sistematik mempromosikan bukti berbanding tuntutan.
  • Tanya tentang hubungan, bukan perasaan. Soalan yang berguna adalah apa yang berlaku kepada ibu bapa — bukan bagaimana ia merasakan tentang topik tersebut.
  • Pastikan ia membenarkan label sebelum memberikannya. Alasan yang ditulis adalah apa yang meletakkan hubungan ibu bapa dalam konteks, dan di situlah anda menangkap kesilapan.
  • Luangkan masa ulasan anda pada perbezaan pendapat. Di situlah model paling lemah dan di mana nilai keputusan tertumpu.

Draf yang Lebih Baik, Bukan Keputusan

Bottleneck yang menghalang penggalian hujah di makmal telah hilang, dan ia tidak akan kembali. Itu perlu dijelaskan dengan jelas: ia adalah perbezaan antara teknik penyelidikan dan sesuatu yang boleh anda tunjukkan di mesyuarat anda sendiri.

Tetapi masalah yang sukar pada tahun 1958 masih sukar sekarang. Waran masih belum ditulis, perselisihan masih jarang berlaku, dan label masih bergantung kepada ibu bapa dan bukannya frasa. Apa yang berubah adalah siapa yang mempunyai masalah tersebut — yang, bagi bidang yang menghabiskan dua puluh tahun menunggu penanda, adalah perubahan yang cukup besar.

Siri perlombongan hujah

Lima pos tentang bagaimana mesin belajar untuk membaca hujah — dari mana bidang ini berasal, mengapa masalah sukar adalah sukar, dan bagaimana kami mengaplikasikannya.

Soalan Lazim

Bagaimana model bahasa besar mengubah perlombongan hujah?

Mereka menghapuskan keperluan untuk korpus yang dianotasi tangan dalam setiap domain baru. Model umum yang diprompt boleh mengenal pasti tuntutan, premis dan hubungan tanpa data latihan khusus domain, yang mengubah perlombongan hujah daripada teknik penyelidikan kepada sesuatu yang boleh digunakan pada teks organisasi biasa.

Adakah LLM lebih baik daripada model yang disesuaikan dengan baik dalam perlombongan hujah?

Dalam perlombongan hujah berasaskan hubungan, penilaian yang diterbitkan telah mendapati model umum yang dipromosikan bersaing dan dalam beberapa kes lebih baik daripada garis dasar penyandi yang disesuaikan merentasi pelbagai set data. Kelebihan praktikal yang lebih besar adalah bahawa mereka tidak memerlukan data latihan yang dianotasi untuk domain baru sama sekali.

Apakah masalah yang tidak diselesaikan oleh LLM?

Tiga yang bersifat struktur. Ketidakseimbangan kelas mencerminkan cara orang menulis dan bukannya cara model dilatih. Sokongan berbanding serangan bergantung kepada ibu bapa, bukan pada perkataan. Dan bantahan sering menyasarkan alasan yang tidak dinyatakan yang tiada dalam teks, jadi tiada jumlah kemampuan model yang dapat menyediakannya.

Bolehkah anda mempercayai skor keyakinan model?

Bukan sebagai isyarat peringkat. Keyakinan yang diucapkan lebih baik diselaraskan daripada kebarangkalian token mentah tetapi tetap tidak boleh dipercayai dalam istilah mutlak, dan ia mengukur kepastian pengambilan daripada kepentingan — jadi peringkat berdasarkan ini secara sistematik mempromosikan butiran yang mempunyai bukti yang baik berbanding ayat yang lebih longgar yang membawa tuntutan sebenar.

Apa yang sebenarnya meningkatkan pengelasan hubungan dengan LLM?

Memerlukan model untuk menyatakan, dalam kata-kata, apa yang dilakukan oleh sumbangan kepada induknya sebelum berkomitmen kepada label sokongan atau serangan. Langkah bertulis ini memaksa hubungan induk ke dalam konteks kerja, yang merupakan maklumat yang gagal diberikan oleh penggubalan ayat itu sendiri.

Adakah perlombongan hujah kini merupakan masalah yang telah diselesaikan?

Akses telah diselesaikan — mana-mana organisasi boleh menjalankannya pada teks mereka sendiri tanpa program anotasi. Struktur masih belum. Menentukan sumbangan mana yang menjawab kepada yang mana, dan dalam arah mana, masih sukar, jadi pengeluaran menghasilkan draf yang baik dan seseorang masih menyemak ketidaksetujuan.

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.

Jalankan ia pada transkrip anda sendiri

Tiada program anotasi, tiada korpus, tiada sesi latihan — hanya pokok pro dan kontra yang terstruktur untuk ditinjau.

Mula percuma

Bacaan berkaitan