Adakah perbincangan yang terstruktur benar-benar mengubah apa yang difikirkan oleh satu kumpulan?
Satu eksperimen pradaftar yang diterbitkan dalam Science pada Oktober 2024 (Tessler et al., Science 386, eadq2852) menguji ini secara langsung dengan 5,734 peserta dari UK. Satu kumpulan peserta membaca pendapat bertulis antara satu sama lain mengenai soalan-soalan yang memecahbelahkan; persetujuan kumpulan tidak bergerak sama sekali (b = -0.005, P = 0.64). Kumpulan yang sebanding yang pendapat mereka disintesis menjadi satu kenyataan kumpulan calon, dinilai, dikritik dan disusun semula, telah bersatu dengan kira-kira lapan mata peratus, dan proporsi kumpulan yang mencapai kesepakatan meningkat dari 22.8% kepada 38.6%. Perbezaan antara dua keadaan tersebut adalah signifikan secara statistik (P = 0.0058). Sintesis dilakukan oleh sistem AI yang dipanggil penulis sebagai Habermas Machine, yang kenyataannya lebih disukai berbanding dengan mediator manusia yang terlatih dan diberi insentif kewangan sebanyak 56% daripada masa. Kenyataan yang dihasilkan selepas pusingan kritikan memberikan lebih banyak berat kepada posisi minoriti berbanding dengan bahagian mereka dalam kumpulan, bukan kurang. Penulis menyatakan batasan yang jelas: semua peserta adalah penduduk UK, kumpulan hanya mengandungi lima orang, sistem tidak dapat memeriksa fakta atau memoderasi, dan analisis eksploratori mendapati konvergensi yang serupa dari mediator manusia, mencadangkan bahawa kesan mungkin datang dari perbincangan yang dimediasi sebagai satu proses dan bukannya dari AI secara khusus. Penemuan praktikal bagi sesiapa yang menjalankan perbincangan adalah bahawa pertukaran pandangan bukanlah mekanisme yang menghasilkan persetujuan; menyusun mereka, dan menjalankan pusingan bantahan yang jelas, adalah.
Pada bulan Oktober 2024, Science menerbitkan eksperimen yang telah didaftarkan terlebih dahulu dengan 5,734 peserta yang termasuk keadaan kawalan yang hampir tidak ada yang menyedarinya. Satu set kumpulan hanya membaca pendapat satu sama lain mengenai soalan politik yang memecahbelahkan. Tahap persetujuan mereka tidak berubah sama sekali. Kumpulan yang pendapatnya disusun dalam satu kenyataan kumpulan calon, dinilai, dikritik dan disusun semula telah bersatu dengan peningkatan lapan peratus, dan kesepakatan hampir dua kali ganda. Pertukaran pandangan secara bebas bukanlah yang menghasilkan titik persamaan. Struktur adalah.
- Keputusan kawalan adalah penemuan. Membaca pendapat antara satu sama lain menggerakkan persetujuan kumpulan sebanyak b = -0.005 (P = 0.64). Menstrukturkan pendapat yang sama menggerakkannya lapan mata peratus (P < 0.001 dalam ketiga-tiga kohort).
- Kesepakatan meningkat dari 22.8% kepada 38.6%, dan 66.6% peserta berkata kenyataan kumpulan itu menyatakan pandangan mereka dengan lebih baik daripada ungkapan asal mereka.
- Putaran kritikan adalah kausal, bukan artefak. Dalam kohort berasingan yang terdiri daripada 245 orang, draf semula yang benar-benar menggunakan kritikan mengalahkan draf semula yang secara rahsia mengabaikannya (P = 0.0039).
- Struktur melindungi minoriti. Kenyataan pasca-kritikan memberikan berat kepada pandangan minoriti pada 0.36 berbanding dengan bahagian sebenar 0.29. Ini bukanlah peraturan majoriti.
- Had yang jujur: Hanya peserta dari UK, kumpulan lima orang, tiada pemeriksaan fakta, dan mediator manusia menghasilkan konvergensi yang serupa pada pusingan yang mereka menangi. Mekanisme ini mungkin dipengaruhi oleh struktur itu sendiri dan bukannya AI.
Lima orang asing diberikan soalan yang memecahbelahkan. Patutkah Perkhidmatan Kesihatan Kebangsaan diprivatkan? Patutkah umur mengundi diturunkan kepada 16 tahun? Setiap daripada mereka menulis pendirian jujur mereka secara peribadi, dengan kata-kata mereka sendiri, dalam panjang yang munasabah. Kemudian mereka membaca apa yang ditulis oleh empat orang yang lain. Pendirian yang dinyatakan diukur sebelum, dan sekali lagi selepas.
Tiada apa yang bergerak. Tidak sedikit pun, tidak ke arah yang salah, tidak dengan jumlah yang terlalu kecil untuk diambil kira. Perubahan yang diukur dalam persetujuan kumpulan adalah minus 0.005, dengan nilai p 0.64, yang hampir tidak menunjukkan apa-apa seperti yang dapat dilaporkan oleh satu eksperimen.
Ini adalah keadaan kawalan dalam satu kajian yang diterbitkan dalam Science pada 18 Oktober 2024. Kumpulan yang sebanding, yang diberikan soalan yang sama dan jumlah masa yang sama, di mana pendapat bertulis mereka sebaliknya dihimpunkan menjadi kenyataan kumpulan calon, dinilai, dikritik dan disusun semula, telah bersatu dengan peningkatan kira-kira lapan mata peratus. Peratusan kumpulan yang mencapai kesepakatan meningkat dari 22.8% kepada 38.6%. Kajian ini biasanya dilaporkan sebagai cerita tentang AI yang mengalahkan mediator manusia. Hasil yang jauh lebih berguna adalah yang tidak mendapat tajuk utama: pertukaran pandangan tidak menghasilkan titik persamaan. Menstrukturkannya menghasilkan.
Membenarkan orang membaca pendapat antara satu sama lain mengurangkan persetujuan kumpulan sebanyak setengah mata peratus.
Menyusun semula pendapat yang sama telah menggerakkannya sebanyak lapan.
Tessler et al., Science 386, eadq2852 (2024) — kohort pendedahan pendapat vs. kohort tugas utama
Apa yang sebenarnya dilakukan oleh kajian itu
Kertas ini adalah AI boleh membantu manusia mencari titik persamaan dalam perbincangan demokratik oleh Michael Henry Tessler, Michiel Bakker dan rakan-rakan di Google DeepMind, Oxford dan Harvard. Ia melaporkan tujuh eksperimen yang dijalankan antara Januari dan Ogos 2023 dengan 5,734 peserta dari UK secara keseluruhan. Saiz sampel, kriteria pengecualian dan analisis utama telah didaftarkan lebih awal sebelum pengumpulan data, dan kodnya telah dikeluarkan secara terbuka. Gabungan pendaftaran awal, keadaan kawalan yang tulen, penerbitan dalam Science dan kod terbuka adalah cukup jarang dalam bidang ini untuk dinyatakan dengan jelas.
Peserta bekerja dalam kumpulan sekitar lima orang dan membincangkan tiga soalan dalam masa lebih kurang satu jam. Untuk setiap soalan, prosedurnya adalah tetap. Setiap orang menulis pendapat mereka sendiri secara peribadi terlebih dahulu, antara 10 hingga 200 patah perkataan, dengan purata sekitar 65. Pendapat yang ditulis itu diserahkan kepada sistem yang dinamakan oleh penulis sebagai Habermas Machine, sempena nama ahli falsafah yang berpendapat bahawa persetujuan muncul apabila orang berfikir bersama dalam keadaan yang adil. Sistem itu merangka beberapa kenyataan calon tentang titik persamaan kumpulan. Peserta memberi penarafan kepada kenyataan tersebut, dan pemenang dipilih melalui pilihan raya berperingkat di mana undi setiap peserta diambil kira secara sama rata. Kenyataan yang menang dikembalikan kepada kumpulan, setiap orang menulis kritikan secara peribadi terhadapnya, dan sistem menghasilkan draf yang telah disemak berdasarkan kritikan tersebut. Peserta memberi penarafan sekali lagi dan akhirnya memilih antara versi asal dan versi yang telah disemak.
Dua butiran yang patut dipegang. Peserta diberitahu bahawa kenyataan tersebut dihasilkan oleh mesin, jadi tiada penipuan yang terlibat. Dan soalan-soalan itu sendiri sengaja dipilih untuk menjadi kontroversi, merangkumi imigresen, umur persaraan, jumlah penjara, Brexit, sasaran iklim dan gaji minimum. Ini bukanlah topik pemanasan yang dipilih untuk memudahkan persetujuan.
Empat perkara yang dilakukan oleh prosedur tersebut
Keluarkan pembelajaran mesin dan prosedur itu mengandungi empat langkah. Setiap satu daripadanya tersedia untuk mana-mana kumpulan dengan dokumen yang dikongsi dan sedikit disiplin.
Setiap orang berpegang pada pendirian sebelum mendengar orang lain.
Pendapat ditulis secara peribadi, dalam ayat penuh, dengan alasan yang disertakan. Tiada siapa yang bercakap terlebih dahulu dan menguasai bilik, dan tiada siapa yang mempunyai pilihan untuk bersetuju secara senyap dengan sesiapa yang terdengar paling yakin. Rekod bertulis tentang apa yang sebenarnya difikirkan oleh setiap orang wujud sebelum sebarang tekanan sosial dapat bertindak ke atasnya.
Jawatan-jawatan disintesis menjadi satu artefak, bukan disusun dalam senarai.
Ini adalah langkah yang tidak diterima oleh kumpulan kawalan. Mereka menerima maklumat yang sama, semua lima pendapat secara penuh, sebagai sekumpulan teks yang berasingan. Kumpulan rawatan menerimanya sebagai satu kenyataan draf tunggal tentang di mana kumpulan itu sebenarnya berada. Maklumat yang sama, struktur yang berbeza, dan hanya satu daripada dua yang menghasilkan pergerakan.
Pemilihan adalah undian berperingkat dengan berat yang sama.
Pernyataan yang menang dipilih dengan mengumpulkan kedudukan setiap peserta, satu undi setiap seorang. Tiada pilihan sesiapa yang diambil kira lebih kerana lebih kuat, lebih cepat, lebih senior atau lebih fasih. Ini adalah bahagian yang sangat mudah untuk diterangkan dan sentiasa sukar untuk dilakukan dalam mesyuarat secara langsung.
Terdapat pusingan rasmi untuk bantahan, dan draf perlu diubah.
Setiap peserta memberikan kritikan secara peribadi terhadap kenyataan yang menang, dan kritikan tersebut dimasukkan semula ke dalam revisi. Bantahan bukanlah satu gangguan atau risiko sosial; ia adalah langkah yang dijadualkan yang dilakukan oleh semua orang. Di antara tiga kohort, 68%, 64% dan 66% peserta lebih suka kenyataan yang telah direvisi berbanding yang asal.
Mengapa keadaan kawalan adalah hasil yang penting
Satu bantahan yang munasabah terhadap mana-mana kajian seperti ini adalah bahawa orang ramai bersetuju hanya kerana mereka akhirnya mendengar apa yang difikirkan oleh orang lain. Penulis telah menjangkakannya dan menjalankan ujian. Satu kohort tambahan sebanyak 372 peserta dalam 75 kumpulan melakukan latihan yang sama, kecuali bahawa bukannya menilai kenyataan kumpulan yang draf, mereka menilai pendapat individu antara satu sama lain. Pendedahan penuh kepada setiap pandangan dalam kumpulan, tanpa sintesis.
Perjanjian kumpulan dalam keadaan itu tidak berubah (b = -0.005, t(230) = -0.46, P = 0.64), dan perbezaan antara dua keadaan itu sendiri adalah signifikan secara statistik (P = 0.0058). Ini adalah hasil yang terkawal dan telah didaftarkan lebih awal, diterbitkan dalam Science, menunjukkan bahawa mengedar pendapat semua orang tidak membawa kumpulan ke arah persetujuan. Ini adalah perkara yang paling hampir dalam literatur sebagai ujian langsung bagi thread komen, dan thread komen itu gagal.
Separuh lagi mekanisme itu diuji dengan teliti. Kenyataan yang telah disemak mungkin lebih disukai hanya kerana orang melihatnya kedua, selepas melaburkan sedikit usaha tambahan. Oleh itu, penulis menjalankan satu lagi kumpulan 245 peserta yang menulis kritikan dan kemudian ditunjukkan draf semula yang sama ada mengandungi atau tidak mengandungi kritikan tersebut. Versi yang benar-benar dipengaruhi oleh kritikan masih menang (P = 0.0039). Pusingan bantahan melakukan kerja yang sebenar.
Struktur tidak meratakan golongan minoriti. Ia memperkuatkannya.
Ketakutan yang jelas tentang sebarang proses yang mencari konsensus adalah bahawa ia menjadi pemerintahan majoriti dengan adab yang lebih baik. Penulis mengukur ini daripada menyatakannya, dengan menyematkan setiap pendapat dan setiap kenyataan dalam ruang vektor dan menempatkannya sepanjang paksi yang berjalan dari persetujuan ke ketidaksetujuan pada setiap soalan.
Dalam kira-kira 77% daripada pusingan, kumpulan itu bermula dengan benar-benar terbahagi. Kenyataan kumpulan awal memberikan pandangan minoriti dengan berat 0.29, berbanding dengan purata sebenar bahagian minoriti 0.29, yang merupakan perwakilan proporsional hampir tepat. Kenyataan yang disemak, ditulis selepas pusingan kritikan, memberikan berat kepada mereka pada 0.36. Minoriti itu diwakili secara berlebihan berbanding saiznya, dan kumpulan itu lebih suka kenyataan yang disemak tersebut. Sembilan puluh enam peratus kenyataan kumpulan berada dalam julat yang sebenarnya merangkumi pendapat kumpulan itu sendiri, jadi sistem itu tidak mencipta kedudukan yang tidak dipegang oleh sesiapa.
Sokongan masih beralih ke arah kedudukan majoriti secara keseluruhan, dan penulis menyatakannya. Majoriti meningkat dalam 29% hingga 32% pusingan dan minoriti meningkat dalam 20% hingga 26%. Tetapi apabila mereka menguji sama ada orang bergerak ke arah majoriti hanya kerana mereka telah ditunjukkan kenyataan yang cenderung kepada majoriti, mereka tidak menemui sebarang hubungan langsung (P = 0.37). Apa sahaja yang mempengaruhi orang adalah kandungan hujah, bukan pendedahan berulang kepadanya.
Draf pertama mesin itu sepadan dengan majoriti dengan tepat.
Selepas satu pusingan bantahan, ia mewakili golongan minoriti secara berlebihan.
Berat minoriti meningkat dari 0.29 kepada 0.36 berbanding dengan bahagian minoriti sebenar sebanyak 0.29
Ia mengalahkan para mediator manusia, dan itu adalah yang paling tidak penting.
Keputusan utama adalah perbandingan langsung antara manusia. Dalam 75 kumpulan, seorang anggota ditugaskan sebagai mediator, dilatih untuk menulis kenyataan kumpulan dan ditawarkan bonus sehingga 50% daripada gaji asas mereka untuk setiap kenyataan yang dipilih oleh kumpulan. Dalam pusingan tersebut, kenyataan mesin lebih disukai 56% berbanding 44% manusia, dan dinilai lebih tinggi dari segi sokongan dan kualiti. Sebuah panel berasingan yang terdiri daripada 155 penilai bebas menilai kenyataan tersebut lebih jelas, lebih informatif, kurang tidak logik, dan kurang cenderung untuk menyeludup pendapat penulis sendiri.
Ini adalah penemuan yang telah tersebar, dan ia adalah yang paling sedikit boleh diharapkan. Para penulis sendiri berhati-hati di sini: mereka menyebut peluang sebenar bukanlah pengantaraan superman tetapi perbincangan yang efisien dari segi masa, adil dan boleh diperluas. Sistem ini menghasilkan kenyataan dalam beberapa saat di mana manusia mengambil masa beberapa minit. Dan dalam analisis eksploratori, para penulis mendapati konvergensi yang serupa dari pengantara manusia pada pusingan di mana manusia menang, yang menunjukkan bahawa kesan tersebut mungkin datang dari struktur yang dimediasi sebagai proses dan bukannya dari apa-apa yang khusus kepada AI. Jika tafsiran itu betul, ia menjadikan kajian ini lebih berguna dan bukannya kurang, kerana manfaatnya kemudian tersedia kepada mana-mana kumpulan yang bersedia untuk mengadopsi prosedur tersebut, dengan atau tanpa model dalam proses.
Ia direplikasi dengan sampel wakil, dan ia tidak berfungsi pada semua perkara.
Kumpulan utama direkrut secara mudah melalui platform crowdsourcing, yang merupakan perkara yang wajar untuk diragui. Oleh itu, penulis bekerjasama dengan Sortition Foundation, yang mengendalikan majlis warganegara sebenar, untuk merekrut 200 peserta yang stratifikasi untuk mewakili UK berdasarkan umur, identiti jantina, etnik, status sosioekonomi dan wilayah. Mereka berbincang dalam tiga sesi satu jam setiap minggu pada bulan April dan Mei 2023, mengenai sembilan soalan. Tahap sokongan dan peningkatan dalam persetujuan kumpulan kedua-duanya diulang.
Bahagian yang menarik adalah di mana ia tidak berfungsi. Di seluruh sembilan soalan, kedudukan bertumpu pada lima. Sokongan untuk mengurangkan populasi penjara meningkat dari 60% kepada 75%, dan untuk memudahkan kemasukan suaka dari 39% kepada 51%. Pada Brexit tidak ada pergerakan sama sekali. Mengenai penjagaan kanak-kanak percuma sejagat, pendapat bergerak ke arah yang bertentangan, dengan penentangan meningkat dari 33% kepada 41%. Proses yang menghasilkan persetujuan pada setiap soalan tanpa mengira subjek akan menjadi bukti bahawa sesuatu tidak kena. Yang ini meninggalkan kedudukan yang terpendam, yang secara kasar adalah apa yang sepatutnya dilakukan oleh perbincangan yang jujur.
Had-had, dinyatakan dengan jelas
Sebarang tuntutan yang dibina berdasarkan satu kajian harus membawa amaran kajian tersebut, dan yang ini mempunyai amaran yang sebenar. Penulis menyenaraikan kebanyakan daripadanya sendiri.
Semua orang adalah British, membincangkan soalan-soalan British.
Semua peserta adalah penduduk UK yang membincangkan dasar UK. Penulis mengatakan mereka tiada alasan khusus untuk mengharapkan penemuan ini adalah khusus untuk UK, tetapi mereka tidak mengujinya. Tiada apa-apa di sini yang telah ditunjukkan berlaku dalam budaya politik yang berbeza.
Kumpulan lima, bukan lima puluh
Setiap kumpulan terdiri daripada kira-kira lima orang. Penulis berpendapat bahawa kaedah ini secara prinsipnya boleh ditingkatkan dengan model konteks yang lebih panjang, tetapi skala tidak diuji. Hasil kumpulan kecil tidak secara automatik bertahan apabila berhubung dengan seratus peserta, dan masalah untuk mengesahkan bahawa sintesis adalah setia menjadi lebih sukar apabila input bertambah.
Ia tidak dapat memeriksa fakta, memoderasi, atau memastikan sesiapa kekal pada topik.
Dalam kata-kata penulis sendiri, jika pendapat manusia tidak berinformasi atau berbahaya, maka hasilnya mungkin tidak berinformasi atau berbahaya. Sistem ini menyintesis apa yang diberikan kepadanya. Ia tidak mempunyai pandangan sama ada mana-mana daripadanya adalah benar, dan soalan-soalan dalam kajian ini telah disemak terlebih dahulu untuk mengurangkan risiko perbincangan yang berbahaya.
Sampel latihan tidak mewakili.
Model ini telah disesuaikan dengan peserta yang diperoleh melalui sumber awam di mana golongan berumur 65 tahun ke atas kurang diwakili. Pengulangan perhimpunan ini menangani sampel penilaian, bukan data yang dipelajari oleh sistem dari preferensi.
Ia menganggap semua orang berdebat dengan ikhlas.
Prosedur ini mengambil setiap kedudukan yang ditulis pada nilai muka. Seseorang yang dengan sengaja menyatakan pandangannya secara salah untuk menarik sintesis ke arah hasil yang diutamakan tidak dimodelkan di mana-mana, dan apa yang dianggap sebagai tingkah laku strategik rasional di bawah prosedur ini adalah soalan penyelidikan yang terbuka.
AI mungkin bukan bahan aktif.
Analisis eksploratori penulis sendiri mendapati konvergensi yang setara daripada mediator manusia pada pusingan yang mereka menangi. Bacaan yang jujur adalah bahawa kajian ini menunjukkan nilai perbincangan yang terstruktur dan dimediasi, dan menunjukkan bahawa model boleh melaksanakan peranan mediasi dengan cekap dan cepat. Ia tidak membuktikan bahawa model adalah sebab ia berfungsi.
Di mana para pengkritik mempunyai hujah yang tepat
Kertas kerja itu menarik kritikan serius daripada para sarjana demokrasi deliberatif, dan sebahagian daripadanya adalah tepat. Kritikan yang paling tajam datang daripada Alvaro Oleart dan Nicolás Palomo Hernández dalam Journal of Deliberative Democracy, yang menunjukkan bahawa dalam prosedur ini peserta tidak pernah benar-benar berdebat antara satu sama lain. Mereka menulis secara peribadi, kemudian menyusun output mesin. Tiada bantahan, tiada pertukaran alasan antara orang, tiada momen di mana hujah seseorang mengubah fikiran orang lain secara langsung. Mereka menyebutnya deliberasi tanpa warganegara, dan mereka mencatatkan ironi nama itu: Habermas menganggap persetujuan sebagai prasyarat untuk wacana yang tulen, bukan sebagai sasaran untuk dioptimumkan.
Beth Simone Noveck mengemukakan bantahan yang berbeza: konsensus bukanlah bahagian yang sukar dalam tadbir urus. Kumpulan lebih sering gagal untuk bersetuju tentang apa masalahnya daripada tentang apa yang perlu dilakukan mengenainya, dan sebuah mesin yang cemerlang dalam menghasilkan persetujuan mengenai soalan yang ditetapkan dengan baik tidak membantu dengan soalan yang ditetapkan dengan buruk. Penyelidik di Knight First Amendment Institute menambah masalah pengawasan, iaitu setelah satu sintesis diambil daripada seribu pendapat, tiada manusia yang dapat mengesahkan bahawa ia mewakili mereka dengan setia.
Kami berpendapat bahawa kritikan pertama adalah yang paling penting, dan kami bersetuju dengan itu. Mengoptimumkan proses ke arah persetujuan tidak sama dengan membantu orang berfikir bersama, dan sistem yang menghasilkan konsensus dengan mengelak daripada perdebatan manusia telah menghapuskan perkara yang menjadikan perbincangan berharga pada asalnya. Penemuan yang perlu diteruskan bukanlah biarkan model menulis kedudukan kumpulan anda. Ia lebih sempit dan lebih tahan lama: kedudukan mesti jelas, struktur mengatasi peredaran, dan pusingan bantahan formal mengubah hasil. Itu tetap berlaku sama ada sintesis dilakukan oleh model, fasilitator, atau kumpulan itu sendiri.
Apa yang perlu dilakukan dengan ini pada hari Isnin
Tiada satu pun daripada empat mekanisme memerlukan AI, dan keempat-empatnya adalah perkara yang kebanyakan mesyuarat lakukan dengan salah. Kumpulkan pendapat bertulis sebelum perbincangan, bukan semasa ia berlangsung. Peserta kajian menulis kira-kira 65 perkataan setiap seorang dengan alasan mereka yang dilampirkan, yang mengambil masa sekitar lima minit kerja dan merupakan perubahan paling murah yang ada. Sintesis daripada mengedarkan. Menghantar komen semua orang adalah tepat keadaan yang tidak menghasilkan sebarang pergerakan; seseorang perlu merangka apa yang sebenarnya dipegang bersama oleh kumpulan dan meletakkannya untuk pembetulan. Putuskan dengan penarafan sama berat dan bukannya berdasarkan siapa yang masih bercakap pada akhir. Dan jadwalkan pusingan bantahan, supaya tidak bersetuju adalah tugas yang dilakukan oleh semua orang dan bukannya risiko sosial yang perlu diambil oleh seseorang.
Jika anda menjalankan perbincangan dalam talian, hasil kawalan memerlukan perhatian khusus, kerana papan perbincangan atau utas komen adalah keadaan kawalan. Ia mengedarkan pendapat dan tidak mensintesis apa-apa. Itu adalah kes struktur yang dibuat dalam alternatif papan perbincangan, dan kini ia mempunyai eksperimen yang telah didaftarkan sebelumnya di belakangnya. Struktur empat fasa dalam cara untuk menyusun perdebatan menguatkuasakan langkah yang sama secara manual, dan perbezaan antara bersetuju dan hanya tidak membantah dibincangkan dalam persetujuan vs konsensus.
Apa yang ini katakan dan tidak katakan tentang Argumentree
Kita harus tepat mengenai perkara ini, kerana godaan untuk membuat tuntutan berlebihan adalah jelas. Mesin Habermas bukanlah apa yang kami bina. Ia menghasilkan kenyataan konsensus calon menggunakan model ganjaran peribadi yang meramalkan bagaimana setiap peserta akan menilai setiap draf, dan ia memilih antara mereka dengan pilihan raya yang disimulasikan. Argumentree tidak melakukan itu, dan kajian ini tidak menguji produk kami.
Apa yang diuji adalah mekanisme di mana produk kami dibina. Posisi dicatat secara eksplisit, dengan alasan mereka, sebelum perbincangan bersatu. Hujah disusun menjadi artefak bersama daripada diedarkan sebagai tumpukan pos. Bantahan adalah tindakan kelas pertama dengan tempat untuk dilampirkan, bukannya gangguan. Posisi minoriti tetap terlihat dan dapat dipertanggungjawabkan daripada larut ke dalam pandangan majoriti. Itulah empat perkara yang diasingkan oleh kajian, dan mereka adalah empat perkara yang dilakukan oleh peta hujah terstruktur secara default. Perbezaannya adalah sintesis kami tetap boleh diperiksa: setiap tuntutan mengekalkan penulisnya, bantahannya dan sokongannya, jadi tiada siapa perlu mempercayai ringkasan yang tidak dapat mereka semak, yang merupakan masalah pengawasan yang tepat yang dibangkitkan oleh pengkritik.
Ujian
Selepas perbincangan anda yang seterusnya, tanya sama ada kedudukan sesiapa sebenarnya berubah. Jika semua orang membaca segala-galanya dan tiada siapa yang bergerak, anda tidak menjalankan perbincangan. Anda menjalankan keadaan kawalan.
Keputusan yang patut diingati
Keluarkan model, majlis warganegara dan hujah tentang sama ada AI seharusnya terlibat dalam proses politik, dan satu nombor kekal dari semua itu. Lima orang, akses penuh kepada alasan bertulis antara satu sama lain mengenai soalan yang mereka pedulikan, diukur sebelum dan selepas: P = 0.64. Cara yang paling biasa digunakan oleh kumpulan untuk mencapai persetujuan, iaitu meletakkan semua pandangan di hadapan semua orang dan membiarkan orang membaca, kini telah diuji berbanding kawalan dan tidak menghasilkan kesan yang boleh diukur.
Keadaan yang berfungsi tidak menambah maklumat baru. Setiap peserta sudah mempunyai setiap pendapat. Apa yang berubah adalah bahawa pendapat-pendapat itu diberikan bentuk, dinilai dengan berat yang sama, dan dikenakan satu pusingan bantahan formal. Itu adalah penemuan prosedural dan bukannya teknologi, dan ia tersedia kepada sesiapa yang bersedia untuk menjalankan perbincangan mereka dengan cara yang berbeza.
Kumpulan itu sudah mempunyai semua hujah. Apa yang kurang adalah struktur untuk meletakkannya.
Jalankan struktur, bukan benang
Argumentree memberikan setiap posisi tempat yang jelas, setiap bantahan tempat untuk dilampirkan, dan setiap hujah minoriti rekod yang bertahan dalam perbincangan.
Sumber
- Tessler, M. H., Bakker, M. A., Jarrett, D., Sheahan, H., Chadwick, M. J., Koster, R., Evans, G., Campbell-Gillingham, L., Collins, T., Parkes, D. C., Botvinick, M., & Summerfield, C. (2024). AI boleh membantu manusia mencari titik persamaan dalam deliberasi demokratik. Sains, 386, eadq2852.Sumber utama untuk setiap angka dalam artikel ini. Tujuh eksperimen, 5,734 peserta dari UK, diterbitkan pada 18 Oktober 2024.
- Tessler et al. (2023). Preregistration: saiz sampel, kriteria pengecualian dan analisis utama. Open Science Framework, osf.io/uy4z3.Analisis telah didaftarkan sebelum data dikumpul, itulah sebabnya keputusan kawalan dibaca sebagai ujian dan bukannya sebagai sesuatu yang diperhatikan selepas itu.
- Oleart, A., & Palomo Hernández, N. (2025). Mengapa Teknologi Penyelesaian AI Membahayakan Demokrasi dan Perbincangan: EU, Majlis Warganegara dan Mesin Habermas. Jurnal Demokrasi Perbincangan, 21(1), 1-6.Kritikan terkuat: peserta menilai output mesin daripada berdebat antara satu sama lain, yang dipanggil oleh penulis sebagai perbincangan tanpa warganegara.
- Institut Pindaan Pertama Knight. Bolehkah Mediasi AI Meningkatkan Perbincangan Demokrasi?Pada data latihan yang tidak mewakili, masalah pengawasan yang boleh diskala, dan anggapan bahawa peserta berdebat dengan ikhlas.
- Noveck, B. S. Mesin Perdamai? Bagaimana AI dapat membantu manusia mencari titik persamaan dalam perbincangan demokratik. Reboot Democracy.Berpendapat bahawa bersetuju mengenai definisi masalah, bukannya mencapai konsensus, adalah kekangan yang mengikat dalam tadbir urus sebenar.
Soalan Lazim
Apa yang sebenarnya ditemui oleh kajian Sains 2024 mengenai perbincangan yang dimediasi AI?
Ia mendapati bahawa menyusun pendapat bertulis kumpulan ke dalam kenyataan kumpulan calon, mengutamakan dengan undi berat sama, mengkritiknya dan menyusunnya semula meningkatkan persetujuan kumpulan sebanyak kira-kira lapan mata peratus, manakala hanya membiarkan peserta yang sama membaca pendapat satu sama lain tidak menghasilkan sebarang perubahan (P = 0.64). Kenyataan yang dihasilkan dengan cara ini lebih disukai berbanding yang ditulis oleh mediator manusia yang terlatih dan diberi insentif kewangan sebanyak 56% daripada masa. Kajian ini melibatkan 5,734 peserta dari UK dan telah didaftarkan lebih awal.
Adakah kajian itu membuktikan bahawa AI lebih baik daripada manusia dalam menjalankan perbincangan?
Tidak, dan penulis tidak menuntutnya. AI menghasilkan kenyataan dalam beberapa saat dan bukannya minit dan lebih disukai 56% berbanding 44%, tetapi analisis eksploratori dalam kertas yang sama mendapati konvergensi yang serupa dari mediator manusia pada pusingan yang mereka menangi. Bacaan yang paling boleh dipertahankan adalah bahawa struktur yang dimediasi adalah apa yang berfungsi, dan bahawa model boleh melaksanakan peranan memediasi dengan cekap dan cepat. Prosedur itu sendiri tidak memerlukan AI.
Adakah proses itu hanya memaksakan pandangan majoriti ke atas semua orang?
Tidak. Kenyataan kumpulan awal memberikan berat kepada kedudukan minoriti pada 0.29 berbanding dengan bahagian minoriti sebenar sebanyak 0.29, dan kenyataan selepas kritikan memberikan berat kepada mereka pada 0.36, mewakili minoriti secara berlebihan berbanding dengan saiznya. Sembilan puluh enam peratus kenyataan berada dalam julat pendapat yang sebenarnya dipegang oleh kumpulan tersebut. Sokongan memang beralih ke arah kedudukan majoriti secara keseluruhan, tetapi tiada hubungan antara seberapa kerap orang melihat kenyataan yang cenderung kepada majoriti dan seberapa banyak mereka bergerak (P = 0.37), jadi pendedahan semata-mata tidak mendorongnya.
Apakah batasan utama kajian ini?
Peserta adalah semua penduduk UK yang membincangkan soalan dasar UK; kumpulan hanya mengandungi kira-kira lima orang, jadi tiada apa yang diuji pada skala perhimpunan; sistem tidak dapat memeriksa fakta, memoderasi atau memastikan perbincangan tetap pada topik, dan penulis mencatat bahawa input yang tidak berinformasi menghasilkan output yang tidak berinformasi; sampel latihan kurang mewakili mereka yang berumur lebih 65 tahun; dan prosedur mengandaikan peserta menyatakan pandangan mereka dengan ikhlas. Penulis juga mengakui bahawa AI mungkin bukan bahan aktif, kerana mediator manusia menghasilkan konvergensi yang serupa pada pusingan yang mereka menangi.
Apakah Mesin Habermas?
Ia adalah nama yang diberikan oleh penyelidik kepada sistem mereka, sempena Jürgen Habermas, yang berpendapat bahawa persetujuan muncul apabila orang berfikir bersama dalam keadaan yang adil. Ia menggabungkan model generatif yang merangka kenyataan kumpulan calon daripada pendapat bertulis peserta dengan model ganjaran peribadi yang meramalkan bagaimana setiap peserta akan menilai setiap draf, kemudian memilih pemenang melalui pilihan raya berat sama yang disimulasikan. Ia dibina berdasarkan model Chinchilla 70B yang telah disesuaikan dengan baik, yang mengatasi Gemini 1.5 Pro yang diprompt pada tugas yang sama.
Bagaimana saya boleh memohon ini tanpa sebarang AI?
Jalankan empat langkah yang diasingkan dalam prosedur. Minta semua orang menulis posisi dan alasan mereka secara peribadi sebelum sebarang perbincangan; kira-kira 65 perkataan sudah memadai. Minta seseorang menyatukan itu menjadi satu draf tunggal tentang apa yang dimiliki kumpulan secara bersama, bukannya mengedarkan pendapat itu sendiri, kerana mengedarkannya adalah syarat yang tidak menghasilkan kesan. Pilih antara draf dengan penilaian sama berat dan bukannya berdasarkan siapa yang bercakap terakhir. Kemudian jalankan pusingan formal di mana semua orang menulis bantahan, dan semak draf berdasarkan bantahan tersebut.
Bacaan berkaitan
4 Fasa Perdebatan Produktif (dan 10 Peraturan yang Menjaganya Adil)
Prosedur yang disahkan oleh kajian ini, dilaksanakan secara manual: posisi yang jelas, pertukaran yang terstruktur, pusingan bantahan formal, dan hasil yang direkodkan.
Alternatif Papan Perbincangan: Apa yang Perlu Digunakan Sebagai Ganti dalam Kursus Dalam Talian
Papan berulir adalah keadaan kawalan kajian. Ia mengedarkan pendapat dan tidak mensintesis apa-apa. Berikut adalah apa yang perlu dijalankan sebagai ganti.
Persetujuan vs Konsensus: Yang Mana Satu Patut Anda Jalankan?
Kajian ini mengukur persetujuan. Ini adalah perbezaan antara kumpulan yang bersetuju dan kumpulan yang hanya berhenti membantah.
Cara Mengelakkan Pemikiran Kumpulan dalam Keputusan Pasukan
Mengapa konvergensi hanya merupakan tanda baik apabila struktur memudahkan perbezaan pendapat untuk dinyatakan terlebih dahulu.

