Deliberation

의견 공유는 아무것도 바꾸지 않았다: 구조화된 심의에 대한 과학 연구가 발견한 것

AT
Argumentree Team
Deliberation & Decision Science
September 2, 2026
12 min 읽다
의견 공유는 아무것도 바꾸지 않았다: 구조화된 심의에 대한 과학 연구가 발견한 것

구조화된 심의가 실제로 그룹의 생각을 변화시키나요?

2024년 10월 Science에 발표된 사전 등록된 실험(Tessler et al., Science 386, eadq2852)은 5,734명의 영국 참가자를 대상으로 이를 직접 테스트했습니다. 한 그룹의 참가자들은 논란이 되는 질문에 대한 서로의 서면 의견을 읽었고, 그룹의 합의는 전혀 변화하지 않았습니다(b = -0.005, P = 0.64). 의견이 후보 그룹 성명으로 통합되고, 순위가 매겨지고, 비판 및 수정된 유사한 그룹은 약 8% 포인트 정도 수렴했으며, 만장일치에 도달한 그룹의 비율은 22.8%에서 38.6%로 증가했습니다. 두 조건 간의 차이는 통계적으로 유의미했습니다(P = 0.0058). 통합은 저자들이 '하버마스 기계'라고 부르는 AI 시스템에 의해 수행되었으며, 이 시스템의 성명은 훈련받고 재정적 인센티브를 받은 인간 중재자의 성명보다 56%의 경우 선호되었습니다. 비판 라운드 이후에 생성된 성명은 소수 의견에 그룹의 비율보다 더 많은 비중을 부여했습니다. 저자들은 명확한 한계를 제시합니다: 참가자는 모두 영국 거주자였고, 그룹은 다섯 명만 포함되었으며, 시스템은 사실 확인이나 조정을 할 수 없고, 탐색적 분석에서는 인간 중재자들로부터 유사한 수렴이 발견되어 효과가 AI 특정에서 오는 것이 아니라 중재된 심의 과정에서 올 수 있음을 시사합니다. 토론을 진행하는 사람에게 실질적인 발견은 의견을 교환하는 것이 합의를 생성하는 메커니즘이 아니라는 것입니다; 이를 구조화하고 명시적인 반대 라운드를 진행하는 것이 그렇습니다.

Share:
요약

2024년 10월, Science는 거의 아무도 주목하지 않은 통제 조건을 포함한 5,734명의 참가자가 참여한 사전 등록된 실험을 발표했습니다. 한 그룹은 단순히 서로의 분열적인 정치적 질문에 대한 의견을 읽었습니다. 그들의 동의 수준은 전혀 변하지 않았습니다. 같은 의견이 후보자 그룹 성명으로 구조화되고, 순위가 매겨지고, 비판 및 수정된 그룹은 8퍼센트 포인트만큼 수렴하였으며, 만장일치가 거의 두 배로 증가했습니다. 자유로운 의견 교환이 공통의 기반을 만드는 것은 아닙니다. 구조가 그렇습니다.

  • 통제 결과는 발견입니다. 서로의 의견을 읽는 것은 그룹 합의를 b = -0.005 (P = 0.64)만큼 이동시켰습니다. 동일한 의견을 구조화하는 것은 8 퍼센트 포인트만큼 이동시켰습니다 (세 개의 집단 모두에서 P < 0.001).
  • 일치율이 22.8%에서 38.6%로 증가했습니다, 그리고 66.6%의 참가자들이 그룹의 진술이 자신의 원래 표현보다 더 잘 반영되었다고 말했습니다.
  • 비평 라운드는 인과적이며, 인공물이 아닙니다. 245명의 별도 집단에서, 비평을 진정으로 반영한 수정본이 비평을 비밀리에 무시한 수정본보다 우수한 성과를 보였습니다 (P = 0.0039).
  • 구조가 소수를 보호했다. 비판 이후의 발언은 소수 의견을 0.36으로 평가했으며, 이는 실제 비율인 0.29에 비해 높았다. 이것은 다수의 지배가 아니었다.
  • 정직한 한계: 영국 참가자만, 다섯 명의 그룹, 사실 확인 없음, 그리고 인간 중재자가 그들이 이긴 라운드에서 유사한 수렴을 생성했습니다. 이 메커니즘은 AI가 아닌 구조 자체에 의해 매개될 수 있습니다.

다섯 명의 낯선 사람들이 논란이 되는 질문을 받았다. 국민 건강 서비스는 민영화되어야 할까? 투표 연령은 16세로 낮춰야 할까? 그들 각각은 자신의 솔직한 입장을 개인적으로, 자신의 말로, 적당한 길이로 작성했다. 그런 다음 그들은 다른 네 사람이 쓴 내용을 읽었다. 그들의 입장은 처음과 나중에 측정되었다.

아무것도 움직이지 않았다. 조금도, 잘못된 방향으로도, 중요하지 않을 정도로 작은 양으로도. 집단 동의의 측정된 변화는 -0.005였고, p-값은 0.64로, 실험이 보고할 수 있는 것 중에서 문자 그대로 아무것도 아닌 것에 가장 가까웠다.

이것은 2024년 10월 18일 Science에 발표된 연구의 통제 조건이었습니다. 동일한 질문과 동일한 시간 동안 주어진 비교 가능한 그룹들은 그들의 서면 의견이 대신 후보 그룹 성명으로 종합되고, 순위가 매겨지고, 비판받고, 수정되는 방식으로 약 8% 포인트 수렴했습니다. 만장일치에 도달한 그룹의 비율은 22.8%에서 38.6%로 증가했습니다. 이 연구는 일반적으로 AI가 인간 중재자를 이긴 이야기로 보도됩니다. 훨씬 더 유용한 결과는 헤드라인에 오르지 않은 것입니다: 의견을 교환하는 것은 공통의 기반을 생성하지 않습니다. 그것들을 구조화하는 것이 생성합니다.

사람들이 서로의 의견을 읽게 하는 것은 그룹의 합의도를 0.5% 포인트 낮추었다.
그러한 의견을 구조화하는 것은 그것을 여덟 번 옮겼다.

Tessler et al., Science 386, eadq2852 (2024) — 의견 노출 집단 대 주요 과제 집단

연구가 실제로 한 것

이 논문은 AI가 민주적 토론에서 인간이 공통점을 찾는 데 도움을 줄 수 있다는 제목으로 Michael Henry Tessler, Michiel Bakker 및 Google DeepMind, 옥스포드, 하버드의 동료들이 작성했습니다. 이 논문은 2023년 1월부터 8월 사이에 진행된 7개의 실험을 보고하며, 총 5,734명의 영국 참가자가 포함되었습니다. 샘플 크기, 제외 기준 및 주요 분석은 데이터 수집 전에 사전 등록되었으며, 코드는 공개되었습니다. 사전 등록, 진정한 통제 조건, Science에의 게재 및 공개 코드의 조합은 이 분야에서 충분히 드물기 때문에 명확히 언급할 가치가 있습니다.

참가자들은 약 5명씩 그룹을 이루어 약 한 시간 동안 세 가지 질문에 대해 논의했습니다. 각 질문에 대한 절차는 고정되어 있었습니다. 모든 참가자는 먼저 자신의 입장을 개인적으로 작성했으며, 글자 수는 10에서 200자 사이로 평균 약 65자였습니다. 작성된 의견은 저자들이 하버마스 기계라고 명명한 시스템으로 전달되었습니다. 이 시스템은 공정한 조건에서 사람들이 함께 추론할 때 합의가 나타난다고 주장한 철학자의 이름을 따온 것입니다. 시스템은 그룹의 공통된 입장을 나타내는 여러 후보 진술을 초안했습니다. 참가자들은 이를 순위 매겼고, 승자는 모든 참가자의 투표가 동등하게 반영되는 순위 선택 선거를 통해 결정되었습니다. 승리한 진술은 다시 그룹으로 돌아갔고, 각 참가자는 그에 대한 비평을 개인적으로 작성했습니다. 이후 시스템은 이러한 비평을 바탕으로 수정된 초안을 작성했습니다. 참가자들은 다시 순위를 매기고 최종적으로 원본과 수정된 버전 중에서 선택했습니다.

두 가지 세부사항은 기억할 가치가 있다. 참가자들은 진술이 기계 생성된 것이라고 들었으므로 속임수는 없었다. 그리고 질문 자체는 이민, 은퇴 연령, 수감자 수, 브렉시트, 기후 목표 및 최저 임금을 다루는 의도적으로 논란이 되는 주제였다. 이들은 합의를 쉽게 만들기 위해 선택된 준비 주제가 아니었다.

절차가 수행한 네 가지 사항

기계 학습을 제외하면 절차는 네 가지 단계로 구성됩니다. 각 단계는 공유 문서와 약간의 규율이 있는 모든 그룹에서 사용할 수 있습니다.

모두가 다른 사람의 이야기를 듣기 전에 자신의 입장을 고수합니다.

의견은 개인적으로 작성되었으며, 완전한 문장으로 이유가 첨부되었습니다. 아무도 먼저 말하지 않았고 방의 분위기를 주도하지 않았으며, 아무도 가장 자신감 있어 보이는 사람에게 조용히 동의할 선택권이 없었습니다. 각 사람이 실제로 생각한 것에 대한 서면 기록이 사회적 압력이 작용하기 전에 존재했습니다.

위치들은 목록에 쌓이지 않고 하나의 아티팩트로 통합됩니다.

이것은 대조군이 받지 못한 단계입니다. 그들은 다섯 가지 의견을 모두 포함한 동일한 정보를 개별 텍스트의 형태로 받았습니다. 치료 그룹은 그룹이 실제로 어떤 입장에 있는지를 나타내는 단일 초안 성명서로 정보를 받았습니다. 동일한 정보, 다른 구조, 그리고 두 가지 중 오직 하나만이 변화를 만들어냈습니다.

선택은 동등한 비중을 가진 순위 투표입니다.

우승 발언은 모든 참가자의 순위를 집계하여 선택되었으며, 각 참가자는 한 표씩 투표했습니다. 누구의 선호도도 더 큰 소리, 더 빠름, 더 높은 직급 또는 더 유창하다고 해서 더 많은 비중을 두지 않았습니다. 이것은 설명하기는 매우 쉽지만 실제 회의에서 일관되게 실행하기는 어려운 부분입니다.

이의 제기를 위한 공식적인 절차가 있으며, 초안은 변경되어야 합니다.

각 참가자는 승리한 진술에 대해 개인적으로 비평을 했고, 그 비평은 수정 작업에 반영되었다. 반대는 방해나 사회적 위험이 아니라, 모든 사람이 수행하는 예정된 단계였다. 세 개의 집단에서 68%, 64% 및 66%의 참가자가 수정된 진술을 원본보다 선호했다.

왜 통제 조건이 중요한 결과인지

이와 같은 연구에 대한 합리적인 반론은 사람들이 결국 다른 사람들이 생각하는 것을 들었기 때문에 의견이 수렴한다는 것이다. 저자들은 이를 예상하고 실험을 진행했다. 75개 그룹의 372명 참가자로 구성된 추가 집단이 동일한 연습을 수행했는데, 이들은 초안으로 작성된 그룹 성명을 평가하는 대신 서로의 개별 의견을 평가했다. 그룹 내 모든 의견에 완전히 노출되었고, 종합은 없었다.

그 조건에서 그룹의 합의는 변하지 않았습니다 (b = -0.005, t(230) = -0.46, P = 0.64), 그리고 두 조건 간의 차이는 통계적으로 유의미했습니다 (P = 0.0058). 이는 Science에 발표된 통제된 사전 등록 결과로, 모든 사람의 의견을 순환시키는 것이 그룹을 합의로 이끌지 않는다는 것을 보여줍니다. 이는 문헌에서 댓글 스레드에 대한 직접적인 테스트에 가장 가까운 것이며, 댓글 스레드는 이를 통과하지 못했습니다.

메커니즘의 다른 절반도 똑같이 신중하게 테스트되었습니다. 수정된 진술은 사람들이 약간 더 많은 노력을 투자한 후 두 번째로 보았기 때문에 선호될 수 있습니다. 그래서 저자들은 245명의 참가자로 구성된 추가 집단을 운영하여 비평을 작성하게 한 후, 그 비평을 실제로 반영한 초안과 반영하지 않은 초안을 보여주었습니다. 진정으로 비평에 기반한 버전이 여전히 승리했습니다 (P = 0.0039). 반대 의견 단계는 실제로 중요한 역할을 합니다.

구조는 소수를 평평하게 만들지 않았다. 오히려 그것을 증폭시켰다.

합의 추구 과정에 대한 명백한 두려움은 그것이 더 나은 매너로 다수결이 되는 것이라는 점이다. 저자들은 이를 주장하기보다는 측정하였으며, 모든 의견과 모든 진술을 벡터 공간에 포함시켜 각 질문에 대한 동의에서 불일치까지의 축을 따라 위치시켰다.

대략 77%의 경우 그룹은 진정으로 나뉘어 시작했습니다. 초기 그룹 진술은 소수 의견을 0.29로 가중치 부여했으며, 이는 실제 평균 소수 점유율 0.29와 거의 정확히 비례하는 수치입니다. 비판 라운드 이후 작성된 수정된 진술은 이들을 0.36으로 가중치 부여했습니다. 소수 의견은 그 크기에 비해 과대표현되었고, 그룹은 어쨌든 그 수정된 진술을 선호했습니다. 그룹 진술의 96%는 그룹의 자체 의견이 실제로 포함된 범위 내에 있었으므로, 시스템은 아무도 가지고 있지 않은 입장을 만들어내지 않았습니다.

지원은 여전히 전반적으로 다수의 입장으로 이동했으며, 저자들은 그렇게 말합니다. 다수는 29%에서 32%의 라운드에서 증가했고, 소수는 20%에서 26%로 증가했습니다. 그러나 사람들이 단순히 다수 지향적인 발언을 보여주었기 때문에 다수 쪽으로 이동했는지를 테스트했을 때, 전혀 관계가 없음을 발견했습니다(P = 0.37). 사람들을 움직인 것은 주장의 내용이었지, 그것에 대한 반복적인 노출이 아니었습니다.

기계의 첫 번째 초안은 대다수와 정확히 일치했다.
한 차례의 이의 제기 후, 소수자를 과대 대표했다.

소수자 가중치는 실제 소수자 비율 0.29에 대해 0.29에서 0.36으로 상승했습니다.

그것은 인간 중재자들을 이겼고, 그것이 가장 중요하지 않다.

헤드라인 결과는 사람들과의 직접 대결이었습니다. 75개 그룹에서 한 명의 구성원이 중재자로 지정되어 그룹 성명을 작성하도록 훈련받았으며, 그룹이 선호하는 각 성명에 대해 기본 급여의 최대 50%의 보너스를 제공받았습니다. 이러한 라운드에서 기계의 성명은 56%의 비율로 인간의 44%보다 선호되었으며, 지지와 품질 모두에서 더 높은 평가를 받았습니다. 155명의 독립 평가자로 구성된 별도의 패널은 이 성명들이 더 명확하고, 더 유익하며, 덜 비논리적이고, 작가의 개인 의견이 포함될 가능성이 적다고 판단했습니다.

이것은 이동한 발견이며, 가장 덜 의존해야 할 것입니다. 저자들 스스로도 여기서 조심스럽습니다: 그들은 진정한 기회를 초인적인 중재가 아니라 시간 효율적이고 공정하며 확장 가능한 심의라고 부릅니다. 이 시스템은 인간이 몇 분이 걸리는 동안 몇 초 만에 진술을 생성했습니다. 그리고 탐색적 분석에서 저자들은 인간이 이긴 라운드에서 인간 중재자들 간의 유사한 수렴을 발견했으며, 이는 그 효과가 AI에 특정한 것에서 오는 것이 아니라 중재된 구조가 과정으로서 오는 것일 수 있음을 시사합니다. 만약 이 해석이 맞다면, 연구는 덜 유용하기보다는 더 유용해지며, 그 혜택은 절차를 채택할 의향이 있는 모든 그룹이 이용할 수 있게 됩니다. 모델이 있든 없든 말입니다.

대표 샘플로 복제되었고, 모든 것에 대해 작동하지 않았습니다.

주요 집단은 편의에 의해 크라우드소싱 플랫폼을 통해 모집되었으며, 이는 의심할 만한 점이 있습니다. 그래서 저자들은 실제 시민 회의를 운영하는 Sortition Foundation과 협력하여 연령, 성 정체성, 인종, 사회경제적 지위 및 지역을 대표하도록 계층화된 200명의 참가자를 모집했습니다. 그들은 2023년 4월과 5월에 걸쳐 9개의 질문에 대해 주 1회 1시간씩 총 3회의 토론을 진행했습니다. 지지 수준과 집단 합의의 증가는 모두 재현되었습니다.

흥미로운 부분은 작동하지 않았던 곳입니다. 아홉 개 질문 중 다섯 개에서 입장이 수렴되었습니다. 교도소 인구 감소에 대한 지지는 60%에서 75%로 증가했고, 망명 입국 완화에 대한 지지는 39%에서 51%로 증가했습니다. 브렉시트에 대해서는 전혀 변화가 없었습니다. 보편적인 무료 육아 지원에 대해서는 반대가 33%에서 41%로 증가하며 반대 방향으로 의견이 이동했습니다. 주제에 관계없이 모든 질문에 대한 합의를 이끌어내는 과정은 뭔가 잘못되고 있다는 증거가 될 것입니다. 이 과정은 고착된 입장을 고착시켰으며, 이는 솔직한 심의가 해야 할 대략적인 일입니다.

한정 사항, 명확하게 진술됨

단일 연구에 기반한 모든 주장은 해당 연구의 주의사항을 포함해야 하며, 이 연구에는 실제 주의사항이 있습니다. 저자들이 대부분의 주의사항을 스스로 나열하고 있습니다.

모두 영국인이었고, 영국 문제에 대해 논의하고 있었다.

모든 참가자는 영국 거주자로 영국 정책에 대해 논의했습니다. 저자들은 결과가 영국에만 해당될 것이라고 기대할 특별한 이유는 없지만, 이를 테스트하지는 않았습니다. 여기서 제시된 내용은 다른 정치 문화에서도 적용된다고 보여지지 않았습니다.

다섯 개의 그룹, 오십 개가 아닌

각 그룹은 대략 다섯 명이었습니다. 저자들은 이 방법이 원칙적으로 긴 맥락 모델과 함께 확장된다고 주장하지만, 규모는 테스트되지 않았습니다. 소규모 그룹의 결과는 백 명의 참가자와 접촉한다고 해서 자동으로 유지되지 않으며, 입력이 증가함에 따라 합성이 충실하다는 것을 검증하는 문제는 훨씬 더 어려워집니다.

사실 확인, 조정 또는 누구를 주제에 맞게 유지할 수 없습니다.

저자들의 말에 따르면, 인간의 의견이 잘못된 정보에 기반하거나 해로운 경우, 결과물도 잘못된 정보에 기반하거나 해로울 수 있습니다. 시스템은 주어진 정보를 종합합니다. 그것이 진실인지 여부에 대한 의견은 없으며, 연구의 질문은 해로운 논의의 위험을 줄이기 위해 사전 검토되었습니다.

훈련 샘플이 대표적이지 않았습니다.

모델은 65세 이상의 참가자가 과소 대표된 크라우드소싱 참가자들로 조정되었습니다. 조립 복제는 시스템이 선호도를 학습한 데이터가 아니라 평가 샘플을 다룹니다.

모두가 진지하게 논쟁하고 있다고 가정합니다.

이 절차는 각 서면 입장을 있는 그대로 받아들입니다. 선호하는 결과로 합성을 끌어내기 위해 의도적으로 자신의 견해를 잘못 진술하는 사람은 어디에도 모델링되지 않으며, 이 절차 하에서 합리적인 전략적 행동으로 간주되는 것은 열린 연구 질문입니다.

AI가 활성 성분이 아닐 수도 있습니다.

저자들의 탐색적 분석에 따르면, 그들이 이긴 라운드에서 인간 중재자들 간의 유사한 수렴이 발견되었습니다. 솔직한 해석은 이 연구가 구조화된 중재적 심의의 가치를 보여주며, 모델이 중재 역할을 능숙하고 신속하게 수행할 수 있음을 입증한다는 것입니다. 그러나 이 모델이 효과의 원인이라는 것을 입증하지는 않습니다.

비평가들이 일리가 있는 부분

이 논문은 심의 민주주의 학자들로부터 심각한 비판을 받았으며, 그 중 일부는 타당하다. 가장 날카로운 비판은 Journal of Deliberative Democracy의 알바로 올레아르트와 니콜라스 팔로모 에르난데스에게서 나오며, 이 절차에서 참여자들이 실제로 서로 논쟁하지 않는다고 지적한다. 그들은 개인적으로 글을 쓰고, 기계 출력에 순위를 매긴다. 반박이 없고, 사람들 간의 이유 교환이 없으며, 한 사람의 주장이 다른 사람의 마음을 직접 바꾸는 순간이 없다. 그들은 이를 시민 없는 심의라고 부르며, 이름의 아이러니를 지적한다: 하버마스는 합의를 진정한 담론의 전제조건으로 간주했지, 최적화할 목표로 보지 않았다.

베스 시몬 노벡은 다른 반론을 제기합니다: 합의는 거버넌스의 어려운 부분이 아닙니다. 그룹은 문제에 대한 합의보다 문제를 해결하는 방법에 대한 합의에 더 자주 실패합니다. 잘 정의된 질문에 대한 합의를 잘 만들어내는 기계는 잘못 정의된 질문에 대해서는 도움이 되지 않습니다. 나이트 제1 수정헌법 연구소의 연구자들은 감독 문제를 추가하는데, 이는 천 개의 의견에서 종합이 도출되면, 어떤 인간도 그것이 충실하게 대표하고 있는지를 검증할 수 없다는 것입니다.

우리는 첫 번째 비판이 가장 중요하다고 생각하며, 이에 동의합니다. 합의에 맞춰 프로세스를 최적화하는 것은 사람들이 함께 추론하는 것을 돕는 것과 같지 않으며, 인간의 논쟁을 우회하여 합의를 생성하는 시스템은 처음에 심의가 가치 있었던 것을 제거했습니다. 앞으로 나아가야 할 발견은 모델이 당신 그룹의 입장을 작성하게 하라가 아닙니다. 그것은 더 좁고 더 지속적입니다: 입장은 명확해야 하며, 구조가 순환을 이깁니다, 그리고 공식적인 반대의 한 차례가 결과를 변화시킵니다. 이러한 사항은 합성이 모델, 진행자 또는 그룹 자체에 의해 이루어지든 관계없이 적용됩니다.

월요일에 이걸 어떻게 할까요?

네 가지 메커니즘 중 어느 것도 AI를 필요로 하지 않으며, 네 가지 모두 대부분의 회의에서 잘못되는 사항입니다. 토론 중이 아니라 토론 전에 서면 입장을 수집하세요. 연구 참가자들은 각자 약 65단어의 이유를 첨부하여 작성했으며, 이는 약 5분의 작업으로 가장 저렴한 변화입니다. 순환하기보다는 종합하세요. 모든 사람의 의견을 전달하는 것은 전혀 진전을 이루지 못하게 하는 조건입니다; 누군가는 그룹이 실제로 공통적으로 가지고 있는 내용을 초안으로 작성하고 수정할 수 있도록 해야 합니다. 마지막에 누가 여전히 이야기하고 있는지에 따라 결정하지 말고 동등한 가중치 순위로 결정하세요. 그리고 반대 의견을 제시하는 시간을 정하세요, 그래서 이견을 제시하는 것이 누군가가 감수해야 할 사회적 위험이 아니라 모든 사람이 수행하는 작업이 되도록 합니다.

온라인 토론을 진행한다면, 통제 결과는 특히 주목할 만합니다. 왜냐하면 토론 게시판이나 댓글 스레드는 통제 조건이기 때문입니다. 이는 의견을 순환시키고 아무것도 종합하지 않습니다. 이것이 토론 게시판 대안에서 제시된 구조적 사례이며, 이제 그 뒤에는 사전 등록된 실험이 있습니다. 토론 구조화 방법의 네 단계 구조는 동일한 절차를 수동으로 강제하며, 동의와 단순히 반대하지 않는 것의 구분은 동의 대 합의에서 다루어집니다.

이것이 Argumentree에 대해 말하는 것과 말하지 않는 것

우리는 이 점에 대해 정확해야 합니다. 과도한 주장을 할 유혹이 분명하기 때문입니다. 하버마스 기계는 우리가 만든 것이 아닙니다. 그것은 개인화된 보상 모델을 사용하여 각 참가자가 각 초안을 어떻게 평가할지를 예측하고, 그들 사이에서 모의 선거를 통해 선택하여 후보 합의 문장을 생성합니다. 아규먼트리(Argumentree)는 그렇게 하지 않으며, 이 연구는 우리의 제품을 테스트하지 않습니다.

우리가 테스트하는 것은 우리 제품이 기반하고 있는 메커니즘입니다. 논의가 수렴되기 전에 포지션이 그 이유와 함께 명시적으로 기록됩니다. 주장은 게시물의 스택으로 순환되는 것이 아니라 공유 아티팩트로 구조화됩니다. 이의 제기는 중단이 아니라 부착할 수 있는 첫 번째 클래스의 행동입니다. 소수의 입장은 다수의 견해로 녹아들기보다는 가시적이고 귀속될 수 있습니다. 이것이 연구에서 분리된 네 가지이며, 구조화된 논증 맵이 기본적으로 수행하는 네 가지입니다. 차이점은 우리의 합성이 검토 가능하다는 것입니다: 모든 주장은 저자, 이의 제기 및 지지를 유지하므로, 아무도 확인할 수 없는 요약을 신뢰할 필요가 없으며, 이는 비평가들이 제기하는 정확한 감독 문제입니다.

테스트

다음 논의 후에 누군가의 입장이 실제로 바뀌었는지 물어보세요. 모두가 모든 것을 읽었고 아무도 움직이지 않았다면, 당신은 심의를 진행하지 않은 것입니다. 당신은 통제 조건을 진행한 것입니다.

기억할 가치가 있는 결과

모델, 시민 회의 및 AI가 정치 과정에 가까이 있어야 하는지에 대한 주장을 제거하면, 하나의 숫자가 모든 것을 남깁니다. 다섯 명이 서로의 관심 있는 질문에 대한 서면 추론을 완전히 접근할 수 있었고, 측정 전후: P = 0.64. 그룹이 합의에 도달하려고 시도하는 가장 일반적인 방법인 모든 의견을 모두에게 제시하고 사람들이 읽도록 하는 방식은 이제 대조군과 비교하여 테스트되었고 측정 가능한 효과를 내지 못했습니다.

작동한 조건은 새로운 정보를 추가하지 않았다. 모든 참가자는 이미 모든 의견을 가지고 있었다. 변화한 것은 의견이 형태를 부여받고, 동등한 비중으로 순위가 매겨지며, 하나의 공식적인 반대 절차를 거쳤다는 것이다. 이는 기술적인 발견이 아니라 절차적인 발견이며, 토론을 다르게 진행할 의지가 있는 누구에게나 적용될 수 있다.

그 그룹은 이미 모든 주장을 가지고 있었다. 부족한 것은 그것들을 정리할 구조였다.

구조를 실행하고, 스레드는 실행하지 마세요.

Argumentree는 모든 입장에 명확한 위치를 제공하고, 모든 반대 의견에 부착할 수 있는 장소를 제공하며, 모든 소수 의견에 논의가 끝난 후에도 남는 기록을 제공합니다.

출처

자주 묻는 질문

2024년 과학 연구에서 AI 매개 토론이 실제로 무엇을 발견했나요?

그룹의 서면 의견을 후보 그룹 성명으로 구조화하고, 동등 가중 투표로 순위를 매기고, 비판하고 재작성하는 것이 그룹의 합의도를 약 8퍼센트 포인트 증가시킨 반면, 같은 참가자들이 서로의 의견을 읽도록 하는 것만으로는 전혀 변화가 없었다(P = 0.64). 이렇게 생성된 성명서는 훈련을 받고 금전적 인센티브를 받은 인간 중재자가 작성한 성명서보다 56% 더 선호되었다. 이 연구에는 5,734명의 영국 참가자가 포함되었으며, 사전 등록되었다.

이 연구가 AI가 사람보다 토론을 더 잘 운영한다는 것을 증명하나요?

아니요, 저자들은 그렇게 주장하지 않습니다. AI는 몇 분이 아닌 몇 초 만에 진술을 생성했으며, 56% 대 44%로 선호되었습니다. 그러나 같은 논문에서 실시된 탐색적 분석에서는 인간 중재자들이 이긴 라운드에서 유사한 수렴을 발견했습니다. 가장 방어 가능한 해석은 중재된 구조가 효과적이며, 모델이 중재 역할을 능숙하고 빠르게 수행할 수 있다는 것입니다. 절차 자체는 AI를 필요로 하지 않습니다.

그 과정이 단지 다수의 의견을 모든 사람에게 강요한 것인가요?

아니요. 초기 그룹 진술은 실제 소수 지분 0.29에 대해 소수 위치를 0.29로 가중하였고, 비판 후 진술은 이를 0.36으로 가중하여 소수의 크기에 비해 과대 대표하였습니다. 진술의 96%는 그룹이 실제로 가진 의견의 범위 내에 있었습니다. 전반적으로 지지율은 다수 위치로 이동하였지만, 사람들이 다수 지향 진술을 얼마나 자주 보았는지와 그들이 얼마나 이동했는지 사이에는 관계가 없었습니다(P = 0.37), 따라서 노출만으로는 이를 설명할 수 없었습니다.

연구의 주요 한계는 무엇인가요?

참가자들은 모두 영국 거주자로 영국 정책 질문에 대해 논의하였으며, 그룹은 약 5명 정도로 구성되어 있어 대규모 집합에서 테스트된 것은 없었습니다. 시스템은 사실 확인, 조정 또는 논의를 주제에 맞게 유지할 수 없으며, 저자들은 잘못된 정보에 기반한 입력이 잘못된 정보에 기반한 출력을 생성한다고 언급합니다. 훈련 샘플은 65세 이상의 인구를 충분히 대표하지 않았으며, 절차는 참가자들이 자신의 의견을 진지하게 표현한다고 가정합니다. 저자들은 또한 AI가 핵심 요소가 아닐 수 있다고 인정하는데, 인간 중재자들이 그들이 이긴 라운드에서 유사한 수렴을 이끌어냈기 때문입니다.

하버마스 기계란 무엇인가?

연구자들이 그들의 시스템에 붙인 이름은 유르겐 하버마스(Jürgen Habermas)에서 따온 것으로, 그는 사람들이 공정한 조건에서 함께 추론할 때 합의가 발생한다고 주장했습니다. 이 시스템은 참가자들의 서면 의견에서 후보 그룹 성명을 작성하는 생성 모델과 각 참가자가 각 초안을 어떻게 평가할지를 예측하는 개인화된 보상 모델을 결합하여, 시뮬레이션된 동등 가중치 선거를 통해 승자를 선택합니다. 이 시스템은 같은 작업에서 프롬프트된 제미니 1.5 프로(Gemini 1.5 Pro)를 능가한 미세 조정된 친칠라 70B 모델을 기반으로 구축되었습니다.

AI 없이 어떻게 이걸 적용하나요?

네 가지 동작을 절차적으로 실행하세요. 모든 사람이 논의 전에 자신의 입장과 이유를 비공식적으로 작성하게 하세요; 대략 65단어면 충분합니다. 누군가 그 내용을 그룹이 공통으로 가지고 있는 단일 초안으로 통합하게 하세요. 의견을 순환시키는 것은 효과를 내지 못한 조건이기 때문에 의견 자체를 순환시키지 마세요. 마지막으로 말하는 사람이 아니라 동등한 가중치의 순위를 통해 초안 중에서 선택하세요. 그런 다음 모든 사람이 이의를 제기하는 공식적인 라운드를 진행하고, 그에 따라 초안을 수정하세요.

관련 읽기