Argument Mining

Teaching Machines to Read Arguments: The Decade of Annotated Corpora

AT
Argumentree Team
Decision Science
July 29, 2026
10 min 읽다
Teaching Machines to Read Arguments: The Decade of Annotated Corpora

주장을 읽도록 기계 가르치기: 주석이 달린 말뭉치의 10년 | Argumentree

주장 채굴은 측정 가능한 계산 작업이 되기 전 수십 년 동안 이론으로 존재해 왔습니다. 이를 변화시킨 것은 주석 작업이었습니다: 사람들이 수천 개의 문서에 앉아 손으로 어떤 부분이 주장인지, 어떤 부분이 전제인지, 그리고 어떤 것이 어떤 것을 지지하거나 공격하는지를 표시했습니다. Christian Stab와 Iryna Gurevych는 이러한 방식으로 설득력 있는 에세이에 주석을 달아 일반적으로 AAEC라고 불리는 말뭉치를 생성했습니다. Andreas Peldszus와 Manfred Stede는 주장 구조를 연구하기 위해 특별히 짧은 논쟁적 마이크로텍스트의 말뭉치를 구축했습니다. Joonsuk Park와 Claire Cardie는 미국 규제 제정에 제출된 공공 의견에 주석을 달았는데, 이는 훨씬 더 복잡한 장르입니다. 어려움은 단순히 라벨링 작업에만 있는 것이 아니었습니다 — 인간 주석자들이 주장에 대해 동의하지 않기 때문에, 인간이 동의하지 않는 작업은 신뢰할 수 있게 평가될 수 없습니다. 따라서 주석자 간의 합의는 전체 분야의 문지기가 되었습니다: 이는 기계 성능의 실질적인 한계를 정의합니다. 왜냐하면 모델은 평가되는 주석보다 더 일관되게 측정될 수 없기 때문입니다. 말뭉치는 또한 이 분야의 영구적인 비대칭성을 드러냈습니다 — 논쟁적 구성 요소를 식별하는 것은 수월했지만, 그들 간의 관계를 식별하는 것은 그렇지 않았습니다.

Share:
요약

기계가 주장을 찾는 방법을 가르칠 수는 없으며, 인간이 주장이 무엇인지에 대해 합의할 수 있을 때까지는 불가능하다. 그것이 어려운 부분으로 드러났고, 이후 이 분야에서 측정한 모든 것에 영향을 미쳤다.

  • 주장 채굴은 사람들이 수천 개의 문서—주장, 전제, 그리고 그들 사이의 연결고리—에 수작업으로 주석을 달았을 때 비로소 실제 분야가 되었다.
  • 주석자들 간의 의견 차이가 있으며, 특히 관계에 대해 그렇습니다. 주석자 간 합의는 게이트키퍼가 되었는데, 이는 어떤 모델이 얼마나 잘 평가될 수 있는지를 제한하기 때문입니다.
  • 세 가지 말뭉치가 이 10년을 형성했다: 설득력 있는 에세이, 논쟁적인 마이크로텍스트, 그리고 공공 규제 제정에 대한 의견 — 깔끔한 것부터 지저분한 것까지.
  • 모든 말뭉치는 장르입니다. 학생 에세이에 대해 훈련된 모델은 회의 기록으로 전이되지 않으며, 오랫동안 회의 기록 말뭉치가 없었습니다.
  • 코퍼스는 영구적인 비대칭성을 드러냈다: 구성 요소를 찾는 것은 수월하지만, 관계를 찾는 것은 그렇지 않다.

두 전문가, 한 단락, 두 가지 다른 답변

두 명의 훈련된 주석자에게 학생 에세이의 같은 단락을 주고 간단한 질문을 하세요: 어떤 문장이 주장이고, 어떤 문장이 그에 대한 이유인지? 그들은 종종 의견이 다를 것입니다. 주제에 대해서도, 주장이 좋은지에 대해서도 아니라, 그것이 어디에 있는지에 대해 다를 것입니다.

이것은 계산적 논증 채굴의 첫 번째 10년을 형성한 사실이며, 과소평가하기 쉽습니다. 모든 하위 작업은 이에 의존합니다: 사람들이 일관되게 수행할 수 없는 작업에 대한 벤치마크를 구축할 수 없으며, 인간이 공유하지 않는 판단에 대해 모델이 인간 성능을 초월한다고 주장할 수 없습니다.

마지막 이메일 스레드에서 직접 시도해 보세요. 주장을 표시하는 것은 보통 쉽습니다. 각 반대 의견이 어떤 문장을 겨냥했는지를 표시하는 것이 당신이 주저하기 시작하는 부분입니다 — 그리고 그 주저함이 이 10년의 전체 이야기입니다.

이론이 20년 동안 사용되지 않은 이유

1990년대 초까지 이론적 장치가 완성되었습니다. 툴민은 이 분야에 해부학을 제공했고, 월튼은 추론 패턴의 목록을 제공했으며, 프리먼은 결론을 공격하는 것과 그 결론에 대한 추론을 공격하는 것의 구별을 제시했습니다. 이 시리즈의 첫 번째 포스트에서 다룬 바와 같이, 주장은 레이블이 붙은 그래프로 재설명되었습니다.

라벨이 붙은 그래프는 원칙적으로 컴퓨터가 점수를 받을 수 있는 것입니다. 실제로는 점수를 매길 기준이 필요합니다. 주석이 달린 데이터가 없으면 서로 다른 결과를 주장하는 두 연구 그룹은 이를 해결할 방법이 없으며, 결과를 비교할 수 없는 분야는 진정한 분야가 아닙니다. 그것은 데모의 모음입니다.

따라서 주장을 채굴하는 것을 학문으로 발전시킨 10년은 알고리즘의 10년이 아니었습니다. 그것은 주석 가이드라인의 10년이었습니다.

작업을 정의한 세 가지 말뭉치

다양한 연구 그룹이 서로 다른 장르를 주석 달았으며, 장르 선택은 누구나 처음 예상했던 것보다 더 중요했다.

  • 설득력 있는 에세이 (Stab & Gurevych). 주장, 전제 및 그들 간의 지지/공격 관계에 대해 주석이 달린 학생의 논쟁 에세이. 명확하게 주장을 하려고 명시적으로 노력한 사람들에 의해 구조화된 글쓰기 — 텍스트가 얻을 수 있는 것 중에서 가장 유리한 경우입니다.
  • 주장적 마이크로텍스트 (Peldszus & Stede). 주장 구조를 연구하기 위해 특별히 제작된 짧고 통제된 텍스트로, 각각은 의도된 형태를 가진 간결한 주장입니다. 작고 깔끔하며 구조적 질문에 대한 답변이 있도록 설계되었습니다.
  • 공공 규제 제정 의견 (박 & 카르디). 미국 규제 상담에 제출된 대중의 의견. 실제로, 수정되지 않은, 자주 산만한 — 조직들이 실제로 가지고 있는 텍스트와 훨씬 더 가까운.

깨끗한 상태에서 지저분한 상태로의 그 진행은 주목할 만한 유용한 점입니다. 목록을 아래로 내려갈수록 성능이 떨어지며, 특히 관계에서 가장 많이 떨어집니다. 에세이는 우호적인 경우였고, 그곳에서도 관계 수치는 미미했습니다.

주석자 간 합의가 진정한 한계다

주석 프로젝트는 독립적인 주석자들이 얼마나 자주 동의하는지를 보고하며, 논증 채굴에서 그 숫자는 각주가 아닙니다. 그것은 한계입니다.

같은 지침을 따르는 두 명의 훈련된 인간이 어떤 전제가 어떤 주장에 연결되는지에 대해 중간 정도만 동의한다면, 그들 중 한 명에 대해 평가된 모델은 다른 모델을 이겼다고 의미 있게 설명될 수 없다. 측정 자체가 모델보다 먼저 불안정해진다.

합의는 관계보다 구성 요소에서 일관되게 더 높습니다 — 사람들은 어떤 문장이 주장인지에 대해 대체로 동의하지만, 그것이 무엇에 대한 응답인지에 대해서는 의견이 다릅니다. 그 단일 비대칭은 나중에 벤치마크가 보여줄 모든 것을 예측했습니다.

자신의 팀에서 주석 테스트를 실행하세요.

결정 이메일 스레드를 가져와 두 동료에게 각각 가장 강력한 반대 의견을 표시하고 그것이 어떤 특정한 이유를 겨냥했는지 말해 달라고 요청하세요. 만약 그들이 다른 대상을 선택한다면, 당신의 의견 차이는 사실에 대한 것이 아니었습니다 — 그리고 어떤 요약 도구도 그것을 드러내지 않을 것입니다. 왜냐하면 요약은 말해진 내용을 기록하기 때문이지, 그것이 겨냥한 내용을 기록하지 않기 때문입니다.

지침은 이론을 실행 가능하게 만든 것입니다.

주석 가이드라인은 사무 작업처럼 들립니다. 이는 사양에 더 가깝습니다. 이론이 남긴 모든 모호성은 주석자가 시작하기 전에 해결되어야 하며, 각 해결은 실제로 약속을 의미합니다.

수사적 질문은 주장인가요? 결론에서의 재진술은 새로운 요소로 간주되나요, 아니면 같은 요소로 간주되나요? 한 문장이 두 가지 주장을 동시에 지지할 때, 그것은 두 주장 모두에 연결되나요, 아니면 더 가까운 주장에 연결되나요, 아니면 더 일반적인 주장에 연결되나요? 누군가 반박하기 전에 한 점을 양보한다면, 그 양보는 자신의 입장에 대한 공격인가요?

이들 중 어떤 것도 명확한 답이 없으며, 각 말뭉치는 약간씩 다르게 대답했습니다. 그래서 모델이 말뭉치 간에 잘 전이되지 않는 것입니다: 그들은 부분적으로 장르를 배우고, 부분적으로는 한 팀의 질문에 대한 답변을 배우고 있습니다.

하지만 데이터를 더 주석 처리할 수는 없나요?

자연스러운 반응이며, 구성 요소 감지에는 대체로 효과적이었습니다. 더 많은 주석이 달린 범위가 더 나은 범위 감지를 생성했습니다. 이 분야의 그 부분은 꾸준하고 예측 가능하게 개선되었습니다.

관계에 대해서는 그렇지 않았으며, 그 이유는 양의 문제가 아니라 구조적인 문제입니다. 관계는 문장 외부의 맥락에 의존하는데, 이는 일관되게 주석을 달기에는 비용이 많이 듭니다. 불일치 관계는 드물기 때문에 말뭉치를 확장하면 불균형도 함께 확장됩니다. 그리고 연결 단계는 자주 명시되지 않기 때문에 주석 작성자는 텍스트에서 보이는 것을 표시하는 것이 아니라 그것의 재구성을 표시하고 있습니다.

더 많은 데이터는 문제를 해결하기보다는 세 가지 문제를 모두 악화시킵니다. 그 주장은 다음 게시물의 주제입니다.

10년이 남긴 것

두 가지, 둘 다 여전히 하중을 지탱하고 있습니다.

첫 번째는 작업 정의 자체입니다. 현재 모든 논증 채굴 논문이 시작하는 네 부분으로 나누어진 구조 — 구성 요소 찾기, 레이블 지정, 연결, 링크 분류 — 는 이러한 주석 프로젝트의 산물이지 철학의 산물이 아닙니다. 툴민은 결코 파이프라인을 제안하지 않았습니다.

두 번째는 기준 집합입니다. 현대 시스템이 숫자를 보고할 때, 일반적으로 이 세기에 주석이 달린 에세이나 마이크로 텍스트에 대한 보고입니다. 이는 논문 간 수치를 비교할 때 기억할 가치가 있습니다: 두 개의 서로 다른 말뭉치에서 동일한 메트릭 이름은 동일한 측정이 아니며, 많은 발표된 비교가 이를 조용히 무시합니다.

실험실 밖에서 이것이 의미하는 바

  • 인간이 논쟁이 어디에 있는지 합의하지 못한다면, 어떤 도구도 당신에게 확신을 줄 수 없습니다. 추출된 구조를 수용할 판결이 아니라 수정할 초안으로 취급하세요.
  • 장르가 양보다 더 중요하다. 깔끔한 에세이에 맞춰 조정된 시스템은 방해와 미완성된 생각으로 가득한 회의록에서 매우 다른 문제에 직면한다.
  • 목표에 대한 이견이 진짜 신호입니다. 두 사람이 이의 제기가 서로 다른 것에 향했다고 생각할 때, 그 간극이 보통 결정이 실제로 막혀 있는 곳입니다.
  • 코퍼스 내에서만 벤치마크 숫자를 비교하십시오. 다른 데이터셋에서 동일한 메트릭은 레이블이 비슷해 보이더라도 다른 측정입니다.

주장이 있는 곳

주석의 10년은 이 이야기에서 가장 화려하지 않은 부분이며, 모든 것이 의존하는 부분입니다. 아무리 큰 모델이라도, 그 점수판이 때때로 서로 의견이 일치하지 않았던 사람들에 의해 만들어졌다는 사실에서 벗어날 수 없습니다.

자신의 회의에 가져가는 유용한 것입니다. 두 명의 훈련된 주석자가 서면 지침을 가지고도 주장을 찾는 것이 어렵다면, 팀이 결정을 계속 재논의하는 것은 규율 문제 아닙니다. 그것은 지침 없이 같은 문제입니다.

주장 채굴 시리즈

기계가 주장을 읽는 방법을 배운 다섯 가지 게시물 — 이 분야의 기원, 어려운 문제들이 왜 어려운지, 그리고 우리가 이를 어떻게 적용하는지.

자주 묻는 질문

주장 채굴 말뭉치란 무엇인가요?

사람들이 주장을 표시한 논증 구조의 문서 모음: 어떤 범위가 주장인지, 어떤 것이 전제인지, 그리고 어떤 전제가 어떤 주장을 지지하거나 공격하는지를 나타냅니다. 이는 경쟁하는 시스템이 동일한 데이터에서 비교될 수 있게 해주며, 아이디어를 연구 분야로 발전시키는 요소입니다.

AAEC 코퍼스란 무엇인가요?

Argument Annotated Essays Corpus는 Christian Stab와 Iryna Gurevych가 학생들의 설득력 있는 에세이에서 구축한 것입니다. 이 코퍼스는 논증 구성 요소와 그들 간의 관계를 주석 처리하며, 논증 마이닝의 표준 벤치마크 중 하나로 남아 있습니다.

왜 주석자 간 합의가 그렇게 중요한가요?

측정의 한계를 설정하기 때문입니다. 동일한 지침을 따르는 두 명의 훈련된 인간이 어떤 전제가 어떤 주장에 연결되는지에 대해 의견이 다를 경우, 그 중 하나에 대해 점수를 매긴 모델이 다른 모델보다 의미 있게 우수하다고 보여질 수 없습니다. 모델이 불안정해지기 전에 평가가 불안정해집니다.

왜 하나의 말뭉치에서 훈련된 모델이 다른 말뭉치에서 성능이 떨어질까요?

각 말뭉치는 장르와 일련의 지침 결정으로 구성되어 있습니다. 학생 에세이는 구조적이고 신중하며, 공공 댓글은 두서가 없습니다. 모델은 장르를 부분적으로 배우고, 모호한 사례에 대한 한 주석 팀의 답변을 부분적으로 배우며, 둘 다 깔끔하게 전이되지 않습니다.

관계 탐지를 수정하기 위해 데이터를 더 주석 처리해 주실 수 있나요?

구성 요소 감지에는 상당한 도움이 되었지만 관계 감지에는 훨씬 덜 도움이 되었습니다. 관계는 문장을 넘어서는 맥락에 의존하며, 불일치 관계는 드물기 때문에 말뭉치를 확장하면 불균형도 함께 확장됩니다. 또한 연결 단계는 종종 명시되지 않기 때문에 주석 작성자는 가시적인 것이 아니라 재구성을 표시하고 있습니다.

오늘날 어떤 말뭉치가 벤치마크로 사용되고 있나요?

설득력 있는 에세이와 논쟁적인 마이크로텍스트가 가장 일반적이며, 더 어렵고 복잡한 평가를 위해 공공 댓글 코퍼스가 사용됩니다. 각 코퍼스가 서로 다른 주석 결정을 사용하기 때문에 두 코퍼스에서 동일한 메트릭 이름이 동일한 측정값이 아닙니다. 이는 오해의 소지가 있는 비교의 빈번한 원인입니다.

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.

토론을 논쟁 트리로 바꾸다

자신의 성적 증명서에서 구조화된 추론 — 주석 지침이 필요하지 않습니다.

무료 시작

관련 읽기