Insegnare alle macchine a leggere argomenti: il decennio dei corpora annotati | Argumentree
L'argomentazione mining è esistita come teoria per decenni prima di diventare un compito computazionale misurabile. Ciò che l'ha cambiata è stata l'annotazione: persone sedute con migliaia di documenti e contrassegnando, a mano, quali parti erano affermazioni, quali erano premesse e quali supportavano o attaccavano quali. Christian Stab e Iryna Gurevych hanno annotato saggi persuasivi in questo modo, producendo il corpus solitamente chiamato AAEC. Andreas Peldszus e Manfred Stede hanno costruito un corpus di brevi microtesti argomentativi specificamente per studiare la struttura dell'argomento. Joonsuk Park e Claire Cardie hanno annotato commenti pubblici presentati per la regolamentazione negli Stati Uniti, un genere molto più caotico. La difficoltà non era mai solo lo sforzo di etichettatura: era che gli annotatori umani non concordano su cosa sia un argomento, e un compito su cui gli esseri umani non possono accordarsi non può essere valutato in modo affidabile. L'accordo tra annotatori è quindi diventato il custode dell'intero campo: definisce il limite pratico sulle prestazioni delle macchine, perché un modello non può essere misurato come più coerente dell'annotazione contro cui viene giudicato. I corpora hanno anche rivelato l'asimmetria permanente del campo: identificare i componenti argomentativi si è rivelato gestibile, mentre identificare le relazioni tra di essi no.
Non puoi insegnare a una macchina a trovare argomenti finché gli esseri umani non possono mettersi d'accordo su cosa sia un argomento. Questo si è rivelato essere la parte difficile, e ha plasmato tutto ciò che il campo ha misurato successivamente.
- Il mining degli argomenti è diventato un vero e proprio campo solo quando le persone hanno annotato a mano migliaia di documenti — affermazioni, premesse e i collegamenti tra di esse.
- Gli annotatori non sono d'accordo, specialmente riguardo alle relazioni. L'accordo tra annotatori è diventato il guardiano, poiché limita quanto bene qualsiasi modello possa essere valutato.
- Tre corpora hanno plasmato il decennio: saggi persuasivi, microtesti argomentativi e commenti sulla regolamentazione pubblica — da puliti a disordinati.
- Ogni corpus è un genere. Un modello addestrato su saggi di studenti non si trasferisce a una trascrizione di riunione, e per molto tempo nessuno aveva un corpus di trascrizioni di riunioni.
- I corpora hanno rivelato l'asimmetria permanente: trovare componenti è gestibile, trovare relazioni non lo è.
Due esperti, un paragrafo, due risposte diverse
Dai a due annotatori addestrati lo stesso paragrafo di un saggio studentesco e fai una semplice domanda: quale frase è l'affermazione e quali frasi sono le ragioni per essa? Spesso non saranno d'accordo. Non sul tema, non sul fatto che l'argomento sia valido — ma su dove si trovi.
Questo è il fatto che ha plasmato il primo decennio dell'argomentazione computazionale, ed è facile sottovalutarlo. Tutto ciò che viene dopo dipende da esso: non puoi costruire un benchmark per un compito che le persone non possono svolgere in modo coerente, e non puoi affermare che un modello supera le prestazioni umane su un giudizio che gli esseri umani non condividono.
Provalo tu stesso nell'ultima conversazione via email in cui hai discusso. Segnare la rivendicazione è di solito facile. Segnare a quale frase era rivolta ciascuna obiezione è dove inizierai a esitare — e quella esitazione è l'intera storia di questo decennio.
Perché la teoria è rimasta inutilizzata per vent'anni
All'inizio degli anni '90, l'apparato teorico era completo. Toulmin aveva fornito al campo la sua anatomia, Walton il suo catalogo di schemi di ragionamento, Freeman la distinzione tra attaccare una conclusione e attaccare l'inferenza ad essa. Come abbiamo trattato in il primo post di questa serie, un argomento era stato ridefinito come un grafo etichettato.
Un grafo etichettato è qualcosa su cui un computer può essere valutato — in linea di principio. In pratica, hai bisogno di qualcosa su cui basare la valutazione. Senza dati annotati, due gruppi di ricerca che affermano risultati diversi non hanno modo di risolvere la questione, e un campo in cui i risultati non possono essere confrontati non è un campo. È una raccolta di dimostrazioni.
Quindi il decennio che ha trasformato l'argomentazione in una disciplina non è stato un decennio di algoritmi. È stato un decennio di linee guida per l'annotazione.
I Tre Corpi Che Hanno Definito il Compito
Diversi gruppi di ricerca hanno annotato generi diversi, e la scelta del genere era più importante di quanto chiunque avesse inizialmente previsto.
- Saggi persuasivi (Stab & Gurevych). Saggi argomentativi degli studenti, annotati per affermazioni, premesse e le relazioni di supporto/attacco tra di esse. Scrittura strutturata da persone che cercavano esplicitamente di argomentare in modo chiaro — tanto favorevole quanto un testo può essere.
- Microtesti argomentativi (Peldszus & Stede). Brevi testi controllati costruiti specificamente per studiare la struttura argomentativa, ognuno un argomento compatto con una forma deliberata. Piccoli, chiari e progettati in modo che le domande strutturali abbiano risposte.
- Commenti pubblici sulla regolamentazione (Park & Cardie). Commenti inviati dal pubblico alle consultazioni regolatorie statunitensi. Reali, non editati, frequentemente prolissi — molto più vicini al testo che le organizzazioni hanno realmente.
Quella progressione da pulito a disordinato è la cosa utile da notare. Le prestazioni diminuiscono man mano che si scende nella lista, e calano di più nelle relazioni. I saggi erano il caso amichevole, e anche lì i numeri delle relazioni erano modesti.
L'accordo tra annotatori è il vero limite massimo
I progetti di annotazione riportano con quale frequenza gli annotatori indipendenti sono d'accordo, e nell'argomentazione mineraria quel numero non è una nota a piè di pagina. È il limite massimo.
Se due esseri umani addestrati che seguono le stesse linee guida concordano solo moderatamente su quale premessa si attacchi a quale affermazione, allora un modello valutato rispetto a uno di essi non può essere descritto in modo significativo come superiore all'altro. La misurazione stessa diventa instabile prima che lo faccia il modello.
L'accordo è costantemente più alto sui componenti che sulle relazioni: le persone concordano principalmente su quale frase sia un'affermazione e divergono su a cosa stia rispondendo. Quella singola asimmetria ha previsto tutto ciò che i benchmark avrebbero successivamente mostrato.
Esegui il test di annotazione con il tuo team.
Prendi un thread di email sulla decisione e chiedi a due colleghi, separatamente, di contrassegnare la singola obiezione più forte e di dire a quale motivo specifico era rivolta. Se scelgono obiettivi diversi, il tuo disaccordo non riguardava mai i fatti — e nessun strumento di sintesi lo evidenzierà, perché i riassunti registrano ciò che è stato detto piuttosto che a cosa era rivolto.
Le linee guida sono la teoria, resa operativa
Una linea guida per l'annotazione sembra un lavoro di segreteria. È più vicina a una specifica. Ogni ambiguità lasciata aperta dalla teoria deve essere risolta prima che gli annotatori possano iniziare, e ogni risoluzione è un vero impegno.
Una domanda retorica è un'affermazione? Una riformulazione nella conclusione conta come un nuovo componente o come lo stesso? Quando una frase supporta due affermazioni contemporaneamente, si attacca a entrambe, o a quella più vicina, o a quella più generale? Se qualcuno concede un punto prima di confutarlo, la concessione è un attacco alla propria posizione?
Nessuna di queste ha risposte ovvie, e ogni corpus le ha risposte in modo leggermente diverso. È per questo che i modelli si trasferiscono male tra i corpora: stanno imparando in parte un genere e in parte le risposte di un team a quelle domande.
Ma non potresti semplicemente annotare più dati?
È la risposta naturale e per il rilevamento dei componenti ha funzionato in modo ampio. Maggiore è il numero di intervalli annotati, migliore è il rilevamento degli intervalli. Quella parte del campo è migliorata costantemente e in modo prevedibile.
Per le relazioni non lo ha fatto, e la ragione è strutturale piuttosto che una questione di volume. Le relazioni dipendono dal contesto al di fuori della frase — il che è costoso da annotare in modo coerente. Le relazioni di disaccordo sono rare, quindi scalare il corpus scala anche lo squilibrio. E il passo di collegamento è frequentemente non dichiarato, quindi l'annotatore non sta segnando qualcosa di visibile nel testo; sta segnando la propria ricostruzione di esso.
Maggiore quantità di dati moltiplica tutti e tre i problemi anziché risolverli. Questo argomento è oggetto di il prossimo post.
Cosa ha lasciato indietro il decennio
Due cose, entrambe ancora portanti.
Il primo è la definizione del compito stesso. La suddivisione in quattro parti con cui ogni articolo di mining degli argomenti ora si apre — trovare i componenti, etichettarli, collegarli, classificare i collegamenti — è un prodotto di questi progetti di annotazione, non della filosofia. Toulmin non ha mai proposto un pipeline.
Il secondo è il benchmark stabilito. Quando un sistema moderno riporta un numero, di solito lo fa su saggi o microtesti annotati in questo decennio. Vale la pena ricordarlo quando si confrontano i dati tra articoli: lo stesso nome di metrica su due corpora diversi non è la stessa misurazione, e molte delle comparazioni pubblicate ignorano silenziosamente questo aspetto.
Cosa significa questo al di fuori del laboratorio
- Se gli esseri umani non riescono a mettersi d'accordo su dove sia l'argomento, nessuno strumento ti darà certezza. Tratta la struttura estratta come una bozza da correggere, non come un verdetto da accettare.
- Il genere conta più del volume. Un sistema sintonizzato su saggi ordinati affronta un problema molto diverso in una trascrizione di riunione piena di interruzioni e pensieri incompleti.
- Il disaccordo sui target è il vero segnale. Quando due persone pensano che un'obiezione fosse rivolta a cose diverse, quel divario è di solito dove la decisione è effettivamente bloccata.
- Confronta i numeri di riferimento solo all'interno di un corpus. La stessa metrica su un dataset diverso è una misurazione diversa, per quanto simile possa apparire l'etichetta.
Dove si trova l'argomento
Il decennio dell'annotazione è la parte meno glamour di questa storia e quella su cui si basa tutto il resto. Nessun modello, per quanto grande, sfugge al fatto che il suo punteggio è stato costruito da persone che a volte non erano d'accordo tra loro su dove si trovasse un argomento.
È una cosa utile da portare nelle proprie riunioni. Se trovare l'argomento è difficile per due annotatori esperti con una linea guida scritta, il fatto che il tuo team continui a rivedere una decisione non è un problema di disciplina. È lo stesso problema, senza la linea guida.
La serie di estrazione degli argomenti
Cinque post su come le macchine hanno imparato a leggere argomenti — da dove proviene il campo, perché i suoi problemi difficili sono difficili e come lo applichiamo.
Come un libro di filosofia del 1958 che i logici rifiutarono è diventato la specifica per un compito di apprendimento automatico.
Il disaccordo è raro nei dati e dipende dal contesto che la frase non contiene.
I modelli zero-shot hanno rimosso il collo di bottiglia del corpus e hanno lasciato i problemi strutturali esattamente dove erano.
Applicandolo: categorie di argomenti, una rivendicazione principale per categoria e perché la fiducia è il segnale di ranking sbagliato.
Fonti e Ulteriori Letture
Il progetto di annotazione del saggio persuasivo e le sue linee guida — il corpus che ha reso il compito misurabile.
Il trattamento completo di parsing dello stesso corpus, con i risultati dei componenti e delle relazioni solitamente citati da esso.
Operazionalizzare il modello di Freeman per il mining automatico degli argomenti — il ponte dalla teoria allo schema di annotazione.
Il corpus CDCP di commenti pubblici sulla regolamentazione — reali, disordinati e molto più difficili degli saggi.
L'indagine che ha consolidato il decennio — definizioni dei compiti, corpora e pratiche di valutazione.
Domande Frequenti
Che cos'è un corpus di estrazione di argomenti?
Una raccolta di documenti in cui le persone hanno contrassegnato a mano la struttura argomentativa: quali span sono affermazioni, quali sono premesse e quale premessa supporta o attacca quale affermazione. È ciò che consente di confrontare sistemi concorrenti su dati identici, il che trasforma un'idea in un campo di ricerca.
Che cos'è il corpus AAEC?
Il Corpus di Saggi Annotati sull'Argomento, costruito da Christian Stab e Iryna Gurevych a partire da saggi persuasivi degli studenti. Esso annota i componenti dell'argomento e le relazioni tra di essi, e rimane uno dei benchmark standard per l'argomento mining.
Perché è così importante l'accordo tra annotatori?
Perché stabilisce il limite nella misurazione. Se due esseri umani addestrati che seguono le stesse linee guida non sono d'accordo su quale premessa si applichi a quale affermazione, un modello valutato rispetto a uno di essi non può essere dimostrato in modo significativo superiore all'altro. La valutazione diventa instabile prima che lo sia il modello.
Perché i modelli addestrati su un corpus si comportano peggio su un altro?
Perché ogni corpus è un genere più un insieme di decisioni guida. I saggi degli studenti sono strutturati e deliberati; i commenti pubblici sono vaghi. Un modello impara in parte il genere e in parte le risposte di un team di annotazione a casi ambigui, e nessuno dei due si trasferisce in modo pulito.
Puoi semplicemente annotare più dati per correggere il rilevamento delle relazioni?
Ha aiutato notevolmente la rilevazione dei componenti e molto meno la rilevazione delle relazioni. Le relazioni dipendono dal contesto oltre la frase, le relazioni di disaccordo sono rare, quindi scalare il corpus scala anche lo squilibrio, e il passo di collegamento è spesso implicito — quindi l'annotatore sta segnando una ricostruzione piuttosto che qualcosa di visibile.
Quali corpora vengono utilizzati come benchmark oggi?
I saggi persuasivi e i microtesti argomentativi rimangono i più comuni, con i corpora di commenti pubblici utilizzati per valutazioni più difficili e complesse. Poiché ciascuno utilizza decisioni di annotazione diverse, lo stesso nome di metrica tra due corpora non rappresenta la stessa misurazione — una fonte frequente di confronti fuorvianti.
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.
Salta il passaggio di annotazione
Incolla una trascrizione e ottieni un albero strutturato di pro e contro che puoi correggere — la bozza è automatica, il giudizio rimane tuo.
La pagina di riferimento per il campo — compiti, storia e perché le relazioni sono la parte difficile.
L'arco dell'intero campo, da un libro di filosofia del 1958 rifiutato fino ad oggi.
Cosa hanno rivelato i corpora sul disaccordo e perché più dati non lo risolvono.
Trasforma una discussione in un albero degli argomenti.
Ragionamento strutturato dai tuoi stessi trascritti — nessuna linea guida per l'annotazione richiesta.
Inizia gratis