Argument Mining

How Argumentree Turns a Transcript Into an Argument Tree

AT
Argumentree Team
Decision Science
July 29, 2026
9 min leer
How Argumentree Turns a Transcript Into an Argument Tree

Cómo Argumentree Convierte una Transcripción en un Árbol de Argumentos | Argumentree

Argumentree utiliza la minería de argumentos para convertir una transcripción o documento no estructurado en un árbol de argumentos a favor y en contra. La extracción realiza cuatro cosas: encuentra los fragmentos de texto que contienen afirmaciones o razones, etiqueta qué es cada uno, determina qué razón se relaciona con qué afirmación y decide si cada enlace apoya o ataca lo que está por encima. Dos decisiones de diseño moldean la salida. Primero, los argumentos se agrupan en categorías de una sola palabra como Costo, Riesgo, Cronograma o Legal, y exactamente un argumento por categoría se promueve para ser la afirmación principal de esa categoría. Segundo, la afirmación principal no es elegida por la puntuación de confianza del modelo. La confianza mide cuán segura fue la extracción, no cuán central es el argumento, y se sabe que la confianza verbalizada de los LLM está mal calibrada. En su lugar, la afirmación principal se selecciona de varias señales a la vez, la más fuerte de las cuales es la centralidad — cuántos otros argumentos se relacionan con ella — y la abstracción, porque una afirmación principal es una posición general mientras que su evidencia de apoyo es específica. Un argumento que contiene un porcentaje, una cifra en moneda o un estudio nombrado se trata como evidencia para una afirmación en lugar de la afirmación misma. Cada argumento extraído debe citar la fuente textualmente; cualquier cosa que no se pueda localizar en el texto original se elimina antes de mostrar el árbol. La salida es un borrador para que las personas lo corrijan, reorganicen y califiquen, no un veredicto.

Share:
Resumen

La extracción es la mitad fácil. La mitad difícil es la estructura: decidir cuál es el punto principal, qué es simplemente evidencia para ello y qué realmente argumenta en contra.

  • Los argumentos se agrupan en categorías de una sola palabra: Costo, Riesgo, Cronograma, Legal, y exactamente uno por categoría se convierte en la afirmación principal de esa categoría.
  • La afirmación principal no es la que el modelo tenía más confianza. Las medidas de confianza extraen certeza, no importancia.
  • Las afirmaciones principales son generales; la evidencia es específica. Un argumento que lleva un porcentaje o un estudio nombrado se considera como apoyo para una afirmación, no la afirmación en sí.
  • Cada argumento debe citar la fuente palabra por palabra. Cualquier cosa que no se pueda encontrar en el texto original se elimina antes de que la veas.
  • El resultado es un borrador. Las personas corrigen, reestructuran y lo califican; la máquina construye la estructura, el grupo mantiene el juicio.

La respuesta más segura fue la incorrecta.

Alimentar una reunión de presupuesto de noventa minutos en un motor de extracción y preguntarle qué argumento importó más, a menudo te dará una estadística. Algo como "el modelo financiero proyecta una reducción del 20% en el gasto operativo" — preciso, bien fundamentado, y el modelo está muy seguro de ello.

También es la respuesta incorrecta. Esa oración no es el argumento. Es la evidencia de un argumento que alguien hizo cuarenta minutos antes y lo expresó de manera mucho más vaga: deberíamos consolidar los dos equipos porque ahorrará dinero. La oración vaga es la afirmación. La precisa es lo que la sostiene.

Esta distinción es todo el problema de convertir una conversación en una estructura, y vale la pena tenerlo en cuenta la próxima vez que leas tus propias notas de reunión. Las oraciones que parecen más citables son generalmente las que hacen el menor trabajo argumentativo.

Lo que la extracción tiene que hacer bien

La minería de argumentos — el campo de investigación detrás de esto, revisado por John Lawrence y Chris Reed en 2019 — generalmente se divide en cuatro trabajos, y se vuelven más difíciles a medida que avanzas.

  • Encuentra las partes argumentativas. La mayoría de las oraciones en una reunión real son logísticas, saludos o reiteraciones. Solo algunas llevan una afirmación o una razón.
  • Etiqueta qué es cada parte. Una afirmación es una posición. Una premisa es una razón para ello. La evidencia son los datos detrás de la razón. La misma oración puede ser una afirmación en un documento y una premisa en otro.
  • Determina qué responde a qué. Una razón se asocia a una afirmación específica; una objeción se asocia a una razón específica. Esto es lo que convierte una lista en un árbol.
  • Decide si apoyar o atacar. Para cada enlace: ¿esto fortalece lo que está adjunto o lo debilita?

Los dos primeros están en gran medida resueltos. Los últimos dos no lo están, y los puntos de referencia publicados muestran claramente la brecha: en el corpus de ensayos persuasivos que Christian Stab e Iryna Gurevych anotaron, la detección de componentes alcanza alrededor del 73% de F1, mientras que la detección de relaciones se sitúa cerca del 48%. En el corpus CDCP que Joonsuk Park y Claire Cardie construyeron, la detección de relaciones cae a aproximadamente el 34%.

Así que las decisiones de diseño interesantes no están en el hallazgo. Están en la estructuración — y ahí es donde entran las categorías.

Por qué los argumentos se clasifican en categorías

Una discusión real no se trata de una sola cosa. Una decisión para consolidar dos equipos se refiere simultáneamente a costos, a la moral, a la exposición legal y a cuánto tiempo toma. Esos son debates diferentes que ocurren en la misma sala, y aplanarlos en una sola lista produce algo que nadie puede leer.

Así que cada argumento extraído está etiquetado con una categoría de una sola palabra — Costo, Riesgo, Cronograma, Legal, Seguridad, Alcance. Una sola palabra, deliberadamente. En el momento en que las categorías se convierten en frases, el mismo tema se fragmenta en casi duplicados: Impacto Presupuestario y Consideraciones de Costo y Riesgo Financiero son un debate con tres sombreros, y el árbol se divide en ramas que deberían haber sido una.

La restricción se aplica en lugar de ser solicitada. Las categorías se normalizan a una única forma canónica, y una categoría es una propiedad de la parte superior de una rama; todo lo que está debajo de una afirmación principal hereda la categoría de esa afirmación principal. Un argumento de costo no adquiere un hijo en la categoría de Riesgo; si el hijo se refiere genuinamente al riesgo, pertenece a la afirmación principal de Riesgo en su lugar.

Un argumento principal por categoría

Dentro de cada categoría, exactamente un argumento se promueve como la afirmación principal — la posición central que todo lo demás en esa categoría apoya o ataca. Todo lo demás en la categoría se convierte en un hijo de ella, directa o indirectamente.

Esta es la elección más trascendental en todo el proceso. Si lo haces bien, la rama se lee como un argumento: aquí está la posición sobre el costo, aquí hay tres razones para ello, aquí está la objeción a la segunda razón. Si lo haces mal, obtienes la inversión de la parte superior de este artículo: una estadística sentada en la parte superior de una rama con la afirmación que se suponía que debía respaldar colgando debajo de ella como si fuera un detalle.

El enfoque obvio no funciona.

La respuesta intuitiva es promover el argumento sobre el cual el modelo tenía más confianza. Esto falla, por una razón que vale la pena entender.

La confianza mide cuán seguro está de que la extracción encontró un argumento real. No mide cuán central es ese argumento para el debate. Una estadística bien redactada con una fuente nombrada es una extracción fácil y de alta confianza. Una oración vaga y con reservas que resulta ser la tesis real es una extracción difícil y de baja confianza. Clasificar por confianza promueve sistemáticamente la evidencia y desmerece la afirmación.

Hay un segundo problema debajo del primero. Un trabajo de Saurav Kadavath y colegas en Anthropic encontró que la confianza verbalizada de los modelos de lenguaje está mejor calibrada que las probabilidades de tokens en bruto, pero evaluaciones posteriores han demostrado repetidamente que aún no está bien calibrada en términos absolutos. Es una señal utilizable. No es un ranking confiable.

¿Qué Elige Realmente la Reclamación Principal?

En lugar de una señal, se combinan varias — y la más fuerte de ellas es estructural en lugar de lingüística.

  • Centralidad. ¿Cuántos otros argumentos se relacionan con este? La afirmación a la que todo lo demás responde es casi siempre la afirmación central. Esta es la cosa más cercana a una señal confiable, porque es una propiedad de la posición del argumento en el debate en lugar de su redacción.
  • Abstracto. Las afirmaciones principales son generales; la evidencia es específica. Este es directamente Toulmin: en su relato de 1958, la afirmación es la conclusión y los fundamentos son los hechos concretos que la sustentan.
  • Lenguaje argumentativo. Los marcadores del discurso — por lo tanto, el tema clave es, yo argumentaría — indican que un hablante está expresando una posición en lugar de proporcionar un detalle.
  • Brevity. Las afirmaciones centrales tienden a ser breves. Una oración larga suele llevar calificaciones, que es lo que hace el material de apoyo.
  • Posición. Una señal débil, pero real: las tesis tienden a aparecer temprano.

La abstracción se mide buscando las huellas de la especificidad. Un porcentaje, una cantidad de dinero, una entidad cuantificada, una frase de cita, una institución nombrada — cada uno hace que un argumento sea menos probable que sea la afirmación principal, porque cada uno es un sello distintivo de los fundamentos en lugar de una conclusión. El trabajo remoto mejora la productividad es una afirmación. Una encuesta a 500 trabajadores mostró un 78% de satisfacción es lo que dices cuando alguien te pregunta por qué.

Combinar varias señales débiles supera confiar en una que parece fuerte, que es la misma razón por la que un grupo con perspectivas diversas supera a un individuo seguro, un patrón explorado en por qué la diversidad supera a la habilidad.

Prueba esto en tu última reunión.

Toma la última decisión que tomó tu equipo. ¿Puedes nombrar el único argumento más fuerte en contra de ella — y puedes nombrar quién lo hizo? Si no puedes, eso no es un problema de memoria. Es un problema de estructura: tu registro capturó lo que se decidió pero no lo que se argumentó, que es exactamente la brecha que la extracción está tratando de cerrar.

Nada sobrevive que no esté en la fuente.

Un argumento que suena plausible pero que nunca se hizo en realidad es peor que uno que falta; es un registro falso de lo que dijo tu equipo. Por lo tanto, cada argumento extraído lleva la redacción exacta de la que proviene, y cualquier argumento cuya evidencia citada no se pueda localizar en el documento fuente se elimina antes de que el árbol se muestre a alguien.

Esto no es glamuroso y es la parte que hace que el resto sea utilizable. Un árbol que no puedes rastrear hasta la transcripción es un resumen con pasos adicionales.

¿Pero esto no es solo un resumen con pasos adicionales?

Es la objeción obvia, y la respuesta está en lo que cada uno desecha.

Un resumen comprime. Te dice aproximadamente lo que se trató en la reunión y, si es bueno, lo que se decidió. Lo que no puede preservar es la forma del desacuerdo: que esta objeción específica se planteó contra esa razón específica, que fue respondida y que una segunda objeción nunca se planteó. Los resúmenes pierden precisamente la parte que importa cuando la decisión se revisita ocho meses después y nadie puede recordar por qué se rechazó la alternativa obvia.

La distinción también separa la minería de argumentos del análisis de sentimientos, que mide la actitud en lugar del razonamiento. Una oración puede estar formulada negativamente mientras apoya el punto al que está unida — "la presión del cronograma aumenta el riesgo" refuerza una afirmación de que el proyecto es arriesgado. Si lo puntúas por tono, siempre lo obtienes al revés.

La salida es un borrador, y ese es el punto.

Lo que sale de la extracción es una propuesta: aquí está lo que pensamos que se argumentó, aquí está cómo creemos que encaja. Luego, las personas lo corrigen: reconfiguran un argumento que estaba asociado a la afirmación incorrecta, dividen uno que fusionó dos puntos, promueven algo que la puntuación se equivocó, y evalúan lo que encuentran convincente.

Esa división es deliberada. Construir la estructura a mano es un trabajo tedioso que impide a los equipos hacerlo en absoluto. Juzgar si un argumento es bueno — si la evidencia se sostiene, si la suposición no declarada es aceptable — no es tedioso. Es el pensamiento real, y se queda con el grupo.

Lo que esto significa si estás leyendo tus propios registros de reuniones

  • La línea citada generalmente no es la afirmación. Las oraciones precisas y bien documentadas son típicamente evidencia. La afirmación que apoyan suele ser más vaga y más fácil de pasar por alto.
  • Cuenta lo que se adjunta a lo que. El punto al que todos los demás respondieron es el punto que importaba, independientemente de quién lo dijera con más confianza.
  • Nombra las categorías. Si no puedes decir sobre qué dos o tres temas se trató una decisión, la discusión no ha sido estructurada — ha sido transcrita.
  • Busca la objeción que nadie respondió. Es lo más útil en cualquier registro de argumentos, y lo primero que un resumen plano destruye.

La oración vaga fue el argumento.

La estadística nunca fue el objetivo. Era la respuesta a una pregunta que alguien hizo sobre una afirmación que ya se había hecho —de manera imprecisa, temprana, y en el tipo de oración que nunca llega a las actas.

Estructurar una discusión significa colocar esa oración de nuevo en la parte superior de la rama donde pertenece, con su evidencia debajo y sus objeciones adjuntas a las razones específicas que disputan. Para eso sirve un árbol. Y es por eso que la respuesta más segura es a menudo la incorrecta.

La serie de minería de argumentos

Este post cubre cómo aplicamos la minería de argumentos. El resto de la serie cubre de dónde proviene el campo y por qué sus problemas difíciles son difíciles.

Preguntas Frecuentes

¿Cómo convierte Argumentree una transcripción en un árbol de argumentos?

Aplica la minería de argumentos: encontrar los fragmentos de texto que contienen afirmaciones o razones, etiquetar qué es cada uno, determinar qué razón se relaciona con qué afirmación y decidir si cada enlace apoya o ataca el punto que está por encima. El resultado es un árbol de pros y contras que las personas luego revisan y corrigen.

¿Qué son las categorías de argumentos y por qué palabras individuales?

Las categorías agrupan una discusión en sus debates separados: Costo, Riesgo, Cronograma, Legal. Están restringidas a palabras individuales porque las categorías de longitud de frase fragmentan: Impacto Presupuestario, Consideraciones de Costo y Riesgo Financiero son un debate con tres sombreros, y el árbol se divide en ramas que deberían haber sido una.

¿Qué significa un argumento principal por categoría?

Dentro de cada categoría, exactamente un argumento se promueve como la afirmación central, y todo lo demás en esa categoría se adjunta debajo de él. Esto es lo que hace que una rama sea legible como un argumento: una posición, las razones para ella y las objeciones a esas razones, en lugar de una lista plana de oraciones relacionadas.

¿Por qué no es el argumento principal simplemente el que tiene la mayor confianza?

Porque la confianza mide cuán segura fue la extracción, no cuán central es el argumento. Una estadística bien formulada es una extracción fácil y de alta confianza; la frase vaga que es la tesis real es una difícil. Clasificar por confianza promueve sistemáticamente la evidencia y desmerece las afirmaciones.

¿Cómo se diferencia esto de la resumición de reuniones?

Un resumen comprime y te dice lo que se cubrió. No puede preservar la forma del desacuerdo: que esta objeción se planteó contra esa razón, que fue respondida y que otra no lo fue. Los resúmenes pierden exactamente la parte que importa cuando se revisa una decisión más tarde.

¿Qué impide que la IA invente argumentos que nadie hizo?

Cada argumento extraído lleva la redacción exacta de la que proviene, y cualquier argumento cuya evidencia citada no se pueda localizar en el documento fuente se elimina antes de que se muestre el árbol. Un argumento que suena plausible pero que nunca se hizo es peor que uno que falta.

¿Puedo cambiar lo que produjo la extracción?

Sí, ese es el flujo de trabajo previsto. La salida es un borrador. Las personas re-asignan argumentos adjuntos a la reclamación incorrecta, dividen puntos fusionados, promueven algo que la puntuación se equivocó y califican lo que encuentran convincente. La máquina construye la estructura; el grupo mantiene el juicio.

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from ancient philosophy to modern AI.

Convierte tu próxima reunión en un árbol de argumentos.

Estructura el razonamiento, no solo el registro — para que la objeción que nadie respondió siga siendo visible en seis meses.

Comenzar gratis

Lectura relacionada