Структурированное обсуждение действительно изменяет мнение группы?
Предварительно зарегистрированный эксперимент, опубликованный в журнале Science в октябре 2024 года (Tessler et al., Science 386, eadq2852), проверил это напрямую с участием 5,734 участников из Великобритании. Одна группа участников читала мнения друг друга по спорным вопросам; согласие в группе вообще не изменилось (b = -0.005, P = 0.64). Сравнимые группы, мнения которых были синтезированы в кандидатное групповое заявление, оценены, подвергнуты критике и переработаны, сошлись примерно на восемь процентных пунктов, а доля групп, достигнувших единогласия, возросла с 22.8% до 38.6%. Разница между двумя условиями была статистически значимой (P = 0.0058). Синтез был выполнен системой ИИ, которую авторы назвали Машиной Хабермаса, чьи заявления предпочитались заявлениям обученных, финансово мотивированных человеческих медиаторов в 56% случаев. Заявления, сделанные после раунда критики, придавали меньшинственным позициям больше веса, чем их доля в группе, а не меньше. Авторы указывают на четкие ограничения: участники были все жителями Великобритании, группы состояли только из пяти человек, система не может проверять факты или модерацию, а исследовательский анализ показал аналогичную конвергенцию от человеческих медиаторов, что предполагает, что эффект может исходить от медиированного обсуждения как процесса, а не от ИИ в частности. Практическое заключение для любого, кто проводит обсуждение, заключается в том, что обмен мнениями не является механизмом, который приводит к согласию; структурирование их и проведение раунда явного возражения — вот что действительно работает.
В октябре 2024 года журнал Science опубликовал заранее зарегистрированный эксперимент с 5,734 участниками, который включал контрольное условие, на которое почти никто не обратил внимания. Одна группа просто читала мнения друг друга по спорным политическим вопросам. Их уровень согласия вообще не изменился. Группы, чьи одинаковые мнения были структурированы в виде заявления кандидата, оценены, прокомментированы и переработаны, сошлись на восемь процентных пунктов, а единодушие почти удвоилось. Свободный обмен мнениями не создает общую основу. Создание структуры — вот что действительно важно.
- Результат контроля — это вывод. Обсуждение мнений друг друга изменило согласие группы на b = -0.005 (P = 0.64). Структурирование одинаковых мнений изменило его на восемь процентных пунктов (P < 0.001 во всех трех когортах).
- Единогласие возросло с 22.8% до 38.6%, и 66.6% участников заявили, что групповое заявление лучше отражает их мнение, чем их собственная формулировка.
- Критический раунд является причинным, а не артефактом. В отдельной когорте из 245 человек переработки, которые действительно использовали критику, превзошли переработки, которые тайно игнорировали её (P = 0.0039).
- Структура защищала меньшинство. Посткритические заявления оценивали мнения меньшинства в 0.36 при истинной доле 0.29. Это не было правлением большинства.
- Честные ограничения: только участники из Великобритании, группы по пять человек, без проверки фактов, и человеческие посредники обеспечили схожую конвергенцию в раундах, которые они выиграли. Механизм может быть опосредованной структурой самой по себе, а не ИИ.
Пятерым незнакомцам был задан спорный вопрос. Должна ли Национальная служба здравоохранения быть приватизирована? Должен ли возраст для голосования снизиться до 16 лет? Каждый из них в частном порядке, своими словами и в разумном объеме, изложил свою честную позицию. Затем они прочитали, что написали остальные четверо. Их заявленные позиции были измерены до и после.
Ничто не изменилось. Ни немного, ни в неправильном направлении, ни на величину, слишком малую, чтобы иметь значение. Измеренное изменение в согласии группы составило минус 0.005, с p-значением 0.64, что близко к буквальному нулю, который может сообщить эксперимент.
Это было контрольное условие в исследовании, опубликованном в Science 18 октября 2024 года. Сравнимые группы, получившие одни и те же вопросы и одинаковое количество времени, чьи письменные мнения были синтезированы в заявление кандидатской группы, оценены, подвергнуты критике и переработаны, сблизились примерно на восемь процентных пунктов. Доля групп, достигнувших единогласия, возросла с 22,8% до 38,6%. Исследование обычно представляется как история о том, как ИИ обошел человеческих посредников. Гораздо более полезный результат — это тот, который не попал в заголовки: обмен мнениями не приводит к общему мнению. Их структурирование приводит.
Позволение людям читать мнения друг друга снизило согласие в группе на полпроцента.
Структурирование тех же мнений переместило это на восемь.
Тесслер и др., Science 386, eadq2852 (2024) — когорта мнений и экспозиции против основных когорт задач
Что на самом деле сделало исследование
Статья Искусственный интеллект может помочь людям найти общие интересы в демократических обсуждениях написана Майклом Генри Тесслером, Михиелом Баккером и коллегами из Google DeepMind, Оксфорда и Гарварда. В ней сообщается о семи экспериментах, проведенных с января по август 2023 года с участием 5,734 участников из Великобритании. Размеры выборок, критерии исключения и основные анализы были предварительно зарегистрированы до сбора данных, а код был опубликован в открытом доступе. Это сочетание предварительной регистрации, подлинного контрольного условия, публикации в Science и открытого кода достаточно редко в этой области, чтобы это стоило сказать прямо.
Участники работали в группах по пять человек и обсуждали три вопроса примерно за час. Для каждого вопроса процедура была фиксированной. Сначала каждый написал свою позицию наедине, от 10 до 200 слов, в среднем около 65. Эти написанные мнения были переданы в систему, которую авторы назвали Машина Хабермаса, в честь философа, который утверждал, что согласие возникает, когда люди рассуждают вместе в справедливых условиях. Система составила несколько кандидатных заявлений о общем мнении группы. Участники оценили их, и победитель был выбран на выборах с ранжированным голосованием, в которых голос каждого участника учитывался одинаково. Победившее заявление вернулось в группу, каждый человек приватно написал критику этого заявления, и система создала переработанный проект на основе этих критик. Участники снова оценили и в конечном итоге выбрали между оригинальной и переработанной версиями.
Стоит обратить внимание на две детали. Участникам сообщили, что утверждения были сгенерированы машиной, поэтому обмана не было. А сами вопросы были намеренно спорными, касающимися иммиграции, пенсионного возраста, числа заключенных, Брекзита, климатических целей и минимальной заработной платы. Это не были разогревочные темы, выбранные для облегчения согласия.
Четыре вещи, которые сделала процедура
Уберите машинное обучение, и процедура состоит из четырех шагов. Каждый из них доступен любой группе с общим документом и некоторой дисциплиной.
Каждый занимает свою позицию, не выслушав других.
Мнения были написаны приватно, полными предложениями, с приложением обоснований. Никто не говорил первым и не задавал тон в комнате, и никто не имел возможности тихо соглашаться с тем, кто звучал наиболее уверенно. Письменная запись того, что каждый человек на самом деле думал, существовала до того, как на это могло повлиять какое-либо социальное давление.
Позиции синтезируются в один артефакт, а не располагаются в списке.
Это шаг, который контрольная группа не получила. Они получили точно такую же информацию, все пять мнений в полном объеме, в виде отдельного текста. Группы, получившие лечение, получили это в виде единого подготовленного заявления о том, где на самом деле находилась группа. Та же информация, другая структура, и только одна из двух вызвала движение.
Отбор — это голосование с ранжированием и равным весом.
Победное заявление было выбрано путем агрегирования рейтинга каждого участника, по одному голосу от каждого. Предпочтения никого не учитывались больше из-за громкости, скорости, старшинства или красноречия. Это та часть, которую легко описать, но сложно реализовать на живой встрече.
Существует формальный этап для подачи возражений, и проект должен быть изменен.
Каждый участник в частном порядке критиковал выигрышное заявление, и эти критики были учтены в доработке. Возражение не было прерыванием или социальным риском; это был запланированный шаг, который выполняли все. В трех группах 68%, 64% и 66% участников предпочли доработанное заявление оригиналу.
Почему контрольное условие является важным результатом
Разумное возражение против любого подобного исследования заключается в том, что люди сходятся во мнении просто потому, что наконец услышали, что думают все остальные. Авторы предвидели это и провели тест. Дополнительная группа из 372 участников в 75 группах выполнила идентичное упражнение, за исключением того, что вместо оценки составленного группового заявления они оценивали индивидуальные мнения друг друга. Полное знакомство с каждой точкой зрения в группе, без синтеза.
Согласие группы в этом условии не изменилось (b = -0.005, t(230) = -0.46, P = 0.64), и разница между двумя условиями была статистически значимой (P = 0.0058). Это контролируемый, предварительно зарегистрированный результат, опубликованный в Science, показывающий, что обсуждение мнений всех не приводит группу к согласию. Это самое близкое к прямому тесту комментариев в литературе, и комментарии не прошли этот тест.
Вторая половина механизма была протестирована так же тщательно. Переработанные утверждения могли быть предпочтительнее просто потому, что люди видели их вторыми, потратив немного больше усилий. Поэтому авторы провели еще одну группу из 245 участников, которые написали критические замечания, а затем им показали переработки, которые либо действительно учитывали их замечания, либо нет. Версии, действительно основанные на критике, все равно победили (P = 0.0039). Раунд возражений действительно имеет значение.
Структура не сгладила меньшинство. Она его усилила.
Очевидный страх по поводу любого процесса поиска консенсуса заключается в том, что он превращается в правило большинства с лучшими манерами. Авторы измерили это, а не утверждали, встраивая каждое мнение и каждое заявление в векторное пространство и располагая их вдоль оси, проходящей от согласия к несогласию по каждому вопросу.
В примерно 77% раундов группа изначально была действительно разделена. Первоначальные заявления группы оценивали мнения меньшинства на уровне 0.29, при истинной средней доле меньшинства 0.29, что почти точно соответствует пропорциональному представительству. Пересмотренные заявления, написанные после раунда критики, оценивали их на уровне 0.36. Меньшинство было чрезмерно представлено относительно своего размера, и группа все равно предпочла эти пересмотренные заявления. Девяносто шесть процентов заявлений группы находились в диапазоне, фактически охватываемом собственными мнениями группы, так что система не выдумывала позиции, которых никто не занимал.
Поддержка действительно сместилась в сторону большинства в целом, и авторы это отмечают. Большинство увеличилось с 29% до 32% раундов, а меньшинства — с 20% до 26%. Но когда они проверили, перемещались ли люди к большинству лишь потому, что им показывали утверждения, склоняющиеся к большинству, они не обнаружили никакой связи (P = 0.37). То, что влияло на людей, было содержанием аргумента, а не повторным его изложением.
Первый черновик машины совпал с большинством точно.
После одного раунда возражений он чрезмерно представлял меньшинство.
Вес меньшинства увеличился с 0,29 до 0,36 при истинной доле меньшинства 0,29.
Это обошло человеческих посредников, и это имеет наименьшее значение.
Заголовочный результат заключался в сравнении с людьми. В 75 группах один участник был назначен медиатором, обученным составлять групповые заявления и получающим бонус до 50% от своей базовой зарплаты за каждое заявление, которое группа предпочитала. В этих раундах заявления машины предпочитались 56% времени по сравнению с 44% у людей и оценивались выше как по поддержке, так и по качеству. Отдельная группа из 155 независимых оценщиков признала их более ясными, более информативными, менее нелогичными и менее склонными к внедрению мнения автора.
Это вывод, который был распространен, и на него стоит опираться меньше всего. Авторы сами осторожны в этом вопросе: они называют реальную возможность не сверхчеловеческим посредничеством, а обсуждением, которое является эффективным по времени, справедливым и масштабируемым. Система выдавала заявления за секунды, в то время как людям требовались минуты. А в исследовательском анализе авторы обнаружили похожую конвергенцию среди человеческих посредников в тех раундах, где победили люди, что предполагает, что эффект может исходить от структурированного посредничества как процесса, а не от чего-то специфического для ИИ. Если это толкование верно, то оно делает исследование более полезным, а не менее, потому что выгода тогда доступна любой группе, готовой принять эту процедуру, с моделью или без нее.
Это воспроизвелось с репрезентативной выборкой, и это не сработало на всем.
Основные когорты были набраны по удобству через платформу краудсорсинга, что является справедливым поводом для скепсиса. Поэтому авторы сотрудничали с Фондом жребия, который проводит настоящие собрания граждан, чтобы набрать 200 участников, стратифицированных для представления Великобритании по возрасту, гендерной идентичности, этнической принадлежности, социоэкономическому статусу и региону. Они обсуждали в течение трех еженедельных часовых сессий в апреле и мае 2023 года девять вопросов. Уровни одобрения и увеличение согласия в группе были воспроизведены.
Интересная часть заключается в том, что это не сработало. По девяти вопросам позиции сошлись на пяти. Поддержка сокращения численности заключенных выросла с 60% до 75%, а поддержка упрощения въезда для соискателей убежища — с 39% до 51%. По вопросу Brexit не было никаких изменений. По вопросу универсального бесплатного детского ухода мнение изменилось в противоположную сторону, с ростом оппозиции с 33% до 41%. Процесс, который привел к согласию по каждому вопросу, независимо от темы, был бы свидетельством того, что что-то пошло не так. Этот процесс оставил укоренившиеся позиции укоренившимися, что примерно соответствует тому, что должно происходить в честном обсуждении.
Границы, изложенные ясно
Любое утверждение, основанное на одном исследовании, должно учитывать оговорки этого исследования, и у этого есть реальные. Авторы сами перечисляют большинство из них.
Все были британцами, обсуждая британские вопросы.
Все участники были резидентами Великобритании, обсуждающими политику Великобритании. Авторы утверждают, что у них нет особых оснований полагать, что результаты специфичны для Великобритании, но они это не проверяли. Ничто из этого не было доказано в другой политической культуре.
Группы по пять, а не по пятьдесят
Каждая группа состояла примерно из пяти человек. Авторы утверждают, что метод в принципе масштабируется с моделями длинного контекста, но масштаб не был протестирован. Результаты малых групп не автоматически сохраняются при контакте с сотней участников, и проблема проверки того, что синтез является верным, становится гораздо сложнее по мере увеличения объема входных данных.
Он не может проверять факты, модерировать или удерживать кого-либо в рамках темы.
Согласно словам авторов, если человеческие мнения являются необоснованными или вредными, то и результат может быть необоснованным или вредным. Система синтезирует то, что ей предоставлено. У нее нет мнения о том, является ли что-либо из этого истинным, и вопросы исследования были предварительно проверены, чтобы снизить риск вредных обсуждений.
Образец для обучения не был репрезентативным.
Модель была настроена на основе участников, собранных с помощью краудсорсинга, среди которых люди старше 65 лет были недостаточно представлены. Репликация сборки касается выборки для оценки, а не данных, из которых система извлекала предпочтения.
Предполагается, что все спорят искренне.
Процедура рассматривает каждую написанную позицию на чистоту. Тот, кто намеренно искажает свою точку зрения, чтобы подтолкнуть синтез к желаемому результату, нигде не моделируется, и то, что считается рациональным стратегическим поведением в рамках этой процедуры, остается открытым вопросом для исследования.
ИИ может не быть активным ингредиентом
Собственный исследовательский анализ авторов показал сопоставимую конвергенцию среди человеческих посредников по раундам, которые они выиграли. Честное прочтение заключается в том, что исследование демонстрирует ценность структурированного, посреднического обсуждения и показывает, что модель может выполнять посредническую роль компетентно и быстро. Это не устанавливает, что именно модель является причиной успеха.
Где критики правы
Статья привлекла серьезную критику со стороны ученых в области делиберативной демократии, и часть из нее обоснована. Самая резкая критика исходит от Альваро Олеарта и Николаса Палома Эрнандеса в Journal of Deliberative Democracy, которые указывают на то, что в этой процедуре участники никогда не спорят друг с другом. Они пишут в частном порядке, а затем оценивают результаты работы машины. Нет опровержений, нет обмена аргументами между людьми, нет момента, когда аргумент одного человека напрямую меняет мнение другого. Они называют это делиберацией без граждан и отмечают иронию названия: Хабермас рассматривал согласие как предварительное условие подлинного дискурса, а не как цель, к которой следует стремиться.
Бет Симон Новек выдвигает другое возражение: консенсус не является сложной частью управления. Группы чаще не могут согласиться на том, в чем заключается проблема, чем на том, что с ней делать, и машина, которая отлично справляется с производством согласия по хорошо сформулированному вопросу, не помогает с плохо сформулированным. Исследователи Института первой поправки Кнайта добавляют проблему надзора, которая заключается в том, что, как только синтез сделан на основе тысячи мнений, ни один человек не может проверить, что он верно их представляет.
Мы считаем, что первая критика является самой важной, и мы с ней согласны. Оптимизация процесса для достижения согласия не равнозначна помощи людям в совместном рассуждении, и система, которая достигает консенсуса, обходя человеческие споры, устранила то, что изначально делало обсуждение ценным. Вывод, который следует вынести, не в том, чтобы позволить модели написать позицию вашей группы. Он более узкий и долговечный: позиции должны быть явными, структура важнее циркуляции, а формальный раунд возражений изменяет результат. Эти принципы действуют независимо от того, выполняется ли синтез моделью, фасилитатором или самой группой.
Что делать с этим в понедельник
Ни один из четырех механизмов не требует ИИ, и все четыре — это вещи, которые большинство встреч делает неправильно. Соберите письменные позиции до обсуждения, а не во время него. Участники исследования написали примерно по 65 слов с обоснованием, что занимает около пяти минут работы и является самым дешевым изменением. Синтезируйте, а не распространяйте. Пересылка комментариев всех участников — это именно то условие, которое не привело ни к какому движению; кто-то должен составить то, что группа действительно считает общим, и представить это на исправление. Принимайте решение по равновесному ранжированию, а не по тому, кто все еще говорит в конце. И запланируйте раунд возражений, чтобы несогласие стало задачей, которую выполняет каждый, а не социальным риском, который кто-то должен взять на себя.
Если вы проводите онлайн-дискуссии, результат контроля заслуживает особого внимания, потому что доска обсуждений или ветка комментариев является условием контроля. Она циркулирует мнения и ничего не синтезирует. Это структурный случай, изложенный в альтернативах доски обсуждений, и теперь у него есть зарегистрированный эксперимент. Четырехфазная структура в как структурировать дебаты принуждает к тем же действиям вручную, а различие между согласием и просто отсутствием возражений рассматривается в согласие против консенсуса.
Что это говорит и не говорит о Argumentree
Мы должны быть точными в этом, потому что искушение преувеличить очевидно. Машина Хабермаса — это не то, что мы построили. Она генерирует кандидатные консенсусные заявления, используя персонализированную модель вознаграждения, которая предсказывает, как каждый участник оценит каждый проект, и выбирает между ними с помощью смоделированных выборов. Argumentree этого не делает, и это исследование не тестирует наш продукт.
Что тестируется, так это механизм, на котором основан наш продукт. Позиции записываются явно, с обоснованием, до того, как обсуждение сойдется. Аргументы структурируются в общий артефакт, а не циркулируют в виде стека сообщений. Возражение является первоклассным действием с местом для прикрепления, а не прерыванием. Меньшинственные позиции остаются видимыми и атрибутируемыми, а не растворяются в мнении большинства. Это четыре вещи, которые исследование выделило, и это четыре вещи, которые структурированная карта аргументов делает по умолчанию. Разница в том, что наша синтез остается проверяемой: каждое утверждение сохраняет своего автора, свои возражения и свою поддержку, так что никому не нужно доверять резюме, которое они не могут проверить, что и является именно той проблемой надзора, которую поднимают критики.
Тест
После вашего следующего обсуждения спросите, изменилось ли чье-либо мнение. Если все прочитали все и никто не изменил свою позицию, вы не провели обсуждение. Вы провели контрольное условие.
Результат, который стоит запомнить
Уберите модель, собрание граждан и спор о том, должно ли ИИ быть где-либо рядом с политическим процессом, и останется только одно число. Пять человек, полный доступ к письменным аргументам друг друга по вопросу, который их интересовал, измеренный до и после: P = 0.64. Наиболее распространенный способ, которым группы пытаются достичь согласия, заключающийся в том, чтобы представить все мнения всем и позволить людям читать, теперь был протестирован по сравнению с контролем и не дал измеримого эффекта.
Условие, которое сработало, не добавило новой информации. Каждый участник уже имел свое мнение. Изменилось то, что мнения получили форму, были оценены с равным весом и подвергнуты одному формальному раунду возражений. Это процедурное открытие, а не технологическое, и оно доступно любому, кто готов вести свои обсуждения иначе.
У группы уже были все аргументы. Ей не хватало структуры, чтобы их организовать.
Запустите структуру, а не поток
Argumentree предоставляет каждой позиции явное место, каждой возражающей стороне — точку для привязки, а каждому аргументу меньшинства — запись, которая сохраняется после обсуждения.
Источники
- Тесслер, М. Х., Баккер, М. А., Джарретт, Д., Шиган, Х., Чадвик, М. Дж., Костер, Р., Эванс, Г., Кэмпбелл-Гиллингем, Л., Коллинз, Т., Паркс, Д. С., Ботвиник, М., & Саммерфилд, К. (2024). ИИ может помочь людям найти общую основу в демократических обсуждениях. Наука, 386, eadq2852.Основной источник для каждой цифры в этой статье. Семь экспериментов, 5,734 участника из Великобритании, опубликовано 18 октября 2024 года.
- Тесслер и др. (2023). Пререгистрация: размеры выборок, критерии исключения и основные анализы. Open Science Framework, osf.io/uy4z3.Анализы были зарегистрированы до сбора данных, поэтому контрольный результат воспринимается как тест, а не как что-то, замеченное позже.
- Олеарт, А., & Паломо Эрнандес, Н. (2025). Почему техносолюшинизм ИИ вредит демократии и обсуждению: ЕС, собрания граждан и машина Хабермаса. Журнал делиберативной демократии, 21(1), 1-6.Самая сильная критика: участники оценивают результаты работы машины, а не спорят друг с другом, что авторы называют обсуждением без граждан.
- Институт Первой поправки Рыцаря. Может ли ИИ-медиация улучшить демократическое обсуждение?На нерепрезентативных обучающих данных, проблема масштабируемого надзора и предположение о том, что участники аргументируют искренне.
- Новеки, Б. С. Машина мира? Как ИИ может помочь людям найти общий язык в демократическом обсуждении. Перезагрузка демократии.Утверждает, что согласование определения проблемы, а не достижение консенсуса, является основным ограничением в реальном управлении.
Часто задаваемые вопросы
Что на самом деле показало исследование 2024 года в журнале Science о делиберации с использованием ИИ?
Было установлено, что структурирование письменных мнений группы в виде заявления кандидата, ранжирование его по голосованию с равным весом, критика и переработка увеличивали согласие группы примерно на восемь процентных пунктов, в то время как простое чтение участниками мнений друг друга не привело к изменениям (P = 0.64). Заявления, полученные таким образом, предпочитались тем, которые были написаны обученными, финансово мотивированными медиаторами, в 56% случаев. В исследовании участвовали 5,734 участника из Великобритании, и оно было предварительно зарегистрировано.
Исследование доказывает, что ИИ лучше людей в ведении дискуссии?
Нет, и авторы этого не утверждают. ИИ генерировал утверждения за секунды, а не за минуты, и его предпочли 56% против 44%, но исследовательский анализ в той же статье показал аналогичное сближение среди человеческих посредников по раундам, которые они выиграли. Наиболее обоснованное толкование заключается в том, что посредническая структура — это то, что работает, и что модель может выполнять посредническую роль компетентно и быстро. Сам процесс не требует ИИ.
Процесс просто навязал большинственное мнение всем?
Нет. Первоначальные групповые заявления оценивали позиции меньшинства на уровне 0,29 при истинной доле меньшинства 0,29, а заявления после критики оценивались на уровне 0,36, что переоценивало меньшинство относительно его размера. Девяносто шесть процентов заявлений находились в диапазоне мнений, которые группа действительно придерживалась. Поддержка действительно сместилась в сторону большинства в целом, но не было связи между тем, как часто люди видели заявления, склоняющиеся к большинству, и тем, насколько они изменились (P = 0,37), поэтому одно лишь воздействие не было движущей силой.
Каковы основные ограничения исследования?
Участники были жителями Великобритании, обсуждающими вопросы политики Великобритании; группы состояли всего из пяти человек, поэтому ничего не тестировалось на уровне ассамблеи; система не может проверять факты, модерировать или поддерживать обсуждение в рамках темы, и авторы отмечают, что плохо информированный ввод приводит к плохо информированному выводу; обучающая выборка недопредставляла людей старше 65 лет; и процедура предполагает, что участники искренне выражают свои мнения. Авторы также признают, что ИИ может не быть активным ингредиентом, поскольку человеческие посредники достигали аналогичного согласия в раундах, которые они выиграли.
Что такое машина Хабермаса?
Это название, которое исследователи дали своей системе, в честь Юргена Хабермаса, который утверждал, что согласие возникает, когда люди рассуждают вместе в справедливых условиях. Она сочетает в себе генеративную модель, которая разрабатывает кандидатные групповые заявления на основе письменных мнений участников, с персонализированной моделью вознаграждения, которая предсказывает, как каждый участник оценит каждый проект, а затем выбирает победителя через смоделированные выборы с равным весом голосов. Она была построена на тонко настроенной модели Chinchilla 70B, которая превзошла модель Gemini 1.5 Pro с подсказками в той же задаче.
Как мне это применить без использования ИИ?
Запустите четыре движения, которые процедура изолировала. Попросите всех написать свою позицию и обоснование наедине перед любыми обсуждениями; примерно 65 слов будет достаточно. Попросите кого-то синтезировать это в один проект того, что группа считает общим, а не распространять мнения сами по себе, так как их распространение является условием, которое не дало эффекта. Выбирайте между проектами по равному весу, а не по тому, кто говорит последним. Затем проведите формальный раунд, где каждый напишет возражение, и пересмотрите проект с учетом этого.
Связанные материалы
4 фазы продуктивных дебатов (и 10 правил, которые обеспечивают справедливость)
Процедура, которую подтверждает это исследование, осуществляется вручную: явные позиции, структурированный обмен, формальный раунд возражений и зафиксированный результат.
Альтернативы форумам для обсуждений: что использовать вместо них в онлайн-курсах
Резьбовая доска является контрольным условием исследования. Она циркулирует мнения и ничего не синтезирует. Вот что нужно запустить вместо этого.
Согласие против консенсуса: что из этого вам следует использовать?
Исследование измеряло согласие. Это различие между группой, которая согласна, и группой, которая просто перестала возражать.
Как избежать группового мышления в командных решениях
Почему конвергенция является хорошим знаком только тогда, когда структура изначально облегчала выражение несогласия.

