Wisdom of Crowds: Galton's Ox — The 1906 Experiment That Proved Crowds Beat Experts
Decision Science

Wisdom of Crowds: Galton's Ox — The 1906 Experiment That Proved Crowds Beat Experts

AT
Argumentree Team
Decision Science
July 25, 2026
14 min читать
Эксперимент с быком Гальтона является основным доказательством мудрости толпы. Осенью 1906 года на Выставке мясного скота и птицы на Западе Англии в Плимуте 84-летний статистик Фрэнсис Гальтон проанализировал конкурс по оценке веса, в котором посетители выставки платили шиллинг, чтобы оценить убойный вес живого быка. Из примерно 800 карточек 787 были разборчивыми; медианная оценка составила 1207 фунтов при фактическом весе 1198 фунтов — в пределах около 0,8% — и, как позже признал Гальтон в последующей переписке, среднее значение составило 1197 фунтов, на один фунт меньше. Гальтон, скептически настроенный к демократическому суждению, ожидал доказать, что средний избиратель некомпетентен; вместо этого он опубликовал результат в журнале Nature (1907) под названием «Vox Populi». Эксперимент работает, потому что независимые, разнообразные ошибки частично компенсируются при агрегировании — принцип, формализованный в теореме жюри Кондорсе (1785), кодифицированный четырьмя условиями Джеймса Суровецкого (разнообразие, независимость, децентрализация, агрегирование, 2004) и применяемый сегодня на рынках прогнозов и в ансамблевом машинном обучении. Преимущество толпы исчезает, когда независимость нарушается через информационные каскады или социальное влияние. В жизненном цикле принятия решений урок Гальтона применим на этапе агрегирования: собирайте суждения независимо перед обсуждением. Argumentree реализует это с помощью независимой асинхронной подачи аргументов, многомерной оценки, агрегированной в консенсусные баллы, и документированного следа рассуждений.
Share:
Кратко

В 1906 году Фрэнсис Гальтон — блестящий статистик и открытый скептик демократического суждения — проанализировал 787 оценок убойного веса быка, ожидая доказать, что толпа безнадежна. Медианная оценка составила 1207 фунтов. Бык весил 1198 фунтов. Толпа обошла экспертов, и наука о коллективном суждении была рождена.

  • Установка: конкурс по оценке веса за шиллинг на ярмарке скота в Плимуте; ~800 карточек, 787 действительных
  • Результат: медиана 1207 фунтов против фактических 1198 фунтов — в пределах ~0,8%; среднее, отмеченное позже, составило 1197 фунтов
  • Почему это работает: независимые, разнообразные ошибки частично компенсируются при агрегировании
  • Подводный камень: нарушить независимость — позволить людям копировать друг друга — и магия исчезает
  • Наследие: рынки прогнозов, ансамблевое машинное обучение и структурированное групповое принятие решений все происходят от этого одного послеобеденного времени

Ученый, который хотел доказать, что толпы глупы

Лучшая часть самого известного эксперимента в области коллективного интеллекта заключается в том, что он был спроектирован — по крайней мере, в духе — чтобы доказать противоположное тому, что он обнаружил.

К 1906 году Фрэнсис Гальтон был одним из самых выдающихся ученых в Британии. Кузен Чарльза Дарвина, он стал пионером статистических концепций корреляции и регрессии к среднему, изобрел метеорологическую карту и поставил идентификацию по отпечаткам пальцев на научную основу. Он также был — и это важно для истории — глубоко скептически настроен к суждению обычных людей. Гальтон считал, что интеллект сосредоточен в небольшой наследственной элите; он ввел термин «евгеника» и потратил десятилетия на его продвижение, наследие, которое сегодня справедливо осуждается и неотделимо от того, как он подходил к этому вопросу. Когда он применил свои статистические инструменты к толпе, он ожидал задокументировать ее некомпетентность.

Поэтому, когда 84-летний Гальтон прогуливался по Выставке мясного скота и птицы на Западе Англии в Плимуте осенью 1906 года и наткнулся на конкурс по оценке веса, он увидел неотразимый набор данных. Вот толпа — некоторые эксперты, большинство нет — делали сотни независимых числовых оценок по вопросу факта, с небольшой платой за участие, чтобы сохранить честность, и призом, чтобы поддержать мотивацию. Как он позже написал в Nature, средний участник, вероятно, был так же хорошо подготовлен для оценки быка, как средний избиратель для оценки достоинств большинства политических вопросов, по которым он голосует. Аналогия с демократией была всей сутью. Гальтон ожидал, что vox populi — голос народа — опозорит себя.

Сельская ярмарка, толстый бык и 787 билетов за шиллинг

Механика конкурса была проста и — как мы теперь знаем — случайно близка к идеальному экспериментальному дизайну. Живой бык был на выставке. За шиллинг любой мог купить штампованную и пронумерованную карточку, написать на ней свое имя и адрес и записать свою оценку того, сколько бык весил после убоя и разделки — коммерчески значимая цифра и более сложный вопрос, чем живой вес животного. Самые точные оценки получали призы.

Три особенности этой установки заслуживают внимания, потому что каждая из них соответствует условию, которое последующие исследования показали как необходимое для коллективной точности. Во-первых, плата в шиллинг отсеивала чистых практических шутников — у людей были интересы в игре. Во-вторых, каждая карточка заполнялась конфиденциально: не было голосования, не было аукциониста, который бы объявлял текущий консенсус, не было видимого лидера, которого можно было бы копировать. Оценки были независимыми. В-третьих, толпа была действительно смешанной: мясники и фермеры с профессиональной экспертизой стояли рядом с клерками и семьями, которые, по словам Гальтона, были руководимы капризом момента. Оценки были разнообразными.

После конкурса Гальтон занял карточки. Из примерно 800 тринадцать были неразборчивыми или иными образом дефектными, оставив 787 действительных оценок. Он отсортировал их, составил таблицы, построил их распределение и вычислил их квантили — полное статистическое исследование, опубликованное в Nature 7 марта 1907 года под заголовком «Vox Populi» (Гальтон, Ф., Nature, 75, 450–451).

Результат, который удивил его

Самая центральная оценка — то, что мы теперь называем медианой — составила 1207 фунтов. Бык, убитый и разделанный, весил 1198 фунтов. Коллективный вердикт толпы оказался неверным на девять фунтов: ошибка около 0,8%, ближе, чем оценки присутствующих экспертов по скоту.

Гальтон — к его искреннему кредиту как ученого — сообщил результат прямо. «Этот результат, я думаю, более заслуживает доверия демократического суждения, чем можно было ожидать», — написал он. Исходя от человека, который потратил свою карьеру, утверждая, что здравое суждение — это редкий наследственный дар, это предложение является тихим научным признанием: данные превзошли его прежние ожидания.

История стала лучше в переписке, которая последовала. Читатели Nature написали, и в своем ответе («Избирательная урна», Nature, 75, 509) Гальтон признал, что арифметическое среднее всех 787 оценок составило 1197 фунтов — на один фунт меньше истинного веса. Спустя век эконометрист Кеннет Уоллис («Возвращение к конкурсу прогнозов Фрэнсиса Гальтона», 2014) снова изучил оригинальные данные и сопутствующий обмен, подтвердив основные моменты истории, которую сделал известной Джеймс Суровецкий. Ошибка в один фунт по среднему значению — это версия, которая обычно цитируется сегодня; девятифунтовая ошибка медианы — это то, с чем на самом деле начал Гальтон. Оба удивительны.

Медиана или среднее? Статистический выбор Гальтона все еще важен

Почему Гальтон предпочел самую центральную оценку? Его рассуждения были явно политическими: медиана — это значение, которое большинство толпы утвердило бы на голосовании. Каждое другое значение было бы отвергнуто теми, кто считал его слишком высоким или слишком низким. Медиана, другими словами, является демократическим вердиктом толпы — что и было именно тем вопросом о vox populi, который он хотел протестировать.

Но внутри политического аргумента скрывается статистический, и его все еще учат сегодня. Медиана — это устойчивая статистика: горстка абсурдных оценок — кто-то пишет 10 000 фунтов для смеха — едва сдвигает ее, в то время как среднее может быть произвольно сильно смещено одним выбросом. Среднее, с другой стороны, использует больше информации из данных и, когда ошибки примерно симметричны и независимы, более эффективно их компенсирует. Толпа Гальтона была достаточно хорошо себя ведущей, чтобы работали оба: медиана ошиблась на 9 фунтов, среднее — на 1 фунт. В более беспорядочных толпах — онлайн-опросах, немодерируемых форумах — устойчивость медианы часто побеждает. Выбор механизма агрегирования является решением о том, насколько вы доверяете краям вашей толпы.

Почему усреднение работает: арифметика отмены ошибок

В результате Гальтона нет мистики. Каждую оценку можно рассматривать как истинное значение плюс ошибка. Если ошибки независимы и разбросаны по обе стороны от истины — некоторые мясники переоценивают, некоторые недооценивают — тогда сложение оценок вместе отменяет большую часть ошибки, в то время как общий сигнал накапливается. Чем более разнообразны и независимы ошибки, тем более активно они отменяются.

Скотт Пейдж позже формализовал интуицию как теорему предсказания разнообразия (Пейдж, Разница, 2007): для квадратной ошибки коллективная ошибка равна средней индивидуальной ошибке минус разнообразие предсказаний. Это математическая идентичность, а не эмпирическое утверждение — что и делает ее такой полезной. Толпа обходит своего среднего участника ровно на столько, на сколько ее участники не согласны друг с другом. Разнообразие — это не просто приятное дополнение; это, арифметически, все преимущество. Толпа клонов ничего не получает от агрегирования.

Та же логика была открыта более века назад, для вопросов да/нет, а не количеств, до Гальтона. Маркиз де Кондорсе доказал в 1785 году, что если каждый избиратель даже немного более вероятно, чем случайно, прав, и избиратели судят независимо, вероятность того, что большинство правы, стремится к уверенности по мере роста группы. Мы рассказываем эту историю — и драматические способы, которыми теорема терпит неудачу, когда ее предположения нарушаются — в нашей сопроводительной статье о теореме жюри Кондорсе.

От сноски к структуре: четыре условия Суровецкого

На протяжении большей части двадцатого века бык Гальтона был статистической курьезом. Это изменилось в 2004 году, когда Джеймс Суровецкий открыл Мудрость толпы историей из Плимута и собрал столетие доказательств — от фондовых рынков до поисковых систем — что толпы могут быть систематически умными. Ключевым моментом является то, что Суровецкий не утверждал, что толпы всегда мудры. Он выделил четыре условия, которые ярмарка Гальтона удовлетворила случайно, и которые любая мудрая толпа нуждается целенаправленно:

Разнообразие мнений

Каждый человек приносит какую-то личную информацию или другой способ интерпретации вопроса. Мясники, фермеры и случайные посетители ярмарки все по-разному воспринимают быка — и их различные ошибки частично компенсировались.

Независимость

Каждый билет заполнялся конфиденциально, без поднятия рук или громкого эксперта, который бы вел обсуждение. Никто не мог скопировать лидера, потому что видимого лидера не было.

Децентрализация

Никакой комитет не решил, каким должно быть "официальное" оценка. Каждый участник опирался на свои местные знания — годы оценки скота или просто хороший глаз.

Агрегация

Механизм превратил 787 частных суждений в один коллективный ответ. Без груды билетов и кого-то, кто готов их подсчитать, мудрость остается запертой в индивидуальных умах.

Удалите любое одно условие, и толпа не просто теряет свое преимущество — она может стать активно хуже, чем ее члены, потому что агрегирование тогда усиливает общую предвзятость вместо того, чтобы отменять независимые ошибки. Для полного понимания науки о четырех условиях и их режимах неудачи смотрите наше руководство по мудрости толпы.

Мелкий шрифт: что ярмарка сделала правильно, а собрания — нет

Вот неудобный вопрос для любого, кто проводит собрания: сколько групповых решений в вашей организации структурированы как ярмарка Гальтона — и сколько структурированы как полная противоположность?

На ярмарке каждое суждение было зафиксировано конфиденциально, в письменной форме, до того, как кто-либо увидел номер другого. На типичном собрании самый старший или самый уверенный человек говорит первым, и каждое последующее «предположение» основывается на его. То, что выглядит как согласие тридцати человек, часто является предположением одного человека с двадцатью девятью эхо. Экономисты называют этот механизм информационным каскадом: как только несколько ранних мнений становятся видимыми, становится индивидуально рациональным для каждого последующего человека игнорировать свою собственную информацию и копировать — и независимость толпы, основное условие всего явления, тихо рушится (Бикчандани, Хиршлефер и Уэлч, 1992). Мы рассматриваем механику в нашем руководстве по информационным каскадам.

Вот почему репликации эксперимента Гальтона иногда разочаровывают: проведите игру по угадыванию веса быка с видимым текущим средним, или позвольте участникам выкрикивать свои предположения, и точность ухудшается. Магия никогда не была в толпе — она была в протоколе. Шиллинг, частная карточка и запертая урна для голосования оказались лучшей архитектурой принятия решений, чем большинство конференц-залов.

Современные потомки быка

Принцип агрегирования, задокументированный Гальтоном, теперь проходит через замечательный спектр современных систем:

Рынки предсказаний

Электронные рынки Айовы, основанные в 1988 году, агрегируют мнения трейдеров в цены. Берг, Нельсон и Риетц (2008) сравнили рынок с 964 национальными опросами в период президентских выборов 1988–2004 годов: рынок был ближе к результату в 74% случаев.

Ансамблевое машинное обучение

Случайные леса и другие ансамблевые методы — это окс Галтона в кремнии: множество несовершенных, частично независимых моделей объединяются — голосованием или усреднением — в предсказание, более точное, чем любая отдельная модель.

Прогнозирование усреднения

Сочетание прогнозов — будь то от экономистов, метеорологических моделей или предсказателей выборов — регулярно превосходит большинство индивидуальных прогнозов по тем же причинам отмены ошибок, на которые наткнулся Гальтон.

Упражнения по оценке

Эксперимент легко воспроизвести: попросите группу независимо и письменно оценить количество, а затем агрегируйте. Воспроизведения в классе и на семинарах остаются стандартной демонстрацией статистической агрегации.

Каждый потомок агрегирует что-то другое — рынки агрегируют убеждения в цены, ансамбли агрегируют выходы моделей в прогнозы, системы голосования агрегируют предпочтения в результаты — и каждый наследует ту же зависимость: агрегат хорош только настолько, насколько независимость и разнообразие того, что его наполняет. Это семейное сходство является сквозной линией всей исследовательской традиции, от теоремы Кондорсе 1785 года до исследований коллективного интеллекта Центра коллективного интеллекта MIT сегодня — 240-летняя дуга, которую мы прослеживаем в Коллективный интеллект: 240 лет исследований.

Что означает бык Гальтона для вашей команды

Практическое применение эксперимента 1906 года — это короткий контрольный список, и он применяется в один конкретный момент в жизни решения — в момент, когда вы собираете и комбинируете суждения, прежде чем группа начнет обсуждение:

  • Соберите оценки независимо, в письменной форме, сначала. Перед встречей, до того как заговорит старший человек. В момент, когда суждения становятся видимыми, независимость — и статистическое преимущество толпы — начинают угасать.
  • Активно привлекайте разнообразные точки зрения. Теорема предсказания разнообразия проста: ваше коллективное преимущество над вашим средним участником это ваше разнообразие. Панель людей с одинаковым опытом и одинаковой информацией — это одно предположение с множеством бейджиков.
  • Выбирайте механизм агрегации осознанно. Медиана для неупорядоченных толп, среднее для хорошо себя ведущих, структурированная оценка, когда суждения имеют несколько измерений. “Мы обсудили это и пришли к консенсусу” не является механизмом агрегации — это обычно механизм якорения.
  • Сохраняйте причины, а не только цифры. Карты Гальтона говорили ему что думала толпа, но никогда почему. Для быка это нормально. Для стратегического решения рассуждение — это то, что вам понадобится, когда обстоятельства изменятся.

Этот последний пункт — это то, где современное коллективное принятие решений выходит за рамки Гальтона. Argumentree создан для того, чтобы дать команде протокол ярмарки с прикрепленным рассуждением: участники вносят аргументы независимо и асинхронно — до того, как комната сойдется — в структурированное дерево «за» и «против»; затем группа оценивает каждый аргумент по явным измерениям (полезность, ясность, точность, полнота), и оценки агрегируются в консенсусные баллы так же, как 787 карточек агрегировались в 1207 фунтов. Анонимные варианты участия защищают независимость от иерархии, а полный след аудита сохраняет то, что конкурс быков никогда не мог: почему за числом.

Гальтон пришел на ярмарку, чтобы доказать, что обычному суждению нельзя доверять. Он ушел с самым сильным доказательством, которое кто-либо когда-либо предоставлял, что — при правильном агрегировании — ему можно доверять. Инструмент изменился с избирательной урны на программное обеспечение. Урок остался прежним.

Часто задаваемые вопросы

Что такое эксперимент с быком Гальтона?

Осенью 1906 года статистик Фрэнсис Гальтон проанализировал конкурс по определению веса на Выставке мясного скота и птицы на Западе Англии в Плимуте. Посетители выставки платили шесть пенсов, чтобы угадать вес живого быка после того, как его "убили и разделали". Гальтон собрал карточки — 787 были разборчивыми и действительными — и обнаружил, что среднее (медианное) предположение составило 1,207 фунтов при фактическом весе в 1,198 фунтов: в пределах около 0.8%, и лучше, чем оценки присутствующих экспертов по скоту. Он опубликовал анализ в "Vox Populi" в журнале Nature в марте 1907 года.

Почему эксперимент с быком Гальтона важен?

Это основное эмпирическое доказательство мудрости толпы: при правильных условиях совокупность многих независимых, несовершенных суждений может быть более точной, чем суждение отдельных экспертов. Результат удивил самого Гальтона, который ожидал продемонстрировать некомпетентность среднего избирателя. Джеймс Суровецкий открыл свою книгу 2004 года "Мудрость толпы" этой историей, а лежащая в основе статистика теперь поддерживает предсказательные рынки и ансамблевое машинное обучение.

Использовал ли Гальтон среднее или медиану?

В оригинальной статье в Nature Гальтон сообщил о "среднем предположении" — медиане — 1,207 фунтов, утверждая, что это был демократически справедливый выбор, потому что половина толпы считала ответ выше, а половина ниже. В последующей переписке он признал, что арифметическое среднее предположений составило 1,197 фунтов — всего на один фунт меньше истинных 1,198 фунтов. Этот обмен является ранним аргументом о надежной статистике: медиана устойчива к искажению дикими выбросами, в то время как среднее извлекает больше информации, когда ошибки примерно симметричны.

Какие условия нужны толпе, чтобы быть мудрой?

Джеймс Суровецкий (2004) выделил четыре: разнообразие мнений (люди обладают разной информацией и интерпретациями), независимость (суждения формируются без копирования других), децентрализация (люди опираются на свои собственные местные знания) и агрегация (механизм объединяет частные суждения в коллективный ответ). Конкурс Гальтона удовлетворял всем четырем — именно поэтому он сработал. Уберите любое одно, и преимущество толпы исчезает или обращается вспять.

Когда толпы терпят неудачу?

Толпы терпят неудачу, когда независимость нарушается — когда люди могут видеть и копировать ответы друг друга, ранние предположения каскадируют по группе, ошибки становятся коррелированными, и совокупность смещается к тому, что сказала первая громкая голос. Информационные каскады, групповое мышление и эхо-камеры — все это версии этой неудачи. Урок для команд: собирайте суждения независимо и в письменной форме, прежде чем кто-либо обсудит их вслух.

Является ли мудрость толпы тем же самым, что и голосование большинства?

Они связаны, но не идентичны. Эксперимент с быком Гальтона включал агрегацию числовых оценок, где усреднение отменяет ошибки. Голосование большинства по вопросам да/нет регулируется теоремой жюри Кондорсе (1785), которая показывает, что большинство становится значительно более надежным по мере увеличения размера группы — при условии, что каждый избиратель лучше случайности и голосует независимо. Оба являются механизмами агрегации; голосование агрегирует дискретные выборы, в то время как усреднение агрегирует количества.

AT

Argumentree Team

Decision Science

The Argumentree team explores the science of better decisions—from 18th-century mathematics to modern AI.

Дайте вашей команде протокол ярмарки.

Argumentree собирает суждения независимо, агрегирует их в консенсусные баллы и сохраняет рассуждения на записи — условия, которые сделали толпу Гальтона мудрой, встроенные в ваши решения.

Начать бесплатную 14-дневную пробную версию →

Связанные статьи