1906年、フランシス・ガルトン — 優れた統計学者であり、民主的判断に対してオープンな懐疑者 — は、牛の処理後の体重に対する787の推定を分析し、群衆が無力であることを証明することを期待していました。中央値の推定は1,207ポンドでした。牛の体重は1,198ポンドでした。群衆は専門家を上回り、集団判断の科学が誕生しました。
- 設定: プリマスの家畜フェアでの6ペンスの体重判断コンテスト; 約800枚のカード、787枚の有効
- 結果: 中央値1,207ポンド対実際の1,198ポンド — 約0.8%以内; 後に記載された平均は1,197ポンドでした
- なぜ機能するのか: 独立した多様な誤差が集約されると部分的に相殺される
- 落とし穴: 独立性を破る — 人々が互いにコピーさせる — と、魔法は逆転する
- 遺産: 予測市場、アンサンブル機械学習、構造化されたグループ意思決定はすべて、この1日の午後から派生しています
群衆を愚かだと証明したい科学者
集団知性における最も有名な実験の最良の部分は、それが見つけたことの反対を証明するために設計されたことです — 少なくとも精神的には。
1906年までに、フランシス・ガルトンはイギリスで最も優れた科学者の一人でした。チャールズ・ダーウィンのいとこであり、相関と平均への回帰の統計的概念を先駆け、天気図を発明し、指紋識別を科学的な基盤に置きました。彼はまた — これは物語にとって重要です — 普通の人々の判断に対して深く懐疑的でした。ガルトンは、知性は小さな遺伝的エリートに集中していると信じていました。彼は「優生学」という用語を作り、それを数十年にわたって推進しました。この遺産は今日では正当に非難されており、彼がこの問題にアプローチする方法から切り離すことはできません。彼が統計的手法を群衆に向けたとき、彼はその無能さを文書化することを期待していました。
したがって、84歳のガルトンが1906年秋にプリマスの西部肥育家畜と家禽の展示会を歩き回り、体重判断コンペティションに出くわしたとき、彼は魅力的なデータセットを見ました。ここには、専門家もいれば、そうでない人もいる群衆がいて、事実に関する数百の独立した数値判断を行っていました。小額の参加費が彼らを正直に保ち、賞品が彼らを動機づけました。彼が後に『ネイチャー』に書いたように、平均的な競技者は、平均的な有権者が投票するほとんどの政治問題のメリットを判断するのに適しているのと同じくらい、牛を判断するのに適している可能性が高いです。民主主義への類推が全体のポイントでした。ガルトンは、ボックス・ポプリ — 人々の声 — が自らを恥ずかしめることを期待していました。
カントリーフェア、太った牛、787枚の6ペンスのチケット
コンテストのメカニズムはシンプルで、今では理想的な実験デザインに偶然近いことがわかっています。生の牛が展示されていました。6ペンスで、誰でもスタンプと番号の付いたカードを購入し、名前と住所を書き込み、牛が屠殺されて処理された後の体重を推定することができます — 商業的に意味のある数字であり、動物の生体重よりも難しい質問です。最も正確な推定が賞品を獲得しました。
この設定の3つの特徴は注目に値します。なぜなら、それぞれが後の研究で集団の正確性に不可欠であることが示された条件に対応しているからです。まず、6ペンスの料金は純粋な実用的ジョーカーを排除しました — 人々はゲームに参加していました。次に、各カードはプライベートに記入されました:手を挙げることはなく、オークショニアが進行中の合意を呼びかけることもなく、コピーするための目に見えるリーダーもいませんでした。判断は独立していました。第三に、群衆は本当に混合されていました:専門的な知識を持つ肉屋や農家が、ガルトンの言葉で言えば、その瞬間の気まぐれに導かれた事務員や家族と並んでいました。判断は多様でした。
コンテストの後、ガルトンはカードを借りました。約800枚のうち、13枚は判読不能またはその他の欠陥があり、787枚の有効な推定が残りました。彼はそれらを整理し、集計し、分布をプロットし、分位数を計算しました — 完全な統計的作業で、1907年3月7日に『ネイチャー』に「ボックス・ポプリ」というタイトルで発表されました (ガルトン, F., ネイチャー, 75, 450–451)。
彼を驚かせた結果
最も中央の推定 — 現在私たちが中央値と呼んでいるもの — は1,207ポンドでした。屠殺されて処理された牛の体重は1,198ポンドでした。群衆の集団的な判断は9ポンドの誤差がありました:約0.8%の誤差で、出席していた牛の専門家の推定よりも近いものでした。
ガルトンは — 科学者としての彼の真の評価において — 結果をそのまま報告しました。「この結果は、民主的判断の信頼性に対して期待されていたよりも、より信用できると思います」と彼は書きました。健全な判断が稀な遺伝的贈り物であると主張してきた男からの言葉として、この文は静かな科学的譲歩です:データは彼の以前の考えを打ち破りました。
その後の通信で物語はさらに良くなりました。『ネイチャー』の読者が書き込み、彼の返信(「投票箱」、ネイチャー, 75, 509)でガルトンは、787の推定の算術平均が1,197ポンドであることを認めました — 実際の体重から1ポンドの誤差です。1世紀後、計量経済学者のケネス・ウォリス(「フランシス・ガルトンの予測コンペティションを再訪する」、2014)は、元のデータと周囲のやり取りを再検討し、ジェームズ・スロウィッキーが有名にした物語の本質を確認しました。平均の1ポンドの誤差は、今日一般的に引用されるバージョンです。中央値の9ポンドの誤差は、ガルトンが実際に最初に示したものでした。どちらも驚くべきことです。
中央値か平均か?ガルトンの統計的選択は今でも重要
なぜガルトンは最も中央の推定を好んだのでしょうか?彼の理由は明示的に政治的でした:中央値は群衆の過半数が投票で承認する値です。他のすべての値は、それが高すぎるか低すぎると思う人々によって否決されます。言い換えれば、中央値は群衆の民主的な判断です — これは彼がテストしようとしたボックス・ポプリに関する正確な質問でした。
しかし、政治的なものの中には統計的な議論が隠れており、今日でも教えられています。中央値はロバストな統計量です:少数のばかげた推定 — 誰かが笑いのために10,000ポンドと書く — はほとんど影響を与えませんが、平均は単一の外れ値によって恣意的に引きずられる可能性があります。一方、平均はデータの情報をより多く使用し、誤差がほぼ対称で独立している場合、より効率的に相殺します。ガルトンの群衆は十分に行儀が良かったため、両方が機能しました:中央値は9ポンドの誤差、平均は1ポンドの誤差でした。より混沌とした群衆 — オンライン投票、モデレートされていないフォーラム — では、中央値のロバスト性がしばしば勝ちます。集約メカニズムを選択することは、群衆の尾をどれだけ信頼するかに関する決定です。
なぜ平均化が機能するのか:誤差相殺の算術
ガルトンの結果には神秘主義はありません。各推定は真の値に誤差を加えたものと考えることができます。誤差が独立しており、真実の両側に散らばっている場合 — 一部の肉屋は過大評価し、一部は過小評価します — 推定を合計することで、誤差の多くが相殺され、共有された信号が蓄積されます。誤差が多様で独立しているほど、より積極的に相殺されます。
スコット・ページは後にこの直感を多様性予測定理(ページ, 差異, 2007)として形式化しました:二乗誤差の場合、集団の誤差は平均的な個人の誤差マイナス予測の多様性に等しいです。これは数学的な同一性であり、経験的な主張ではありません — それが非常に有用な理由です。群衆はその平均的なメンバーを、メンバー同士がどれだけ意見が異なるかによって正確に上回ります。多様性は持っているべきものではなく、算術的には全体の利点です。クローンの群衆は集約から何も得られません。
同じ論理は、数量ではなくはい/いいえの質問に対して、ガルトンの1世紀以上前に発見されました。マルキ・ド・コンドルセは1785年に、各有権者が偶然よりもわずかに正しい可能性が高く、かつ有権者が独立して判断する場合、グループが大きくなるにつれて過半数が正しい確率が確実性に近づくことを証明しました。私たちはその物語 — そしてその仮定が崩れたときの定理の劇的な失敗の仕方 — を、コンドルセの陪審員定理に関する補足記事で語ります。
脚注からフレームワークへ:スロウィッキーの4つの条件
20世紀のほとんどの間、ガルトンの牛は統計的な好奇心でした。それは2004年に変わり、ジェームズ・スロウィッキーが群衆の知恵をプリマスの物語で始め、株式市場から検索エンジンまでの証拠を1世紀分集め、群衆が体系的に賢いことができることを示しました。重要なのは、スロウィッキーが群衆が常に賢いと主張しなかったことです。彼は、ガルトンのフェアが偶然に満たした4つの条件を特定し、賢い群衆が意図的に必要とする条件を特定しました:
意見の多様性
各人は何らかのプライベートな情報や質問の解釈の異なる方法を持ち寄ります。肉屋、農家、カジュアルなフェアゴーアは皆、牛を異なって読み取り、彼らの異なる誤差は部分的に相殺されました。
独立性
各チケットはプライベートに記入され、手を挙げることや大声の専門家が部屋を固定することはありませんでした。誰もリーダーをコピーできませんでした。なぜなら、目に見えるリーダーがいなかったからです。
分散化
"公式"な推定が何であるべきかを決定する委員会はありませんでした。すべての参加者は自分の地域の知識 — 牛を判断する何年もの経験、またはただの良い目 — に基づいていました。
集約
メカニズムが787のプライベートな判断を1つの集団的な答えに変えました。チケットの山とそれを集計する意欲のある人がいなければ、知恵は個々の頭の中に閉じ込められたままです。
いずれかの条件を取り除くと、群衆は単にその優位性を失うだけでなく、共有されたバイアスを増幅することによって、メンバーよりも悪化する可能性があります。4つの条件とその失敗モードの完全な科学については、群衆の知恵に関するガイドをご覧ください。
細則:フェアが正しかったこと、会議が間違っていること
会議を運営する人にとって不快な質問があります:あなたの組織の中で、ガルトンのフェアのように構造化されたグループ決定はどれくらいありますか — そして、正反対のように構造化されたものはどれくらいありますか?
フェアでは、すべての判断がプライベートに、書面で、他の誰かの数字を見る前にコミットされました。典型的な会議では、最も上級または最も自信のある人が最初に発言し、その後のすべての「推定」は彼らのものに基づいています。30人が同意しているように見えるものは、しばしば1人の推定と29のエコーです。経済学者はこのメカニズムを情報カスケードと呼びます:いくつかの初期の意見が見えるようになると、各後続の人が自分の情報を割り引いてコピーすることが個人的に合理的になります — そして群衆の独立性、全現象の荷重条件が静かに崩壊します (ビクチャンダニ、ヒルシュレイファー & ウェルチ, 1992)。私たちは、情報カスケードに関するガイドでメカニズムをカバーしています。
これが、ガルトンの実験の再現が時々失望する理由でもあります:可視の進行中の平均で牛の推定ゲームを実行するか、参加者に推定を叫ばせると、正確性が低下します。魔法は決して群衆の中にはありませんでした — プロトコルの中にありました。6ペンス、プライベートカード、ロックされた投票箱は、ほとんどの会議室よりも優れた意思決定アーキテクチャであることが判明しました。
牛の現代の子孫
ガルトンが文書化した集約原則は、現在、驚くべき範囲の現代のシステムに通じています:
予測市場
1988年に設立されたアイオワ電子市場は、トレーダーの信念を価格に集約します。バーグ、ネルソン、リーツ(2008)は、1988年から2004年の大統領選挙における964の全国調査と市場を比較しました:市場は74%の確率で結果に近かったです。
アンサンブル機械学習
ランダムフォレストや他のアンサンブル手法は、シリコンの中のガルトンの牛です:多くの不完全で部分的に独立したモデルが、投票または平均化によって集約され、単一のモデルよりも正確な予測に変わります。
予測平均化
経済学者、天気モデル、選挙予測者からの予測を組み合わせることは、ガルトンが偶然に発見した誤差相殺の理由で、通常はほとんどの個々の予測を上回ります。
推定演習
この実験は再現が容易です:グループに独立して書面で数量を推定させ、その後集約します。教室やワークショップでの再現は、統計的集約の標準的なデモンストレーションとして残っています。
各子孫は異なるものを集約します — 市場は信念を価格に、アンサンブルはモデルの出力を予測に、投票システムは好みを結果に集約します — そしてそれぞれが同じ依存関係を引き継ぎます:集約は、それを供給するものの独立性と多様性と同じくらい良いです。その家族の類似性は、1785年のコンドルセの定理から今日のMITの集団知性研究までの全研究伝統の通過線です — 240年の弧を、集団知性:240年の研究で追跡します。
ガルトンの牛があなたのチームに意味すること
1906年の実験の実用的な翻訳は短いチェックリストであり、意思決定のライフサイクルの特定のポイント — 判断を集めて組み合わせる瞬間 — に適用されます。グループが熟考を始める前に:
- 最初に独立して、書面で推定を集める。 会議の前に、上級者が発言する前に。判断が可視化される瞬間、独立性 — そして群衆の統計的優位性 — は減少し始めます。
- 多様な視点を積極的に募集する。 多様性予測定理は明確です:あなたの平均的なメンバーに対する集団的な利点はあなたの多様性です。同じ背景と同じ情報を持つ人々のパネルは、多くの名札を持つ1つの推定です。
- 集約メカニズムを意図的に選択する。 混沌とした群衆には中央値、行儀の良い群衆には平均、判断に複数の次元がある場合には構造化された評価を。 「私たちは議論し、合意に達しました」は集約メカニズムではありません — 通常はアンカリングメカニズムです。
- 数字だけでなく理由を保持する。 ガルトンのカードは、群衆が何を考えているかを教えてくれましたが、なぜかは教えてくれませんでした。牛にとってはそれで良いですが、戦略的な決定にとっては、状況が変わったときに必要な部分です。
最後のポイントは、現代の協力的意思決定がガルトンを超えているところです。Argumentreeは、推論を添えたフェアグラウンドプロトコルをチームに提供するように構築されています:参加者は、部屋が収束する前に、独立して非同期に議論を提供し、グループは各議論を明示的な次元(有用性、明確さ、正確さ、完全性)で評価し、評価は787枚のカードが1,207ポンドに集約されたように合意スコアに集約されます。匿名の貢献オプションは、階層からの独立性を保護し、完全な監査トレイルは、牛のコンテストが決してできなかったことを保持します:数字の背後にある理由です。
ガルトンは、普通の判断が信頼できないことを証明するためにフェアに行きました。彼は、正しく集約されればそれができるという、誰もがこれまでに生産した最も強力な証拠を持って帰りました。道具は投票箱からソフトウェアに変わりましたが、教訓は変わっていません。
よくある質問
ガルトンの牛の実験とは何ですか?
1906年秋、統計学者フランシス・ガルトンは、プリマスで開催された西イングランド肥育家畜および家禽展示会での体重判断コンテストを分析しました。来場者は、牛が「屠殺されて処理された」後の生牛の体重を推測するために6ペンスを支払いました。ガルトンは787枚のカードを収集し、その中で読み取れる有効なものを見つけました。中央値の推測は1,207ポンドで、実際の処理後の体重は1,198ポンドでした:約0.8%以内で、出席していた家畜専門家の推定よりも優れていました。彼はこの分析を1907年3月に『ネイチャー』に「ボックス・ポプリ」として発表しました。
なぜガルトンの牛の実験は重要なのですか?
それは群衆の知恵の創始的な実証です:適切な条件下では、多くの独立した不完全な判断の合計が、個々の専門家の判断よりも正確である可能性があります。この結果は、平均的な有権者の無能さを示すことを期待していたガルトン自身を驚かせました。ジェームズ・スロウィッキーは、2004年の著書『群衆の知恵』の冒頭でこの話を紹介し、基礎となる統計は現在、予測市場やアンサンブル機械学習を支えています。
ガルトンは平均値を使用しましたか、それとも中央値を使用しましたか?
元の『ネイチャー』の記事で、ガルトンは1,207ポンドの「中央値の推定」を報告し、群衆の半分が答えを高く、半分が低く考えていたため、民主的に公正な選択であると主張しました。追跡の通信では、推測の算術平均が1,197ポンドであり、真の1,198ポンドからわずか1ポンドの差であることを認めました。このやり取りは、ロバスト統計に関する初期の議論です:中央値は極端な外れ値による歪みに抵抗し、平均は誤差がほぼ対称的な場合により多くの情報を抽出します。
群衆が賢くなるためにはどのような条件が必要ですか?
ジェームズ・スロウィッキー(2004)は、4つの条件を特定しました:意見の多様性(人々は異なる情報と解釈を持つ)、独立性(判断は他者を模倣せずに形成される)、分散化(人々は自分の地域の知識を活用する)、および集約(メカニズムが個々の判断を集団の答えに結合する)。ガルトンのコンテストはこの4つすべてを満たしており、まさにそれが成功の理由です。いずれか1つを取り除くと、群衆の利点は減少または逆転します。
群衆はいつ失敗しますか?
群衆は独立性が崩れると失敗します — 人々が互いの答えを見たり模倣したりできると、早期の推測がグループ内で連鎖し、誤りが相関し、合計が最初の大きな声が言ったことに向かって漂流します。情報の連鎖、グループシンク、エコーチャンバーはすべてこの失敗のバージョンです。チームへの教訓:誰も声に出して議論する前に、独立して書面で判断を集めることです。
群衆の知恵は多数決と同じですか?
関連はありますが、同一ではありません。ガルトンの牛は数値推定を集約することを含んでおり、平均化によって誤差が相殺されます。はい/いいえの質問に対する多数決は、コンドルセの陪審定理(1785)によって支配されており、各有権者が偶然よりも優れていて独立して投票する限り、グループのサイズが大きくなるにつれて多数派が劇的に信頼性が高くなることを示しています。どちらも集約メカニズムです;投票は離散的な選択を集約し、平均化は量を集約します。
Argumentree Team
Decision Science
The Argumentree team explores the science of better decisions—from 18th-century mathematics to modern AI.
あなたのチームにフェアグラウンドプロトコルを提供してください。
Argumentreeは、判断を独立して集め、合意スコアに集約し、記録に推論を保持します — ガルトンの群衆を賢くした条件が、あなたの意思決定に組み込まれています。
無料14日間トライアルを開始 →
