同じデータを29チームに渡したら、答えがバラバラになった。「分析の自由度」という科学の盲点

同じデータを29チームに渡したら、答えがバラバラになった。「分析の自由度」という科学の盲点

読む前に予想してみよう!

同じデータを使えば、専門家なら誰が分析しても同じ結論になる

研究カード(どんな研究?)
対象
61人の分析者(29チーム)
規模
同一データセット1つ
研究の種類
多分析者(クラウドソーシング)研究
確かさ
★★★★☆
3秒でわかる

同じデータ・同じ問いを29の専門家チームが分析したら、「効果あり」が20チーム、「はっきりしない」が9チーム。データ分析の“分かれ道”が結論を揺らす。

ひとことで言うと同じ材料と同じレシピの指示でも、料理人ごとに味が変わる。データ分析もそうだった!

論文スペック表研究デザイン・規模・結果・その後(玄人向け)
研究デザイン
多分析者(クラウドソーシング)研究。1回目の分析の後、結果を伏せて方針を互いに評価しあい、2回目の分析を最終報告として提出
参加者
29チーム・61人の分析者
データ
イングランド・ドイツ・フランス・スペインの1部リーグ(2012–13年シーズン)の選手2,053人と審判3,147人。選手と審判の組み合わせ(146,028組)ごとの、同じ試合に出た回数とレッドカード数(観察データ)
主な指標
肌の色とレッドカードの関係を表すオッズ比
主な結果
オッズ比0.89〜2.93(中央値1.31)。有意20チーム(69%)、非有意9チーム(31%)
分析の多様さ
29の分析で共変量の組み合わせは21通り
後続の多分析者研究
脳画像で70チーム(2020年)、社会学で73チーム・161人(2022年)
もくじ
  1. 問い:審判は肌の色で判定を変えるのか
  2. 方法:29チームに「同じデータ、同じ問い」を配る
  3. 結果:オッズ比は0.89〜2.93。結論は「有意」20対「非有意」9
  4. 「分かれ道の庭」――ズルしなくても偽陽性は増える
  5. サッカーだけじゃない:脳画像でも社会学でも
  6. 処方箋:マルチバース分析と「手の内を見せる」科学
  7. 研究史の中の位置づけ
  8. まとめ

科学の論文には、たいてい「この効果は統計的に有意だった」という一文があります。読む側は「データがそう言っているなら、そうなんだろう」と受け取ります。

では、まったく同じデータを、別々の専門家チーム29組に渡して、まったく同じ問いに答えてもらったらどうなるでしょう?

答えは「20チームが“効果あり”、9チームが“はっきりしない”」。誰もデータをいじっていないし、ズルもしていない。それでも結論が割れたのです。2018年に発表されたこの実験は、「データが語る」という言い方そのものに、大きな疑問符をつけました。

01問い:審判は肌の色で判定を変えるのか

研究を率いたのは、シルバーザーン(Silberzahn)さんとウールマン(Uhlmann)さんら。テーマに選ばれたのは、社会的にも重い問いでした。

「サッカーの審判は、肌の色が濃い選手に、明るい選手よりレッドカードを出しやすいのか?」

使われたのは、イングランド・ドイツ・フランス・スペインの1部リーグで2012–13年シーズンにプレーした選手2,053人と、彼らがキャリアの中で出会った審判3,147人のデータです。選手と審判の組み合わせ(約14万6千組)ごとに、同じ試合に出た回数と、その審判から受けたレッドカードの数がまとめられていました。選手の肌の色は、研究の目的を知らない2人の評定者が、写真をもとに5段階で評価していました。

ここで大事なのは、これが実験ではなく観察データだということ。肌の色とレッドカードのあいだに関係が見えても、ポジション(守備の選手はファウルが多い)、リーグ、年齢など、ほかの要因が絡んでいる可能性があります。どれを、どう考慮するか。まさにそこが「分かれ道」になります。

02方法:29チームに「同じデータ、同じ問い」を配る

プロジェクトには、29チーム・61人の分析者が参加しました。進め方はおおむね次の流れです。

  1. 各チームが独立に1回目の分析を行い、方針の要約を提出する
  2. 結果の部分を伏せた方針の要約を全チームで見せ合い、互いに評価やコメントをする
  3. それを踏まえて方針を見直し、最終的な分析を出す

つまり「一発勝負の素人分析」ではなく、専門家どうしでレビューしあった後の、練られた分析です。それでも、選ばれた手法は実にさまざまでした。29の分析のうち、共変量の組み合わせだけで21通りに分かれていたと報告されています。

03結果:オッズ比は0.89〜2.93。結論は「有意」20対「非有意」9

各チームが出した効果の大きさ(オッズ比)は、0.89から2.93までばらつきました。中央値は1.31。

最後の2点がとくに重要です。「下手なチームが変な結果を出した」のでも、「先入観のあるチームが都合のいい結果を出した」のでもない。腕のいい専門家が誠実に選んでも、なお結論が割れたのです。

著者らは、複雑なデータの分析では、こうしたばらつきは専門家でも避けがたいのかもしれない、とまとめています。

同じ地図(データ)でも、たどる道(分析の選び方)しだいで行き着く先が変わる
同じ地図(データ)でも、たどる道(分析の選び方)しだいで行き着く先が変わる

04「分かれ道の庭」――ズルしなくても偽陽性は増える

この現象と近い問題には、先に名前がついていました。統計学者のゲルマン(Gelman)さんと共著者のローケン(Loken)さんが広めた「分かれ道の庭(garden of forking paths)」です。

よく知られた「pハッキング」は、有意になるまで分析をあれこれ試すこと。これは意図的な(あるいは半ば無自覚な)“釣り”です。

ゲルマンさんらの指摘はもっと深いものでした。研究者が分析を1回しかしていなくても問題は起こる。なぜなら、その「1回」の選び方が、目の前のデータを見てから決まっているかもしれないからです。もしデータが少し違っていたら、別の分かれ道を「自然に」選んでいたはず。その意味で、目に見えない多重比較がすでに起きている、というわけです。

2011年にはシモンズ(Simmons)さんらが「偽陽性心理学(False-Positive Psychology)」という論文で、データ収集や分析のちょっとした柔軟性が重なるだけで、本来5%に抑えられるはずの偽陽性が何倍にも膨らむことをシミュレーションで示していました。

ただし、29チームの論文の著者ら自身は、自分たちの結果を pハッキングとも「分かれ道の庭」とも区別しています。各チームは決められた一つの問いを調べ、有意な結果を出す動機もなく、データを眺めてから検定を選んだわけでもなかった。それでも結果はばらついた。つまり「データを見る前に分析を決めておけば済む」話ではなく、筋の通った分析の選び方が複数あること自体が、結論を揺らしうる。著者らは、事前登録をしていてもこのばらつきは防げなかっただろう、と述べています。

05サッカーだけじゃない:脳画像でも社会学でも

「多分析者(many analysts)」型の研究は、その後ほかの分野でも行われました。

  • 脳画像(fMRI):ボトヴィニク=ネゼル(Botvinik-Nezer)さんらは2020年、70チームに同じ脳画像データで9つの仮説を検証してもらいました。まったく同じ処理手順を選んだチームは一つもなく、仮説ごとの判定にも大きなばらつきが出ました。
  • 社会学:ブレズナウ(Breznau)さんらは2022年、73チーム・161人に「移民が増えると、人々の社会政策(福祉など)への支持は下がるか」という同じ仮説を同じデータで検証してもらいました。数値も結論も大きく分かれ、各チームの判断を細かく分類しても、結果のばらつきの95%以上は説明できないままでした。

分野が違っても、「同じデータから違う答え」は繰り返し現れたのです。

ここから玄人ゾーン

ここまで読めば要点はつかめています。この先は反論・方法論・未解決の問いまで踏み込みます。

06処方箋:マルチバース分析と「手の内を見せる」科学

では、どうすればいいのか。有力な答えの一つがマルチバース分析です。

ステーゲン(Steegen)さん、ゲルマンさんらは2016年、データの除外や変数の作り方など、筋の通った選択肢をすべて組み合わせ、それぞれで分析をやり直して結果の分布を示すことを提案しました。一つの分析だけを見せるのは、無数にある並行宇宙の一つだけを見せるようなものだ、という発想です。

同じ考え方を「仕様(specification)」の側から整理したのが、シモンソン(Simonsohn)さんらのスペシフィケーション・カーブ分析です。ありうる分析仕様ごとの推定値を並べ、結果がどの選択にどれほど左右されるかを一目で見せます。

このほか、

  • 事前登録:データを見る前に分析計画を公開しておく
  • データとコードの公開:他人が別の分かれ道を試せるようにする
  • 多分析者デザインそのもの:重要な問いでは最初から複数チームに分析してもらう

といった方法が、「再現性の危機」以降の改革として広がっています。

07研究史の中の位置づけ

2010年代前半、心理学では追試の失敗が相次ぎ、「再現性の危機」と呼ばれました。そこで議論の中心だったのは、主にズル・出版バイアス・小さすぎるサンプルです。

29チームの研究が新しかったのは、誠実で有能な分析者でも、結論は割れることを示した点です。問題は個人のモラルだけでなく、データ分析という作業そのものに組み込まれた不確かさにある。この視点の転換によって、「ひとつの論文=ひとつの真実」という見方から、「ひとつの論文=ありうる分析の一例」という見方へ、議論が広がりました。

論文に載る一つの分析は、ありえた無数の分析の「一つの宇宙」にすぎないかもしれない
論文に載る一つの分析は、ありえた無数の分析の「一つの宇宙」にすぎないかもしれない

08まとめ

同じデータ、同じ問い、誠実な専門家。それでも答えは一つにならなかった。

これは「科学は信用できない」という話ではありません。一つの分析結果は、ありえた多くの分析のうちの一つにすぎないという、ごく当たり前で、でも見落とされがちな事実を突きつけた研究です。

次に「研究で〇〇と判明!」というニュースを見たら、こう考えてみてください。「別のチームが同じデータを分析しても、同じ結論になるだろうか?」

この研究を英語で読もう原田英語の English CornerIn a project published in 2018, 61 researchers in 29 teams received the same data about soccer players and… 音声 4択クイズ9問A2・B1・B2タップして開く

原田英語の English Corner

この研究を英語で読もう

In a project published in 2018, 61 researchers in 29 teams received the same data about soccer players and referees. Each team was asked whether referees gave more red cards to players with darker skin. After a first round of analysis, the teams shared their plans and commented on each other's work.

Then they ran their final analyses. The results did not agree. Twenty teams found a statistically significant effect, but nine teams did not. The estimated effects ranged from slightly lower odds to nearly three times higher odds.

The spread could not be explained by the teams' level of expertise or by what they believed before the project. Their choices about which factors to include and which statistical model to use were enough to change the answer.

128 words ・ CEFR B1

和訳を見る

2018年に発表されたプロジェクトで、29チーム61人の研究者が、サッカー選手と審判に関する同じデータを受け取った。各チームは、審判が肌の色の濃い選手により多くレッドカードを出しているかどうかを問われた。1回目の分析の後、チームは分析計画を共有し、互いの作業にコメントした。

それから最終的な分析を行った。結果は一致しなかった。20チームは統計的に有意な効果を見つけたが、9チームは見つけなかった。推定された効果は、オッズがわずかに低いものから、3倍近く高いものまで幅があった。

このばらつきは、チームの専門性の高さや、プロジェクト前に信じていたことでは説明できなかった。どの要因を入れ、どの統計モデルを使うかという選択だけで、答えが変わったのだ。

4択リーディングクイズ

Q1. What is the main point of the passage?

Q2. What did the teams do before their final analyses?

Q3. What can we infer from the passage?

重要単語

  • analystB2
    名詞分析者、アナリストEach analyst made slightly different choices. analyze(分析する)、analysis(分析、複数形 analyses)とセットで。アクセントは AN-a-lyst の頭。
  • data setB2
    名詞(句)データセット、データの集まりAll the teams worked on the same data set. dataset と1語で書くことも多い。data は本来 datum の複数形で、学術英語では data are も見かける。
  • covariateC1
    名詞共変量(一緒に考慮する別の変数)Adding a covariate can change the estimate. co-(共に)+ variate(変量)。日常語では control variable(統制変数)と言い換えられることも。
  • odds ratioC1
    名詞(句)オッズ比An odds ratio of 1.3 means the odds are about 30% higher. odds は「見込み・勝ち目」。against all odds(あらゆる困難にもかかわらず)は入試頻出の熟語。
  • robustC1
    形容詞頑健な(条件を変えても崩れにくい)A robust result survives many different analyses. もとは「たくましい、がっしりした」。robust economy(底堅い経済)のようにも使う。
  • transparentB2
    形容詞透明な、手の内が見えるSharing code makes research more transparent. 名詞は transparency(透明性)。政治・企業の文脈でも頻出。
  • observationalC1
    形容詞観察による(実験ではない)Observational data cannot easily prove cause and effect. observe(観察する)の形容詞形。observational study(観察研究)と experiment(実験)の対比は科学英語の基本。

4コマでわかる

同じデータを29チームに渡したら、答えがバラバラになった。「分析の自由度」という科学の盲点の4コマ漫画
同じデータ、同じ問いを29の研究チームに分析してもらったら、20チームは「効果あり」、9チームは「はっきりしない」。誰もズルしていないのに結論が割れた。論文の数字の裏にある“見えない分かれ道”の話。

押すと「マジかリスト」に保存されます

出典・参考文献(5件)タップで表示

原典ガイド:入門から読むと入りやすく、必読は議論の土台、発展はその先の論点です。

  1. 必読Silberzahn et al. (2018) Many Analysts, One Data Set: Making Transparent How Variations in Analytic Choices Affect Results, Advances in Methods and Practices in Psychological Sciencedoi.org原典。チームごとのオッズ比のばらつきと、事前の信念や専門性、分析の質の評価ではばらつきを説明できなかったという結果
  2. 入門Gelman & Loken (2014) The Statistical Crisis in Science, American Scientistdoi.org「分かれ道の庭」を一般向けに説明した記事。pハッキングをしなくても偽陽性が増える理由
  3. 発展Steegen, Tuerlinckx, Gelman & Vanpaemel (2016) Increasing Transparency Through a Multiverse Analysis, Perspectives on Psychological Sciencedoi.orgマルチバース分析の提案。筋の通った選択肢をすべて組み合わせて結果の分布を示す方法
  4. 発展Botvinik-Nezer et al. (2020) Variability in the analysis of a single neuroimaging dataset by many teams, Naturedoi.org同じ脳画像データを70チームが分析し、処理手順も判定もばらついた研究
  5. 発展Breznau et al. (2022) Observing many researchers using the same data and hypothesis reveals a hidden universe of uncertainty, PNASdoi.org社会学で73チームが同じ仮説を検証し、ばらつきの大半が説明できなかった研究