死んだサケの脳が「光った」。fMRIの統計の落とし穴を暴いた伝説の実験

読む前に予想してみよう!
死んだサケのfMRI実験で見つかった「脳活動」は、正しく統計を補正すると消えた
多重比較の補正(FDR・FWE)をかけると、活動している点はゼロになった。
- 対象
- 死んだタイセイヨウサケ/健康な人の安静時fMRIデータ
- 規模
- 1匹/499人分・約300万回の模擬解析
- 研究の種類
- 方法論のデモンストレーション+大規模シミュレーション
- 確かさ
- ★★★★☆
死んだサケをfMRIにかけ、人の写真を「見せた」ら脳に“活動”が出た。犯人は統計の多重比較。7年後には脳画像ソフト全体の検証へと話が広がった。
ひとことで言うとたくさんくじを引けば、偶然の当たりも出る。脳画像も同じだった!
論文スペック表研究デザイン・規模・結果・その後(玄人向け)
- 研究デザイン
- 方法論のデモンストレーション(学会ポスター)と、安静時データを使った大規模シミュレーション
- データ
- 死んだタイセイヨウサケ1匹(8064ボクセル)/健康な人の安静時fMRI 499人分・約300万回の模擬解析
- 解析ソフト
- SPM2(サケ)/SPM・FSL・AFNI(クラスターの失敗)
- 主な指標
- 補正なし p < 0.001 で「有意」となるボクセル数/ソフトごとの偽陽性率
- 主な結果
- サケは16ボクセルが有意、FDR・FWE補正でゼロ。クラスター推定は条件しだいで偽陽性率が最大約70%
- その後の追試・再分析
- コックスら(2017)が規模の誇張を指摘。エクルンドら(2019)は1群の並べ替え検定について、両側検定とICA-FIXの組み合わせで偽陽性率が名目どおりになると報告
2009年6月、サンフランシスコで開かれた脳画像の国際学会(ヒト脳機能マッピング学会)に、一枚の奇妙なポスターが貼られました。
被験者はタイセイヨウサケ1匹。体長およそ18インチ(約46cm)、体重3.8ポンド(約1.7kg)。方法の欄には、さらりとこう書かれていました。「スキャンの時点で生きていなかった」。
研究チームはこのサケをfMRI装置に入れました。そして、社会的な場面にいる人の写真(それぞれ特定の感情が読み取れるもの)を次々に「見せ」、写真の人物がどんな気持ちかを「判断してもらった」のです。標準的な手順でデータを解析すると――サケの脳のあたりに、活動を示す点が浮かび上がったのです。
もちろん、死んだ魚が他人の気持ちを想像したわけではありません。この“実験”の本当の主役は、サケではなく統計でした。
01問い:なぜ、わざわざ死んだ魚を?
ポスターの著者は、カリフォルニア大学サンタバーバラ校のベネット(Bennett)さん、ミラー(Miller)さん、ヴァッサー大学のベアード(Baird)さん、ダートマス大学のウォルフォード(Wolford)さん。
彼らが言いたかったのは、魚のことではありません。ポスターの冒頭には、典型的なfMRI画像には約13万個のボクセルがあり、補正しなければ偽陽性はほぼ確実に出るのに、その補正がしばしば省かれている、という問題意識が書かれています。
口で「補正しないと危ないよ」と言っても、なかなか響かない。そこで、絶対に脳活動があるはずのない被験者で本物の実験をやってみせる、という作戦をとったのです。
ベネットさんらは同じ2009年、学術誌『Social Cognitive and Affective Neuroscience』に、きちんとした論考も発表しています。そこでは、FWEやFDRといった「原理的な」補正法はすでに確立しているのに、ボクセル1個ずつの偽陽性の確率だけを抑え、脳全体での偽陽性の量はわからない不適切な方法で報告される論文が、少数ながら毎月出続けていると指摘しました。
02方法:手順は「本物」、被験者だけがありえない
サケ実験の手順は、ふつうの人間の実験とほぼ同じでした。
この「p < 0.001・小さなクラスターサイズ」という基準は、当時も一部の論文で使われていた設定で、ポスターは考察で、これでは多重比較への対策として効果がないと批判しています。つまりサケは、よくある解析の“ものさし”そのものを試すための標本だったのです。

03結果:8064個中16個が「有意」、補正したらゼロ
解析の結果、サケの脳の位置に小さな活動クラスターが見つかりました。調べた範囲は8064ボクセル。そのうち16ボクセルが基準を超えたのです。
ここで、ちょっとした計算をしてみましょう。もしボクセルどうしが独立なら、p < 0.001 の基準で8064回検定すると、偶然だけでも8個前後は「有意」になると見込めます。実際にはさらに、平滑化のせいで隣り合うボクセルの値が似てくるため、偶然の当たりがかたまり(クラスター)として現れやすい。「3ボクセル以上」という条件は、思ったほど強いフィルターにはならないのです。
そして決定打。同じデータにFDR補正とFWE補正をかけると、活動しているボクセルは一つも残りませんでした。基準を p = 0.25 まで大きくゆるめても、ゼロのままでした。
サケは考えていなかった。考えていないことを、正しい統計はちゃんと示せた。この実験のメッセージは「fMRIはインチキだ」ではなく、「補正をすれば、ノイズはノイズとして消える」だったことに注意が必要です。
047年後の続き:「クラスターの失敗」
サケのポスターが投げかけたのは、主に「補正をサボるな」という問題でした。ところが2016年、補正していたはずの研究にも問題が潜んでいる可能性を示す論文が出ます。
スウェーデン・リンショーピン大学のエクルンド(Eklund)さんとクヌートソン(Knutsson)さん、イギリス・ウォーリック大学のニコルズ(Nichols)さんの論文「Cluster failure(クラスターの失敗)」です。
彼らは、課題をしていない健康な人499人分の安静時fMRIデータを使いました。安静時のデータに、ありもしない「課題の時間割」を当てはめて群解析をすれば、本当の効果はゼロのはず。これを組み合わせを変えて約300万回くり返し、代表的なソフト(SPM、FSL、AFNI)が何回「有意」と言ってしまうかを数えたのです。
理屈の上では、偽陽性は5%に収まるはず。ところが、
- ボクセル単位の補正は、むしろ慎重すぎる(偽陽性が5%より少ない)側だった
- クラスター単位の推定では、条件によって偽陽性率が最大で約70%にまで膨らんだ
- 主な原因は、ノイズの「空間的なつながり方」(空間自己相関)がソフトの想定(ガウス関数の形)とずれていたこと
- 一方、データを並べ替えて基準を作る並べ替え(パーミュテーション)検定は、ほぼ5%どおりだった(ただし本文では、1群の検定で偽陽性率がずれる例外も報告されている)
と報告しました。さらに、AFNIのプログラム(3dClustSim)に15年間残っていたバグも指摘されました。
この論文は、脳画像の分野の外でも大きな話題になります。実は論文本体の要点の欄に「約4万件のfMRI研究の妥当性に疑問を投げかける」という一文がありました。著者らはのちに訂正を出し、この部分を「一定数のfMRI研究」「弱く有意な結果の解釈」に影響しうる、という表現に改めています。訂正では、論文の結論そのものは変わらないとされています。
ここまで読めば要点はつかめています。この先は反論・方法論・未解決の問いまで踏み込みます。
05研究史の中の位置づけ
死んだサケのポスターは、2012年にイグ・ノーベル賞(神経科学賞)を受賞しました。授賞理由は「複雑な装置と単純な統計を使えば、脳研究者はどこにでも――死んだサケの中にさえ――意味のある脳活動を見いだせることを示した」というものです。けれども、その価値は笑いだけではありません。
一つめは、「ありえない被験者で手法を試す」という発想です。正解がゼロだと分かっている対象に手法をかければ、手法そのものの“くせ”が見える。エクルンドさんらが安静時データを「答えがゼロの実験」として使ったのは、同じ考え方をはるかに大規模にしたものだといえます。
二つめは、再現性をめぐる議論の先がけになったことです。2010年代には、心理学や神経科学で「論文の結果が追試で再現されない」問題が大きく取り上げられました。サケとクラスターの論争は、その中で解析ソフトの初期設定や慣習的な基準まで疑う流れの一部になりました。エクルンドさんらは2019年の続報で、データ共有と「答えがゼロの現実的なデータ」での手法検証の大切さをあらためて強調しています。AFNIにも並べ替えにもとづく群解析が加わり、主要な3つのソフトのいずれでも並べ替え検定が使えるようになりました(SPMでは拡張ツールのSnPMを使います)ようになりました。
06まとめ
死んだサケの脳が「光った」のは、魚が考えたからではなく、数千回のくじ引きで偶然の当たりが出たからでした。正しく補正すれば、その当たりはきちんと消えた。
そして7年後、「補正したつもり」の方法にも前提のずれがありうることが示され、脳画像研究は自分たちの道具をあらためて点検することになりました。脳の画像に色がついていたら、「何回くじを引いて、どう補正したのか」を一度考えてみてください。
この研究を英語で読もう原田英語の English CornerA dead Atlantic salmon, about 46 centimeters long, became famous in brain science.
音声
4択クイズ9問A2・B1・B2タップして開く
原田英語の English Corner
この研究を英語で読もう
In 2009, a team of scientists reported a strange test. They put a dead salmon in a brain scanner. They showed it photos of people and asked about their feelings. They checked the data in the usual way, and a few small spots in the fish's brain looked active!
The fish was not thinking, of course. The scanner checks thousands of tiny spots, so some look active just by chance. With the correct math, all the active spots went away.
80 words ・ CEFR A2
和訳を見る
2009年、ある科学者のチームが奇妙な実験を報告しました。彼らは死んだサケを脳スキャナーに入れたのです。サケに人の写真を見せ、その人たちの気持ちについてたずねました。いつものやり方でデータを調べると、魚の脳の小さな点がいくつか、活動しているように見えたのです!
もちろん、魚は考えていませんでした。スキャナーは何千もの小さな点を調べるので、偶然だけで活動しているように見える点が出てきます。正しい計算方法を使うと、活動していた点はすべて消えました。
4択リーディングクイズ
Q1. What is the passage mainly about?
死んだサケの脳が活動しているように見えた実験の話なので B。サケが本当に顔を見たわけではない。
Q2. What happened with the correct math?
With the correct math, all the active spots went away とあるので C。
Q3. In this passage, "by chance" means ...
by chance は「偶然に」。本当の理由がないのに起こる、という意味なので B。
A dead Atlantic salmon, about 46 centimeters long, became famous in brain science. In a 2009 poster, Craig Bennett and his colleagues described placing it in an fMRI scanner and showing it 15 photos of people in social situations.
They analyzed the data with a common method that tests each tiny cube of the brain, called a voxel, on its own. Out of 8,064 voxels, 16 passed the test, and they formed a small cluster inside the fish's head. The reason is simple.
If you run thousands of tests, a few will come out positive by luck. When the team applied standard corrections for multiple comparisons, no voxels were left. The joke had a serious point. Without these corrections, random noise can look like real brain activity.
127 words ・ CEFR B1
和訳を見る
体長約46センチの死んだタイセイヨウサケが、脳科学で有名になった。2009年のポスター発表で、クレイグ・ベネットさんらは、このサケをfMRIスキャナーに入れ、社会的な場面にいる人々の写真15枚を見せたと報告した。
それから、脳の小さな立方体(ボクセル)を一つずつ別々に検定する、よく使われる方法でデータを分析した。8,064個のボクセルのうち16個が基準を超え、魚の頭の中で小さなかたまりをつくった。理由は単純だ。
何千回も検定すれば、運だけでいくつかは陽性になる。チームが多重比較の標準的な補正をかけると、ボクセルは一つも残らなかった。この冗談には真剣な狙いがあった。補正をしなければ、偶然のノイズが本物の脳活動のように見えてしまうのだ。
4択リーディングクイズ
Q1. What was the main purpose of the salmon study?
最後の文で、補正をしなければノイズが脳活動に見えると述べているので C。サケの感情を調べたわけではない。
Q2. How many voxels passed the test before correction?
Out of 8,064 voxels, 16 passed the test とあるので B。15は写真の枚数、8,064は調べたボクセルの総数。
Q3. Why did some voxels look active?
If you run thousands of tests, a few will come out positive by luck と説明しているので C。
The subject was 3.8 pounds of Atlantic salmon, and it was not alive at the time of scanning. In a 2009 poster, Craig Bennett and colleagues gave the fish a standard fMRI routine: 15 photos of people, each shown for ten seconds, with the salmon "asked" to judge the emotions involved. Using a voxelwise threshold of p below 0.001 with no correction, they found 16 significant voxels out of 8,064.
Applying false discovery rate or familywise error corrections left none, even at very relaxed thresholds. Seven years later, Anders Eklund, Thomas Nichols and Hans Knutsson asked a harder question. They used resting-state data from 499 healthy people as fake experiments where the true effect was zero, and ran about three million group analyses.
Cluster-based methods in three major software packages sometimes produced false positive rates of up to 70 percent, mainly because real noise is spatially correlated in ways the software did not assume. The team that maintains AFNI replied that this figure came from the worst cases and depended heavily on the design and threshold. The AFNI team has since added permutation-based options; such tests stayed close to the expected five percent in the original study.
197 words ・ CEFR B2
和訳を見る
被験者は3.8ポンドのタイセイヨウサケで、スキャンの時点で生きていなかった。2009年のポスター発表で、クレイグ・ベネットさんらはこの魚に標準的なfMRIの手順を行った。人の写真15枚をそれぞれ10秒ずつ見せ、サケにはその感情を判断するよう「頼んだ」。補正なしでボクセルごとに p が0.001未満という基準を使うと、8,064個中16個のボクセルが有意になった。
偽発見率(FDR)や検定全体での誤り率(FWE)の補正をかけると、基準を大きくゆるめても一つも残らなかった。7年後、アンダース・エクルンドさん、トーマス・ニコルズさん、ハンス・クヌートソンさんは、もっと難しい問いに取り組んだ。健康な499人の安静時データを、本当の効果がゼロの「ニセの実験」として使い、約300万回の群解析を行ったのだ。主要な3つのソフトのクラスター法は、ときに最大70%もの偽陽性率を出した。
主な原因は、実際のノイズがソフトの想定しない形で空間的につながっていることだった。AFNIを開発するチームは、この数字は最悪のケースから来たもので、デザインや基準に大きく左右されると反論した。AFNIのチームはその後、並べ替えにもとづく方法を追加した。こうした検定は、元の研究でほぼ期待どおりの5%に収まっていた。
4択リーディングクイズ
Q1. What did Eklund and colleagues use as experiments with a true effect of zero?
They used resting-state data from 499 healthy people as fake experiments where the true effect was zero とあるので B。
Q2. According to the passage, why did cluster-based methods give too many false positives?
mainly because real noise is spatially correlated in ways the software did not assume とあるので C。
Q3. What can be inferred about the AFNI team's view?
this figure came from the worst cases and depended heavily on the design and threshold と反論しており、典型的な問題の大きさを誇張していると考えたと読めるので B。問題自体は認めている。
重要単語
- false positiveB2名詞(句)偽陽性A false positive can look like a real discovery.
反対は false negative(偽陰性)。医療検査のニュースでも頻出。 - multiple comparisonsC1名詞(句)多重比較Testing thousands of spots at once is a multiple comparisons problem.
correct for multiple comparisons で「多重比較を補正する」。統計の定番コロケーション。 - thresholdB2名詞しきい値、基準The team set a strict threshold for significance.
もとは「敷居」。on the threshold of ~で「~の入り口に」という比喩も入試に出る。 - noiseB1名詞(データの)雑音、偶然のゆらぎRandom noise in the scanner can create fake patterns.
signal(意味のある信号)と対で使う。signal-to-noise ratio「S/N比」。 - correctionB1名詞補正、訂正After the correction, no active spots were left.
動詞 correct。論文の「訂正記事」も correction と呼ぶ。 - voxelC1名詞ボクセル(3D画像の最小単位)Each voxel is a tiny cube of brain tissue.
volume + pixel を合わせた造語。2Dなら pixel、3Dなら voxel。 - permutationC1名詞並べ替え、順列A permutation test shuffles the labels many times.
数学の「順列」と同じ語。permute(並べ替える)の名詞形。
4コマでわかる

このネタ、誰かに教えたくなった?
死んだサケをMRIに入れて人の写真を見せたら、脳の一部が「反応」した。もちろんサケは考えていない。統計の補正をサボると、偶然のノイズが“脳活動”に見えてしまう。その7年後、別のチームが脳画像ソフトの「補正のしかた」そのものを検証し、大論争になった。
押すと「マジかリスト」に保存されます
出典・参考文献(5件)タップで表示
原典ガイド:入門から読むと入りやすく、必読は議論の土台、発展はその先の論点です。
- 入門Bennett, Miller & Wolford (2009) Neural correlates of interspecies perspective taking in the post-mortem Atlantic Salmon: an argument for multiple comparisons correction, NeuroImage 47(Suppl. 1) S125(学会抄録)doi.orgサケのポスターの学会抄録。著者が公開しているポスター本体とあわせて、方法の欄の「生きていなかった」と、補正前後の結果を確かめられる
- 必読Bennett, Wolford & Miller (2009) The principled control of false positives in neuroimaging, Social Cognitive and Affective Neurosciencedoi.orgFWE・FDRなど原理的な補正法と、不適切な基準で報告される論文の実態をまとめた論考
- 必読Eklund, Nichols & Knutsson (2016) Cluster failure: Why fMRI inferences for spatial extent have inflated false-positive rates, PNASdoi.org499人分の安静時データで3つのソフトの偽陽性率を検証した本論文。のちの訂正もあわせて読む
- 発展Cox, Chen, Glen, Reynolds & Taylor (2017) FMRI Clustering in AFNI: False-Positive Rates Redux, Brain Connectivitydoi.orgAFNI開発元による反論。条件ごとの偽陽性率の違いと、改良した手法
- 発展Eklund, Knutsson & Nichols (2019) Cluster failure revisited: Impact of first level design and physiological noise on cluster false positive rates, Human Brain Mappingdoi.org批判への応答。課題デザインと生理ノイズの影響、ICA-FIXによるノイズ除去の効果
※本記事は上記の研究・公開資料をもとに、原田英語が独自の言葉で解説したものです。引用は著作権法第32条の範囲で行い、出典を明記しています。画像はすべてオリジナルのイメージです。研究結果には限界や個人差があります。誤りのご指摘は原田英語のお問い合わせフォームから。










