単語の長さを決めるのは「使う頻度」か「文脈での情報量」か。MITの新説と、その後の“逆転劇”

読む前に予想してみよう!
「よく使う単語ほど短い」という傾向は、日本語や英語など多くの言語で昔から知られている
言語学者ジップが広めた「短縮の法則」。論争になっているのは、その傾向の“本当の原因”が頻度なのか、文脈での情報量なのか、という点。
- 対象
- ヨーロッパ11言語のウェブ文書(英語は別コーパスでも再現)
- 規模
- 各言語の高頻度語2万5千語
- 研究の種類
- コーパスの相関分析
- 確かさ
- ★★☆☆☆
「よく使う単語ほど短い」に、2011年MITが「本当の決め手は文脈での予想しやすさ」と挑戦。だが後の再分析では、やはり頻度が強いという結果も。
ひとことで言うと単語の長さは「よく使うか」「予想しやすいか」どっちで決まる? まだ決着なし!
論文スペック表研究デザイン・規模・結果・その後(玄人向け)
- 研究デザイン
- 観察研究(コーパスの相関分析)
- データ
- ヨーロッパ11言語のグーグルN-gram統計、各言語の高頻度語2万5千語(英語はBNCでも再分析)
- 主な指標
- 単語の長さ(文字数)と、頻度・平均情報量(2〜4-gramで推定)との相関、および偏相関
- 主な結果
- 3-gramでは11言語中10言語で、情報量のほうが頻度より長さと強く相関
- 効果の大きさ
- 英語BNCでの相関は頻度で約0.12、情報量で約0.16〜0.17と、絶対値は小さい
- その後の追試・再分析
- Meylan & Griffiths (2021) はデータ処理を見直すと過半数の言語で頻度が優勢、Pimentel et al. (2023) は13言語で頻度が最もよく長さを予測と報告
もくじ
「の」「は」「the」「a」。よく使う単語ほど短い。
これは言語学でもっとも有名な経験則のひとつで、20世紀前半にアメリカの言語学者ジップ(G. K. Zipf)が広めました。理由もシンプル。よく使う言葉を短くしておけば、全体として話す手間が減る。モールス信号で頻出の E を「・」1つにしたのと同じ発想です。
ところが2011年、MITのピアンタドーシ(Piantadosi)らが、この“定説”に挑戦しました。「単語の長さを本当に決めているのは頻度ではなく、文脈の中でどれだけ予想しにくいか(情報量)だ」。この主張は米国科学アカデミー紀要(PNAS)に掲載されました。しかしその後10年あまりかけて、再分析で揺さぶられることになります。
01問い:「頻度」と「予想しやすさ」は何が違う?
この2つは似ているようで、実は別物です。
たとえば英語の “you are what you eat” の eat。eat 自体はとびぬけて頻度が高い単語ではありませんが、この決まり文句の中ではほぼ確実に予想できます。逆に、頻度はそこそこでも、いつも予想しにくい場面で出てくる単語もある。
ピアンタドーシらの理屈はこうです。話し手と聞き手にとって効率がいいのは、1秒あたりに運ぶ情報量をなるべく一定に保つこと(これを情報密度均一化の考え方と呼びます)。そのためには、情報をたくさん運ぶ単語には長さを与え、文脈から予想できる単語は短くするのが合理的。頻度だけで長さを割り振るジップ式より、文脈を考えたほうが賢い符号になる、という主張です。
02方法:グーグルのN-gramデータで11言語を比較
平均情報量は、その単語が出てくるたびに「直前の1〜3語から見てどれだけ予想外だったか」を計算し、平均したものです(2-gram、3-gram、4-gramの3通り)。
03結果:多くの言語で「情報量」が頻度を上回った
- 2-gramでは、11言語すべてで、情報量のほうが頻度より長さと強く相関した。
- 3-gramでは11言語中10言語で同じ結果(ポーランド語だけ有意差なし)。著者らはこれを最も代表的な結果とした。
- 4-gramでは11言語中7言語にとどまった。著者らは、長いN-gramほど推定誤差が大きくなるためと説明している。
- 頻度と情報量は互いに相関しているので、一方の影響を除いた「偏相関」も計算。いくつかの言語では、情報量の影響を除くと頻度の効果はほぼゼロになった。
英語では、グーグルのデータ特有の偏りでないことを確かめるため、イギリス国立コーパス(BNC)と標準的な平滑化の手法でも再分析し、同じ方向の結果を得ています(ただしBNCは約1億語で、グーグルの英語データの約1万分の1の規模)。さらに、英語とオランダ語では文字数でなく音素数・音節数で測っても、2-gramと3-gramでは同様でした(ドイツ語は結果がまちまちで、3-gramの音素数では逆方向の有意な結果も出ています)。
著者らは、「最も効率的なのは、もっとも予測しやすい単語を短くする符号であって、もっとも頻度の高い単語を短くする符号ではない」とまとめ、ジップの見方の修正が必要だと主張しました。

04話し手は“その場で”短い語を選んでいる?
この説を後押ししたのが、2013年のマホワルド(Mahowald)らの研究です。
英語の chimp / chimpanzee(チンパンジー)のように、意味がほぼ同じで長さだけ違う単語ペアに注目。コーパスを調べると、短い形のほうが予想しやすい文脈で使われていました。さらに行動実験でも、予想しやすい文脈では人は短い形を選びやすいことが分かりました。
つまり、「予想しやすいときは短く言う」という話し手の日々の選択が積み重なって、単語の長さそのものに刻まれていく――というメカニズムが考えられます。日本語でも「スマートフォン」が「スマホ」になるような短縮が身近ですね(ただし日本語の短縮語についてこの理論で検証した研究を本記事では確認できていないので、ここはあくまでイメージです)。
05ところが…再分析で「やっぱり頻度」
ここまで読めば要点はつかめています。この先は反論・方法論・未解決の問いまで踏み込みます。
この逆転劇の面白さは、誰かが不正をしたわけではなく、「単語とは何か」「情報量をどう推定するか」という測定の選択が結論を左右したことです。
06研究史の中での位置づけ
それでも、ピアンタドーシらの論文の価値が消えたわけではありません。
この研究は、「言語は伝達の効率に合わせて形づくられている」という大きな研究プログラムの代表例になりました。ギブソンらのグループやその共同研究者からは、文法や語順も効率で説明しようとする研究が次々に出ています(2019年には、ギブソン、ピアンタドーシ、マホワルドらがその流れをまとめた総説「How Efficiency Shapes Human Language」を Trends in Cognitive Sciences に発表しています)。
また、マホワルドらが示した「予想しやすい場面では短い形を選ぶ」という話し手レベルの効果は、単語全体の長さの議論とは別に、発話の研究として支持を集めています。争点は、それが語彙全体の長さまで決めるほど強いのか、という点にあります。
07まとめ
「よく使う単語ほど短い」というジップの法則に、MITのチームは「本当は予想しやすい単語ほど短い」という、より洗練された説明をぶつけました。
しかしその後、データ処理と理論の両面から再検討が進み、2020年代の研究では頻度が再び優勢という結果も出ています。現時点の判定は「ビミョー」。予想しやすい場面で短く言う傾向は確かにありそうですが、それが語彙全体の長さを決める主役かどうかは、まだ決着していません。
ひとつの論文が新説を出し、別のチームが再分析で揺さぶる。言語学も、こうして少しずつ真実に近づいていくのです。
この研究を英語で読もう原田英語の English CornerIn everyday English, the most common words, such as "the," "of," and "a," are also among the shortest.
音声
4択クイズ9問A2・B1・B2タップして開く
原田英語の English Corner
この研究を英語で読もう
Short words like "the" and "a" are used all the time. Long words are used less often. A language scientist named Zipf wrote about this long ago. In 2011, a team at MIT had a new idea.
They said a word is short when people can guess it easily from the words before it. They checked eleven languages on the internet. Later, other teams checked again with new methods. Some of them found that Zipf's simple idea still works better.
80 words ・ CEFR A2
和訳を見る
"the" や "a" のような短い単語は、いつも使われます。長い単語はあまり使われません。ジップという言語学者が、ずっと前にこのことを書きました。2011年、MITのチームが新しい考えを出しました。
単語が短いのは、前の単語から簡単に予想できるときだ、と言ったのです。彼らはインターネット上の11の言語を調べました。その後、ほかのチームが新しい方法でもう一度調べました。そのいくつかは、ジップのシンプルな考えのほうが今でもうまく当てはまることを見つけました。
4択リーディングクイズ
Q1. What is the passage mainly about?
ジップの考え(よく使う語は短い)と、MITの考え(予想しやすい語は短い)の2つが紹介されているので B。
Q2. How many languages did the MIT team check?
They checked eleven languages on the internet. とあるので C。
Q3. In this passage, "guess" is closest in meaning to ...
guess は「推測する、言い当てる」。前の単語から次の単語を予想することなので C の predict。
In everyday English, the most common words, such as "the," "of," and "a," are also among the shortest. In the 1930s, the linguist George Zipf explained this pattern with frequency. If people use a word often, it saves effort to keep it short. In 2011, researchers at MIT offered a different answer. They argued that a word's length depends on how easy it is to predict from the words around it.
Using huge collections of web text in eleven European languages, they found that predictability was linked to length more strongly than frequency in most of them. The idea became famous. But later studies used different ways to count words and to measure predictability, and some of them found that frequency did a better job after all.
127 words ・ CEFR B1
和訳を見る
日常の英語では、"the"、"of"、"a" のような最もよく使われる単語は、最も短い単語のなかにも入っています。1930年代、言語学者のジョージ・ジップは、この傾向を頻度で説明しました。よく使う単語なら、短くしておくと手間が省けるというわけです。2011年、MITの研究者たちは別の答えを出しました。単語の長さは、まわりの単語からどれだけ予想しやすいかで決まる、と主張したのです。
11のヨーロッパの言語の膨大なウェブ文書を使い、彼らは多くの言語で、予想しやすさのほうが頻度よりも長さと強く結びついていることを見つけました。この考えは有名になりました。しかしその後の研究は、単語の数え方や予想しやすさの測り方を変えて分析し、そのうちのいくつかは、結局は頻度のほうがうまく説明できると分かりました。
4択リーディングクイズ
Q1. What is the passage mainly about?
ジップの頻度説、MITの予想しやすさ説、その後の再検討という「単語の長さを決めるもの」をめぐる議論なので A。
Q2. What did the MIT researchers argue?
They argued that a word's length depends on how easy it is to predict from the words around it. とあるので B。
Q3. What does the phrase "after all" in the last sentence suggest?
after all は「(予想・主張に反して)結局は」。MITの主張とは逆に、頻度のほうがうまく説明したという流れなので B。
Since Zipf, linguists have explained short common words with a simple idea: if you use a word often, it pays to keep it short. In 2011, Steven Piantadosi and his colleagues at MIT proposed a sharper version. What matters, they argued, is how much information a word carries in context, which they estimated from the few words that come before it in Google's web data.
Across eleven European languages, this average information content tracked word length better than raw frequency did, especially when the context was the previous one or two words. The correlations themselves were modest, though. A check on a separate British corpus produced values below 0.2. Later work went after the method. One team showed that even random typing produces a link between information content and length.
Another reran the analysis with stricter decisions about what counts as a word and found frequency winning in most languages. In 2023, a study of thirteen languages reported that better language models made the information-based predictions worse, and its authors concluded that Zipf's original account holds up.
177 words ・ CEFR B2
和訳を見る
ジップ以来、言語学者たちは、よく使う単語が短いことを単純な考えで説明してきた。よく使う語なら、短くしておくと得だ、というものだ。2011年、MITのスティーブン・ピアンタドーシらは、より鋭い形の説を提案した。重要なのは単語が文脈の中でどれだけの情報を運ぶかだと彼らは主張し、それをグーグルのウェブデータで、その語の直前に来る数語から推定した。
ヨーロッパの11言語で、この平均情報量は、単なる頻度よりも単語の長さとよく対応した。特に、文脈を直前の1〜2語としたときにそうだった。ただし、相関そのものは控えめだった。別のイギリス英語コーパスで確認すると、値は0.2未満だった。その後の研究は方法に切り込んだ。あるチームは、でたらめにキーを打つだけでも情報量と長さの結びつきが生まれることを示した。
別のチームは、何を1語と数えるかをより厳密に決めて分析し直し、多くの言語で頻度が勝つことを見いだした。2023年には、13言語の研究が、より高性能な言語モデルを使うと情報量にもとづく予測がかえって悪くなると報告し、著者らはジップのもともとの説明が持ちこたえていると結論した。
4択リーディングクイズ
Q1. Which best describes the structure of the passage?
2011年の新説を紹介したあと、Later work went after the method. 以降で反論・再分析が続く構成なので A。
Q2. What did one team show using random typing?
even random typing produces a link between information content and length とあるので B。相関があるだけでは最適化の証拠にならない、という批判。
Q3. Why does the author mention that the values were below 0.2?
直前に The correlations themselves were modest, though. とあり、情報量が頻度に勝っていても関係そのものは弱かったことを示すためなので B。
重要単語
- frequencyB2名詞頻度Word frequency is easy to count in a large corpus.
frequent(たびたび起こる)の名詞形。high-frequency words「高頻度語」は単語帳でもおなじみ。 - predictableB2形容詞予測できるThe last word of a common phrase is very predictable.
pre(前もって)+dict(言う)+able。dictionary の dict と同じ「言う」。反対は unpredictable。 - corpusC1名詞コーパス(大量の言語データ)They built a corpus of one million sentences.
ラテン語で「体」。複数形は corpora。corpse(死体)と同語源なので混同注意。 - correlationB2名詞相関There is a weak correlation between the two numbers.
correlation does not mean causation「相関は因果ではない」は入試・研究の頻出フレーズ。 - surprisalC1名詞サプライザル(予想外さを表す情報量)Rare words in odd places have high surprisal.
surprise から作られた専門用語。予想しにくいほど値が大きくなる。 - replicateC1動詞(研究結果を)再現するOther teams tried to replicate the result.
名詞は replication。replication crisis「再現性の危機」は科学ニュースの頻出語。 - accountB2名詞説明、理論Zipf's account of word length is still popular.
「口座」だけでなく「説明」の意味が重要。account for ~「~を説明する」は入試頻出。
公式・一次情報をチェック
- Wordly wisdom(MIT News, 2011)news.mit.edu
このネタ、誰かに教えたくなった?
「よく使う単語ほど短い」は約90年前からある言語の法則。2011年MITは「本当は文脈で予想しやすい単語ほど短い」と発表。ところが後の再分析では「やっぱり頻度が効いている」との結果も。科学の論争はこう進む。
押すと「マジかリスト」に保存されます
出典・参考文献(5件)タップで表示
原典ガイド:入門から読むと入りやすく、必読は議論の土台、発展はその先の論点です。
- 必読Piantadosi, Tily & Gibson (2011) Word lengths are optimized for efficient communication. PNASdoi.org論争の出発点となった原典。11言語での頻度と情報量の比較と、偏相関による切り分け
- 入門Mahowald, Fedorenko, Piantadosi & Gibson (2013) Info/information theory: Speakers choose shorter words in predictive contexts. Cognitiondoi.orgchimp と chimpanzee のような長短ペアを使い、予想しやすい文脈で短い形が選ばれることをコーパスと行動実験で示した研究。話し手レベルの効果をつかむのに向く
- 発展Ferrer-i-Cancho & Moscoso del Prado Martín (2011) Information content versus word length in random typing. Journal of Statistical Mechanicsdoi.orgでたらめに打った文字列でも情報量と長さの関係が出ることを示した数理的な批判
- 必読Meylan & Griffiths (2021) The Challenges of Large-Scale, Web-Based Language Datasets: Word Length and Predictability Revisited. Cognitive Sciencedoi.org「何を1語と数えるか」など大規模ウェブデータの処理の選び方で結論が変わることを示した再分析。方法論の落とし穴を学ぶ教材に
- 発展Pimentel, Meister, Wilcox, Mahowald & Cotterell (2023) Revisiting the Optimality of Word Lengths. EMNLP 2023doi.org元の理論の導き方を見直し、13言語で頻度が長さを最もよく予測すると示した再検討
※本記事は上記の研究・公開資料をもとに、原田英語が独自の言葉で解説したものです。引用は著作権法第32条の範囲で行い、出典を明記しています。画像はすべてオリジナルのイメージです。研究結果には限界や個人差があります。誤りのご指摘は原田英語のお問い合わせフォームから。











