「つながる単語は近くに置く」は37言語で本当だった。でも日本語は“ゆるめ”。依存距離の研究

読む前に予想してみよう!
日本語のように動詞が文の最後に来る言語では、長い語句を先に言う傾向がある
英語では短い語句を先に、日本語では長い語句を先に言いやすいという実験結果がある。どちらも、結びつく語どうしを近づける並べ方として説明できる。
- 対象
- 37言語の構文解析済みコーパス(10語族)
- 規模
- 37言語(コーパス規模は言語により大きく異なる)
- 研究の種類
- コーパス分析(ランダム語順との比較)
- 確かさ
- ★★★★☆
文法的につながる単語どうしの距離は、37言語すべてで「でたらめな語順」より短かった。脳の負担を減らす並べ方らしい。ただ日本語などでは短縮が控えめ。
ひとことで言うとどの言葉も、つながる単語を近くに置く傾向があった。脳をラクにするためかも!
論文スペック表研究デザイン・規模・結果・その後(玄人向け)
- 研究デザイン
- コーパス分析(実際の語順とランダムな語順の比較)
- データ
- 10語族37言語のツリーバンク(主に書き言葉、日本語は話し言葉の対話)
- 比較基準
- 自由語順・固定語順のランダム並べ替え(各文100通り)と最適語順
- 主な指標
- 文が長くなるにつれての依存距離の増え方
- 統計
- 文ごとのランダム効果を入れた混合効果モデルの尤度比検定
- 主な結果
- 自由語順比で37言語すべて短い。固定語順比でもテルグ語以外で短い
- その後の訂正・再分析
- 図の取り違えと参考文献欠落の訂正。2022年に「主要部の数」で測る再評価
英語の “pick up the box” と “pick the box up”。どちらも正しい英語です。
でも、箱が長くなって “pick the box that was lying on the kitchen floor up” になると、とたんに読みにくい。up がどの動詞とセットなのか、頭の中で長いあいだ“保留”しないといけないからです。
「文法的につながる単語は、なるべく近くに置く」。この素朴な原理が、実は世界の言語に共通する“普遍的な性質”なのではないか――。2015年、MITのフットレル(Futrell)らは、37言語の大量の文を使ってこの仮説を検証しました。結果は、37言語すべてで「イエス」。ただし、日本語のような言語には、ちょっと面白いクセがありました。
01問い:「近くに置く」は本当に世界共通か
なぜ近いほうがいいのか。心理言語学ではギブソン(Gibson)が1998年に、結びつく語が離れているほど、その間ずっと記憶で保持しなければならず、処理が難しくなるという局所性の理論(のちの依存局所性理論につながる考え方)を提案しています。
この考え方は、語順の世界的な傾向――たとえば「前置詞を使う言語は動詞が目的語の前に来やすい」といった、いわゆる語順の相関――を説明する原理としても使われてきました。
ただ著者らによれば、実際の文で依存距離が短くなっているかを確かめた研究は、言語数が少ないか、特定の構文だけを見たものが中心でした(この見方には、後で紹介するように異論もあります)。そこでフットレルらは、近年整ってきた多言語ツリーバンクを使い、たくさんの言語の“ありのままの文”全部で確かめることにしたのです。
02方法:本物の語順 vs. でたらめな語順
比較の“ものさし”(ベースライン)は2種類です。
- 自由語順ベースライン:主語が動詞の前に来たり後ろに来たり、毎回でたらめに並べる。
- 固定語順ベースライン:「主語は動詞の前」のような並べ方のルールをランダムに1つ決めて、それを一貫して適用する。現実の言語に近く、より厳しい比較になる。
さらに、線が交差しない並べ方の中で依存距離がもっとも短くなるもの(最適ベースライン)も計算し、「実際の言語はどこまで最短に近いか」も見ています。
統計では、文が長くなるにつれて依存距離がどう増えるかを、言語ごとに混合効果モデルで推定しました。本物の文の依存距離が、ランダムな文より“ゆっくり”増えるかが勝負どころです。
03結果:37言語すべてで「ランダムより短い」
- 自由語順ベースラインと比べると、37言語すべてで、本物の文の依存距離はランダムな並べ方より短く、文が長くなるほど差が広がった。
- より厳しい固定語順ベースラインでも、ほぼすべての言語で同じ結果。例外は、長い文がほとんど含まれない小さなコーパスだったテルグ語だけ(有意差なし)。
- 一方で、実際の依存距離は最適ベースラインよりは長かった。言語は依存距離を「完全に最小化」しているわけではなく、他の要因とのバランスをとっていると著者らは考えている。
たとえば12語の文で比べると、イタリア語ではランダムな並べ方の平均が約27.5、実際の文が約18.0。かなりの短縮です。一方、トルコ語ではランダム約26.8に対して実際は約23.7と、差が小さめでした。

04日本語は“ゆるめ”?:主要部後置言語のクセ
著者らが「新しく、予想外の発見」と述べたのが、日本語・韓国語・トルコ語のような主要部後置の言語では、短縮の度合いがずっと小さいという点でした。逆に、イタリア語、インドネシア語、アイルランド語などは高度に最適化されていたといいます。
なぜか。著者らの仮説は「格標示」です。日本語には「が」「を」「に」のような助詞があり、単語が文の中で何の役割を果たすかが語の形そのものから分かる。だから結びつく語どうしが多少離れていても、どの語がどれにかかるかを見失いにくく、依存距離への圧力が弱まるのではないか――というわけです。実際、格標示のあるドイツ語では、長い依存が英語ほど処理を難しくしないという先行研究もあると著者らは指摘しています。
ただし、日本語が「依存距離を気にしない」わけではありません。山下とチャン(Yamashita & Chang)は2001年、日本語話者を対象とした2つの実験で、話し手が長い語句を文の前のほうに出す傾向(長いものが先)を示しました。
英語では「短いものが先、長いものは後ろ」が好まれます。日本語では逆。一見正反対ですが、動詞が最後に来る日本語では、長い語句を先に出して短い語句を動詞の近くに残すほうが、結びつく語どうしの距離が短くなる。つまり、どちらも「近くに置く」原理の鏡像として説明できるのです。
ここまで読めば要点はつかめています。この先は反論・方法論・未解決の問いまで踏み込みます。
05研究史の中での位置づけ
依存距離最小化は、フットレルらの論文以降、語順の普遍性を処理効率で説明する研究の柱の一つになりました。
その後、フットレルらは依存の局所性を語順の説明原理として理論的に整理し(2020年、Language誌)、フットレルも著者に加わったハーン(Hahn)らの研究は51言語のデータで「複雑さを減らす圧力」と「あいまいさを減らす圧力」の両方を最適化した文法が、語順の相関の多くを再現できることを示しています(2020年、PNAS)。
つまり、「つながる語を近くに」は単独で語順を決める万能原理ではなく、格標示、あいまいさ回避、情報の出し方の順序などと綱引きしながら働く一つの力、というのが現在の見方に近いでしょう。
06まとめ
フットレルらは37言語の大量の文を使い、文法的につながる単語どうしは、どの言語でもランダムな並べ方より近くに置かれていることを示しました。人間のワーキングメモリの限界が、語順という言語の“設計”にまで影響している可能性を示す、強い証拠です。
一方で、日本語のような主要部後置言語では短縮が控えめで、その理由はまだ仮説の段階。英語の「短いものが先」と日本語の「長いものが先」が同じ原理の鏡像だという話は、英語と日本語の両方を学ぶ人にとって、語順を見る目が変わる発見ではないでしょうか。
この研究を英語で読もう原田英語の English CornerIn every sentence, some words depend on others.
音声
4択クイズ9問A2・B1・B2タップして開く
原田英語の English Corner
この研究を英語で読もう
In a sentence, some words belong together. For example, a verb goes with its object. Scientists at MIT studied sentences in 37 languages. They measured how far apart these word pairs were.
Then they mixed up the words in a random way and measured again. In all 37 languages, the real sentences kept the pairs closer. This may make sentences easier for our memory. In Japanese, the effect was smaller.
70 words ・ CEFR A2
和訳を見る
文の中には、セットになる単語があります。たとえば、動詞はその目的語とセットです。MITの科学者たちは、37の言語の文を調べました。彼らは、これらの単語のペアがどれくらい離れているかを測りました。
それから単語をでたらめに並べかえて、もう一度測りました。37の言語すべてで、本物の文のほうがペアを近くに置いていました。これは、私たちの記憶にとって文をわかりやすくしているのかもしれません。日本語では、その効果は小さめでした。
4択リーディングクイズ
Q1. What is the passage mainly about?
セットになる単語どうしが、どの言語でも近くに置かれていたという話なので C。
Q2. How many languages did the scientists study?
Scientists at MIT studied sentences in 37 languages. とあるので C。
Q3. In this passage, "random" means ...
random は「でたらめな、無作為の」。mixed up the words in a random way は「でたらめに並べかえた」なので A。
In every sentence, some words depend on others. A verb needs its subject and object, and an adjective belongs to a noun.
Researchers at MIT asked whether languages keep these linked words close together. They used collections of sentences in 37 languages that had already been analyzed by hand. For each sentence, the computer made 100 versions with the same grammar links but with the words in a random order.
Then the team compared the total distance between linked words. In every language, real sentences had shorter distances than the random versions. The researchers think this helps listeners, because they do not have to hold words in memory for long. Japanese, Korean and Turkish showed a smaller effect.
118 words ・ CEFR B1
和訳を見る
どの文でも、ある単語はほかの単語に依存しています。動詞には主語と目的語が必要ですし、形容詞は名詞に属しています。
MITの研究者たちは、言語がこうした結びついた単語を近くに置いているかどうかを調べました。彼らは、すでに人の手で分析された37言語の文のコレクションを使いました。コンピューターは1つの文ごとに、文法上の結びつきは同じで単語の順番だけがでたらめな版を100通り作りました。
そしてチームは、結びついた単語どうしの距離の合計を比べました。どの言語でも、本物の文のほうがでたらめな版より距離が短かったのです。研究者たちは、聞き手が単語を長く記憶にとどめておかなくてすむので、これは聞き手の助けになると考えています。日本語、韓国語、トルコ語では効果が小さめでした。
4択リーディングクイズ
Q1. What is the passage mainly about?
結びついた単語を近くに置いているかを37言語で調べた研究の紹介なので A。
Q2. How many random versions did the computer make for each sentence?
the computer made 100 versions とあるので D。37 は言語の数。
Q3. Why might short distances help listeners?
because they do not have to hold words in memory for long とあるので B。
When you read "pick the box that was lying on the kitchen floor up," you have to keep "pick" in mind until "up" finally arrives. Psychologists have long argued that this kind of long-distance link strains working memory. In 2015, Richard Futrell, Kyle Mahowald and Edward Gibson tested whether languages avoid such links on a large scale.
Using hand-checked treebanks from 37 languages, they shuffled the word order of each sentence 100 times while keeping its grammatical structure, and compared the real sentences with these shuffled versions. In all 37 languages, linked words sat closer together than chance would predict, and the gap grew as sentences got longer. The real orders were still longer than the shortest possible ones, so other pressures seem to compete.
Japanese, Korean and Turkish, which put verbs at the end, showed much less shortening. The authors suggested that case markers such as Japanese ga and o let readers track links over longer distances. The Japanese data, however, came from spoken dialogue while most other corpora were written text, a mix that critics questioned. Experiments show that Japanese speakers tend to put long phrases first, which keeps short phrases next to the final verb.
198 words ・ CEFR B2
和訳を見る
"pick the box that was lying on the kitchen floor up" という文を読むとき、up がようやく現れるまで pick を覚えておかなければならない。心理学者たちは長年、この種の離れた結びつきは作業記憶に負担をかけると論じてきた。2015年、リチャード・フットレル、カイル・マホワルド、エドワード・ギブソンは、言語がこうした結びつきを大規模に避けているかどうかを検証した。
37言語の人手でチェックされたツリーバンクを使い、各文の文法構造を保ったまま語順を100回シャッフルし、本物の文とシャッフル版を比べた。37言語すべてで、結びついた単語は偶然から予想されるより近くに置かれており、その差は文が長くなるほど広がった。それでも本物の語順は理論上の最短の並べ方よりは長く、ほかの圧力も競合しているようだ。
動詞を最後に置く日本語、韓国語、トルコ語では、短縮がずっと小さかった。著者らは、日本語の「が」「を」のような格を示す助詞のおかげで、読み手は離れた結びつきも追いやすいのではないかと示唆した。ただし日本語のデータは話し言葉の対話から取られていたのに対し、ほかの多くのコーパスは書き言葉で、批判者たちはこの混在を問題にした。実験では、日本語の話し手は長い語句を先に置く傾向があり、それによって短い語句が文末の動詞のすぐそばに残ることが示されている。
4択リーディングクイズ
Q1. What was the main goal of the 2015 study?
tested whether languages avoid such links on a large scale とあるので B。
Q2. What happened to the difference between real and shuffled sentences as sentences got longer?
the gap grew as sentences got longer とあるので C。
Q3. Why does the author mention that the Japanese data came from spoken dialogue?
日本語のデータだけが話し言葉で他の多くは書き言葉だったこと、批判者がジャンルの混在を問題にしたことを述べている。ジャンルの違いも結果に影響した可能性を示すためなので B。
重要単語
- dependencyC1名詞依存関係The verb and its object form a dependency.
depend on ~(~に頼る)の名詞形。日常では「依存(症)」の意味でも使う。 - word orderB1名詞(句)語順Japanese word order is quite flexible.
in alphabetical order「アルファベット順に」の order と同じ「順序」。 - working memoryC1名詞(句)作業記憶(ワーキングメモリ)Long sentences put a load on working memory.
short-term memory(短期記憶)と近いが、情報を保ちながら操作する働きを強調する用語。 - baselineC1名詞比較の基準、ベースラインThey compared real sentences with a random baseline.
テニスコートの「ベースライン」と同じ語。研究では「比べる基準」の意味で頻出。 - minimizeB2動詞最小にするSpeakers seem to minimize the distance between related words.
minimum(最小)+-ize。反対は maximize。イギリス式つづりは minimise。 - shuffleB2動詞(順番を)混ぜる、シャッフルするThe computer shuffled the words a hundred times.
トランプを切る shuffle と同じ。音楽の「シャッフル再生」もこの語。 - head-finalC1形容詞主要部後置のJapanese is a head-final language.
head(中心語)が final(最後)に来る。英語は head-initial(主要部前置)寄り。
公式・一次情報をチェック
- How language gives your brain a break(MIT News, 2015)news.mit.edu
- Universal Dependencies(多言語の依存構造コーパス・プロジェクト)universaldependencies.org
このネタ、誰かに教えたくなった?
文法的につながる単語どうしの距離を測ると、37言語すべてで「でたらめに並べた場合」より短かったらしい。言語はみんな脳の記憶の負担を減らす並べ方を選んでいる? ただ日本語や韓国語、トルコ語は“短縮ゆるめ”。
押すと「マジかリスト」に保存されます
出典・参考文献(5件)タップで表示
原典ガイド:入門から読むと入りやすく、必読は議論の土台、発展はその先の論点です。
- 必読Futrell, Mahowald & Gibson (2015) Large-scale evidence of dependency length minimization in 37 languages. PNASdoi.org37言語を比べた本論文。ベースラインの作り方と、言語ごとの結果
- 発展Gibson (1998) Linguistic complexity: locality of syntactic dependencies. Cognitiondoi.org離れた依存ほど処理が重くなるとする局所性の理論を提案した心理言語学の古典
- 発展Yamashita & Chang (2001) "Long before short" preference in the production of a head-final language. Cognitiondoi.org日本語話者の「長いものが先」の傾向を示した産出実験
- 発展Liu, Xu & Liang (2015) Dependency length minimization: Puzzles and Promises. arXivarxiv.org先行研究、コーパスのジャンル、比較基準の問題を指摘したコメント論文
- 発展Yadav, Mittal & Husain (2022) A Reappraisal of Dependency Length Minimization as a Linguistic Universal. Open Minddoi.org依存距離を「語の数」ではなく「主要部の数」で測り直した再評価
※本記事は上記の研究・公開資料をもとに、原田英語が独自の言葉で解説したものです。引用は著作権法第32条の範囲で行い、出典を明記しています。画像はすべてオリジナルのイメージです。研究結果には限界や個人差があります。誤りのご指摘は原田英語のお問い合わせフォームから。









