心理学ホント

数分の録音で作ったAIの声、人は本物とほぼ聞き分けられなかった

数分の録音で作ったAIの声、人は本物とほぼ聞き分けられなかった

読む前に予想してみよう!

AIで作った声は、本物の人間の声よりも「人間らしい」と判断された

研究カード(どんな研究?)
対象
イギリスの成人(オンライン実験)
規模
各実験50人(計3実験)
研究の種類
知覚実験
確かさ
★★☆☆☆
3秒でわかる

市販ツールで作った「声のクローン」は、本物の声とほぼ同じ割合で「人間」と判定された。AIの声は本物より「支配的」に聞こえる傾向も。

ひとことで言うとAIでまねした声は、本物の人の声とほとんど区別できなかった!

もくじ
  1. 市販ツールで「声のクローン」を作ってみた
  2. クローンと本物、「人間」判定の割合がほぼ同じ
  3. 顔では起きた「超リアル効果」は、声ではまだ
  4. 詐欺から身を守るには
  5. まとめ

電話の向こうから聞こえる、家族の声。「ちょっと困ったことになって……」。

その声が、本人ではなくAIが作ったものだったら、あなたは気づけるでしょうか?

2025年、イギリスの研究チームが、聞き手の知らない人の声を使って実験したところ、答えは「ほぼ無理」でした。

01市販ツールで「声のクローン」を作ってみた

AIの声には2種類ありました。

  • 汎用AI音声:特定の誰かをまねていない、AIオリジナルの声
  • ボイスクローン:実在の人の声(本人の同意あり)を、短い録音から再現した声

研究者によると、クローン作りには専門知識はほとんど不要で、数分の録音とわずかなお金しかかからなかったそうです。

02クローンと本物、「人間」判定の割合がほぼ同じ

3種類の声を混ぜて聞かせた実験では、「人間の声だ」と判断された割合は、

  • 本物の人間の声:約72%
  • ボイスクローン:約70%
  • 汎用AI音声:約39%

クローンは、本物とほとんど同じ割合で「人間」と判断されたのです。一方、誰もまねていない汎用AI音声は、まだ見抜かれやすい結果でした。

知らない人の声なら、クローンと本物の区別はほとんどつかなかった
知らない人の声なら、クローンと本物の区別はほとんどつかなかった

03顔では起きた「超リアル効果」は、声ではまだ

画像の世界では以前、AIが作った顔の方が、本物の顔より「本物っぽい」と判断されるという研究が話題になりました(超リアル効果)。

今回の研究は「声でも同じことが起きるか?」を調べたもの。結果、本物を上回るほど「人間らしい」とは判断されませんでした。論文タイトルにある「(まだ)超リアルではない」はこのことです。

その代わり、AIの声は本物より「支配的(強そう)」に聞こえる傾向があり、一部のAI音声は本物より「信頼できそう」と評価されました。

04詐欺から身を守るには

声だけで本人だと判断するのは、もう危ない時代です。

数字をもう少し見てみると、汎用AI音声だけを本物と比べた実験では、本物の声が「人間」と判断されたのが約81%、汎用AI音声は約41%でした。誰かのコピーではないAIの声には、まだ聞き分けられる「AIっぽさ」が残っているようです。

05まとめ

数分の録音から、知らない人には本物と区別しにくい声を作れる――それが2025年の現実です。

もちろん、病気で声を失った人が「自分の声」で話せるようになるなど、良い使い道もたくさんあります。だからこそ、声は「本人確認」には使わない。これを新しい常識にしておきましょう。

この研究を英語で読もう原田英語の English CornerCan people tell an AI-cloned voice from a real one? 音声 4択クイズ9問A2・B1・B2タップして開く

原田英語の English Corner

この研究を英語で読もう

Can people tell an AI-cloned voice from a real one? In 2025, researchers at Queen Mary University of London tested this. Using a commercial service, they created voice clones from about four minutes of recordings of real people, who had agreed to take part. They also made general AI voices that did not copy anyone.

Listeners heard the voices and decided whether each was human or AI. Real voices were judged human about 72 percent of the time, and clones about 70 percent, so they were almost impossible to tell apart. General AI voices were judged human only about 39 percent of the time.

104 words ・ CEFR B1

和訳を見る

人は、AIで複製された声と本物の声を聞き分けられるでしょうか。2025年、ロンドン大学クイーン・メアリー校の研究者たちがこれを試しました。市販のサービスを使い、参加に同意した実在の人々の約4分の録音から、ボイスクローンを作りました。また、だれもまねしていない汎用のAI音声も作りました。

聞き手はそれぞれの声を聞き、人間かAIかを判断しました。本物の声は約72%、クローンは約70%の割合で人間だと判断され、両者を見分けるのはほぼ不可能でした。汎用のAI音声が人間だと判断されたのは、約39%にすぎませんでした。

4択リーディングクイズ

Q1. What were the voice clones made from?

Q2. Which type of voice was the easiest to recognize as AI?

Q3. What can we infer from the passage?

重要単語

  • voice cloneB1
    名詞(句)ボイスクローン(声の複製)A voice clone can copy someone's voice. clone は「複製」。動詞でも使い、clone a voice「声を複製する」。
  • distinguishB2
    動詞区別する、見分けるCan you distinguish a real voice from a fake one? distinguish A from B = tell A from B「A と B を区別する」は入試の定番語法。
  • realisticB1
    形容詞本物そっくりのThe AI voice sounded very realistic. 「現実的な」の意味も(a realistic plan)。hyperrealistic は「本物以上に本物らしい」。
  • fraudB2
    名詞詐欺Phone fraud is becoming more common. 発音は /frɔːd/(フロード)。commit fraud「詐欺を働く」。scam はより口語的。
  • trustworthyB2
    形容詞信頼できるSome AI voices sounded more trustworthy. trust(信頼)+worthy(~に値する)。praiseworthy(賞賛に値する)も同じ作り。
  • dominantB2
    形容詞支配的な、強そうなThe AI voices sounded more dominant than real ones. dominate(支配する)の形容詞形。dominant language「主要言語」など「優勢な」の意味でも頻出。

4コマでわかる

数分の録音で作ったAIの声、人は本物とほぼ聞き分けられなかったの4コマ漫画
市販のAIツールと数分の録音で作った「声のクローン」を聞かせたら、人は本物の声とほぼ区別できなかったらしい。本物を「人間」と判断したのが約7割、クローンも約7割。電話の「オレオレ」がますます危ない。

押すと「マジかリスト」に保存されます

出典・参考文献(4件)タップで表示
  1. Lavan et al. (2025) Voice clones sound realistic but not (yet) hyperrealistic, PLOS Onedoi.org
  2. Barrington, Cooper & Farid (2025) People are poorly equipped to detect AI-powered voice clones, Scientific Reportsdoi.org
  3. Miller et al. (2023) AI Hyperrealism: Why AI Faces Are Perceived as More Real Than Human Ones, Psychological Sciencedoi.org
  4. Nightingale & Farid (2022) AI-synthesized faces are indistinguishable from real faces and more trustworthy, PNASdoi.org