ポッドキャスト版「Audiostart News」も配信中!各ポッドキャストプラットフォーム「オーディオスタートニュース」で検索!

ElevenLabsが最新音声合成モデル「Eleven v4」提供開始、演じるAI音声と低遅延Turbo

イレブンラボは、新しいモデルアーキテクチャを採用した音声合成モデル「Eleven v4」の提供を開始しました。同社モデルで最も高い感情表現力を持ち、日本語を含む90以上の言語に対応します。リアルタイム対話向けに、音声生成開始までの推論時間が中央値約100ミリ秒の「Eleven v4 Turbo」も同時に公開しました。

「Eleven v4」とは

イレブンラボジャパン合同会社(本社:米国ニューヨーク州、CEO:Mati Staniszewski、以下イレブンラボ)は、2026年9月29日、音声合成(Text to Speech)モデル「Eleven v4」の提供開始を発表しました。新しいモデルアーキテクチャを採用しており、同社のモデルの中で最も高い感情表現力を備えるとしています。発表資料では、Eleven v4がArtificial Analysisの「Text to Speech Leaderboard(Provider Voices)」で1位となったことも示されています。

動画広告のナレーションやオーディオブックの登場人物、海外向けコンテンツの吹き替えでは、言葉の正確さに加えて「どのように話すか」が作品の印象を大きく左右します。Eleven v4は文章の文脈や演出の意図を捉え、声のトーン、間、感情、キャラクター性を表現します。イレブンラボは、台本を読み上げるだけでなく、声で「演じる」ためのモデルと位置づけています。

台本から感情を読み取り、環境音や効果音も生成

Eleven v4は、ドラマティックな場面、穏やかな語り、緊迫したせりふ、コミカルな掛け合いまで、同じ声のまま場面に応じた表現ができます。

「タグ」と呼ばれるプロンプトで感情表現を指定することもできますが、モデルはまず台本のテキストそのものを読み取ります。文章に含まれる感情や状況に合わせて、話し方が自然に変化する仕組みです。

環境音や効果音も、インラインタグで演技の中に組み込めます。たとえば「[door slams](ドアが閉まる)」や「[rain](雨)」を台本に書き込むと、場面に合った音を生成できます。

複数の話者による会話は、会話全体をひとつの文脈として生成されます。発言の重なりや間がやりとりの流れから生まれるため、別々に録ったテイクをつなぎ合わせたような不自然さが残りにくいとしています。

インラインタグで感情やテンポを直接指定

台本の中にインラインタグを記述することで、感情、テンポ、間、リアクション、効果音を直接指定できます。「[laughs](笑う)」「[whispers](ささやく)」「[long pause](長めの間)」などのタグを1つのせりふに複数並べた場合でも、前モデル「Eleven v3」と比べて格段に安定して反映されるとしています。

制作途中で1文だけを作り直すことも可能で、作り直した部分と前後のつなぎ目は、聞いても分からない水準で自然になじむとされています。また、発音記号(IPA)への対応も改善され、読み方の難しい固有名詞や人名を正しく発音させやすくなりました。

日本語を含む90以上の言語で表現力を強化

Eleven v4は90以上の言語に対応しています。日本語は、ブラジルポルトガル語、標準中国語、広東語などとともに、前モデルからの品質改善に重点が置かれた言語のひとつです。改善は発音の正確さだけでなく、リズム、感情、話し方の自然さといった「その言語らしさ」にも及ぶとしています。

もうひとつの特徴が、声と話し方を切り離して扱える点です。従来は、ある言語の話者の声で別の言語の台本を読ませると、元の言語の特徴が話し方に残ることがありました。Eleven v4では標準で、声の特徴は保ったまま、話し方を台本の言語のネイティブに切り替えます。たとえば日本語の音声をもとに英語の台本を読ませる場合でも、声の特徴を保ちながら英語として自然な発音に近づけられます。ただし、結果は元の音声や言語によって異なるとしています。

リアルタイム対話向けの「Eleven v4 Turbo」

同時に公開された「Eleven v4 Turbo」は、Eleven v4の表現力を低遅延で利用できるモデルです。最初の音声が出るまでのモデル推論時間は中央値で約100ミリ秒です。この数値には、通信時間や大規模言語モデルによる回答生成の時間は含まれません。顧客サポート、予約、営業などの音声エージェントや、ライブアシスタントでの利用を想定しています。

両モデルは同じ表現機能を備えており、用途に応じて次のように使い分けられます。

モデル 向いている用途 主な提供先
Eleven v4 じっくり作り込むコンテンツ ElevenCreative、API
Eleven v4 Turbo リアルタイムのやりとり ElevenAgents、API

Eleven v4 Turboは音声品質とのわずかなトレードオフを伴う一方で、対話に適した低遅延を実現しています。提供初日から「ElevenAgents」で利用でき、大規模言語モデル(LLM)が回答を生成している途中からテキストを順次流し込んで音声化を始められるため、応答の待ち時間を短縮できます。通話の途中で相手の話す言語が切り替わっても、同じ声のまま新しい言語で応対を続けられます。

ボイスクローンの再現性と長尺コンテンツの一貫性

話者の声を再現するボイスクローン機能も向上しました。短い音声サンプルから声を再現する「インスタントボイスクローン」では、約10秒の音声からでも、声質や話し方の特徴をこれまで以上に忠実に捉えられるようになったとしています。話者が普段使う言語での生成に適した「プロフェッショナルボイスクローン」も引き続き利用できます。なお、話者が普段使わない言語で生成する場合は、言語によって声の特徴やアクセントの再現度に差が生じることがあるため、実際の音声を確認しながら利用するよう案内されています。

また、オーディオブックやポッドキャストのような長尺コンテンツでは、複数回に分けて生成した際に声質や話し方がばらつくことがありました。Eleven v4では、複数回の生成をまたいでも話者の声や話し方の印象を保ちやすくなっています。

提供方法と想定される用途

Eleven v4は「ElevenCreative」とAPIで、Eleven v4 Turboは「ElevenAgents」とAPIで利用できます。想定用途には、オーディオブック、ナレーション、キャラクターボイス、動画のボイスオーバー、吹き替えやローカライズ、教育コンテンツ、音声エージェントなどが挙げられています。

安全な音声AI利用に向けた取り組み

イレブンラボは、音声AIを安心・安全に使える環境の整備を技術開発の重要な前提と位置づけています。ボイスクローンの作成には声の利用に必要な権利や許可が求められ、特にプロフェッショナルボイスクローンは本人が自分の声を作成・確認する仕組みです。さらに、作成時のVoice CAPTCHAによる確認や、不正利用が確認されたアカウントへの対応など、悪用防止策を講じています。

イレブンラボについて

イレブンラボは2022年に設立されたAI研究・プロダクト企業です。企業向けの音声・チャットエージェント基盤「ElevenAgents」、コンテンツ制作・編集を支援する「ElevenCreative」、開発者向けの「ElevenAPI」を提供しています。企業評価額は110億米ドルを超え、Fortune 500企業の80%以上を含む数千社に利用されているとしています。

参照元: https://prtimes.jp/main/html/rd/p/000000070.000160611.html

タイトルとURLをコピーしました