ポッドキャスト版「Audiostart News」も配信中!各ポッドキャストプラットフォーム「オーディオスタートニュース」で検索!

声を一から設計できるGoogleの音声AI「Gemini 3.8 TTS」が登場

Googleは2026年9月23日、Geminiファミリーに2つの新しい音声合成(TTS)モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を追加したと発表しました。自然言語による声のデザイン、30秒の音声からの声の再現、1行ごとの演技指示などに対応し、Gemini APIやGoogle AI Studioなどで提供が始まっています。

Gemini 3.8 Flash TTSとFlash-Lite TTSの概要

Googleは、今回の2モデルについて同社史上もっとも表現力の高い音声生成モデルだとしています。音声生成を固定のプリセットから「ダイナミックなクリエイティブスタジオ」へと変えるものと位置づけ、クリエイター、開発者、企業がより豊かで表現力のある音声体験を作れるようにするとともに、Gemini NotebookやGoogle Vidsといった製品の体験向上にもつなげるとしています。

  • Gemini 3.8 Flash TTS:創造的な演出やキャラクターデザイン向けのモデルです。自然言語のプロンプトでまったく新しい声を作成でき、ゲーム、オーディオブック、ポッドキャスト、インタラクティブメディアなどでの活用が想定されています。演技の指示、テンポ、方言の切り替え、相づちなどを1行ごとに細かく制御できます。
  • Gemini 3.8 Flash-Lite TTS:大量処理とコスト効率を重視したモデルです。大規模な吹き替え、音声コンテンツ制作、表現力のある音声エージェント向けに最適化されており、トーンやテンポ、細かなニュアンスを制御できます。

これらは、3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinkingに続く「Gemini Audio」ファミリーの新モデルです。

自然言語で声を作成・カスタマイズ

Gemini 3.8 Flash TTSでは、これまでの30種類のオリジナル音声から、事実上無限の音声ライブラリへと拡張されます。主な機能は次のとおりです。

  • 生成型ボイスデザイン:役柄、アクセント、声の特徴を自然言語で指定し、100以上の言語・方言でオリジナルの声を作成できます。公式ブログでは、メルボルンのハイテンションなDJ、単調なロボット、日本のドラゴンといった作例が紹介されています。
  • 豊富な音声ライブラリ:2,000種類以上の実用レベルの音声を利用でき、メキシコのスペイン語、ケベックのフランス語、スコットランド英語といった地域的なバリエーションも含まれます。
  • ボイスレプリケーション(声の再現):本人の声、または使用権を持つ声の30秒の音声サンプルから、一貫した声のプロファイルを再現できます。同意確認、SynthIDによる電子透かし、C2PAクレデンシャルが組み込まれています。
  • 保存と再利用:作成したカスタム音声を保存・管理でき、継続的なプロジェクトでも声のブレを最小限に抑えられます。
  • ボイスリミックス(近日提供):ライブラリの音声を選び、音色、ピッチ、話す速さ、アクセントを微調整できる機能が今後提供される予定です。

1行ごとに演技を演出できる機能

声を選んだ後は、両モデルとも各セリフの読み方を細かく制御できます。

  • 1行ごとの演技指示:ト書きを自分で書くことも、台本内の自然な手がかりからGeminiに演技を任せることもできます。落ち着いたカスタマーサービス担当者から、ささやき声のサスペンスシーンまで対応します。
  • 長尺の音声生成:数時間におよぶ連続音声でも、音質、自然なテンポ、キャラクターの声質を保ち、話者のブレを最小限に抑えます。ポッドキャストやオーディオブックに適しているとしています。
  • 2話者のシーン演出:1つの台本から2人の会話を演出でき、両者の声を明確に分けたまま自然な話者交代を実現します。
  • 非言語音声と相づち:笑い声、ため息、息をのむ音といった非言語表現や、「うんうん」のような相づちを台本上で指定でき、会話にリアルな質感を加えられます。

ベンチマークで上位を獲得

Gemini 3.8 Flash TTSは、Hume AIのVoice Design Benchmarkで総合1位(71.4)を獲得し、アクセントのモデリングでもトップ(60.8)となりました。また、Hume AIのOverall Quality Indexでは、Gemini 3.8 Flash TTSが1位、Gemini 3.8 Flash-Lite TTSが2位を獲得しています。Gemini 3.1 Flash TTSと比べ、長尺コンテンツや2話者の脚本制御など幅広い用途で大きく改善したとしています。

さらに、Voice Arenaでのブラインド形式の人間による評価では、日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコのスペイン語、ヒンディー語といった主要言語で、競合の中で上位にランクインしています。

信頼性と透明性を確保する安全対策

Googleは、声の作成・再現機能について、声の提供者の保護やアイデンティティの尊重、コンテンツの透明性確保のための厳格な安全対策を講じたとしています。ボイスレプリケーションでは、声の所有者による口頭での同意録音を提出する必要があり、その声が参照音声の話者と一致しなければ声を作成できません。

また、Gemini Audioモデルで生成されたすべての音声には、知覚できない電子透かし「SynthID」が埋め込まれ、AIが生成した音声であることを検出できるようになっています。

Google AI Studioの新しいオーディオプレイグラウンド

開発者は、Google AI Studioで新しい音声生成機能を試せます。ボイスデザイン用のワークスペースとして設計されており、プロンプトで新しい声を作成したり、自分の声を再現したりしたうえで、2話者対応の脚本エディターで1行ごとに演出できます。なお、AI Studioでのボイスレプリケーションは、米国イリノイ州・テキサス州、EEA、英国、スイス、インドでは利用できません。

開発者プラットフォームとパートナー企業

Gemini APIを通じて、Agora、LiveKit、Pipecat、Vercelといった開発者プラットフォームで、音声生成体験を構築・展開できます。また、Figma、HeyGen、Linguana、Wondercraft、99.co、Ollangなどの企業が最新のTTSモデルを導入し、グローバルな吹き替えの加速、地域のアクセントを踏まえたメディアのローカライズ、大規模な会話型音声エージェントの実現に取り組んでいます。

提供状況

Gemini 3.8 Flash TTSは、発表日から順次提供されています。

  • 開発者向け:Gemini API、Google AI Studio
  • 企業向け:Gemini EnterpriseでAPI経由の提供を近日予定
  • 一般向け:Gemini Notebook

Gemini 3.8 Flash-Lite TTSも、発表日から順次提供されています。

  • 開発者向け:Gemini API、Google AI Studio
  • 企業向け:Gemini EnterpriseでAPI経由の提供を近日予定
  • 一般向け:Google Vids

参照元:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

タイトルとURLをコピーしました