AI

Googleが音声合成AI「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」をリリース


Googleが音声合成・テキスト読み上げモデルの「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」をリリースしました。日本語を含む100以上の言語・方言に対応し、2000種以上の音声でテキストを読み上げさせることができます。

Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/


Gemini 3.8 Flash TTSは高度な処理向けのモデルで、自然言語によるプロンプトを使って完全に新しい声をゼロから作成し、ゲーム、オーディオブック、ポッドキャストなどで利用することができます。Gemini 3.8 Flash-Lite TTSは大量処理向けのモデルです。


以下がGemini 3.8 Flash TTSの動作を紹介する動画です。「もっと低い声がいい」といった人間の要望に応え、AIが適切な音声を提案します。

Create your own voices with Gemini 3.8 text-to-speech - YouTube


また、30秒間の音声サンプルを吹き込むことで声を再現する機能にも対応。テキストを自分の声で読み上げさせることができます。この音声再現には透明性確保のために話者による同意が必要となっているため、映画やアニメの音声をそのまま入力して再現するといったことはできないようになっています。

数時間続く連続音声でも高い音声品質や自然なペース、キャラクターの声質を維持したり、複数人で会話するような表現を行ったり、笑い声やため息、相づちなどのリアクションを行ったりすることも可能。

音声AIベンチマークのHume AIでは総合スコアで1位を獲得。


人間による選考を行うVoice Arenaでは、日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語(MSA)などで上位に位置しています。


安全対策として、Gemini Audioモデル全般と同様、生成されるすべての音声クリップにはSynthIDによる透かしが入ります。

これらのモデルはGoogle AI Studioで体験できます。

・関連記事
「Grok Voice Think Fast 2.0」が登場、文字起こしと音声対話の両方に対応 - GIGAZINE

音声クローンが可能な音声合成AI「Qwen-Audio-3.0-TTS」が登場、日本語対応でGemini超えの性能 - GIGAZINE

Googleが日本語対応の音声合成AI「Gemini 3.1 Flash TTS」をリリースしたので使ってみた、音声タグで感情を制御可能 - GIGAZINE

in AI,   動画, Posted by log1p_kr

You can read the machine translated English article Google releases speech synthesis AI 'Gem….