Gemini 3.8 TTS登場、30秒の録音で声を複製

Googleは9月23日、音声合成モデル2種Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを発表した。前者は口調を細かく制御しキャラクターを作り込む制作用途向け、後者は大量・低コストの呼び出しを主眼としている。両モデルは同日からGemini APIとGoogle AI Studioで利用可能になり、法人向けのGemini Enterpriseも追って対応する。

何ができるのか

音声のソースは3種類ある。ネイティブの30種類の音色、商用利用可能な既製音色2,000種類以上、そしてユーザー自身が作るカスタム音色だ。カスタム音色の作成には30秒の録音サンプルがあれば十分で、Googleによれば100以上の言語・方言に対応するという。複数の音色を混ぜる機能は「近日公開」とされている。

制御面では、開発者がセリフ1行ごとに自然言語で演技指示を書ける。どの一文で声を落とすか、どこで笑うかといった具合だ。モデルはネイティブで2人の対話シーンに対応し、台本に沿って笑い声やため息、息をのむ音、「うん」「そうだね」といった相槌を挿入できる。数時間分の長尺コンテンツを生成しても音質は目立って劣化しないともGoogleは説明している。

両モデルは一般ユーザー向けの製品にも組み込まれた。Flash TTSはGemini Notebookに、Flash-Lite TTSはGoogle Vidsに搭載され、どちらも一般ユーザーが利用できる。Agora、LiveKit、Pipecat、Vercel、Figma、HeyGenなど10社が最初の統合パートナーとなった。

音声クローンには地域制限がある

Googleはクローン機能に複数の安全策を設けている。生成される音声には必ずSynthIDの電子透かしが入り、クローン作成前には同意確認が必要で、C2PAコンテンツ証明書も付与される。クローン機能は米イリノイ州、テキサス州、欧州経済領域(EEA)、英国、スイス、インドでは現時点で利用できない。イリノイ州とテキサス州には、生体情報保護に関する専用の州法がある。

ベンチマークについて、GoogleはHume AIの音色デザイン指標を引用し、Flash TTSが総合ランキング1位、アクセント再現でも1位だとしている。Voice Arenaの日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語の各ランキングでも上位に入ったという。これらはいずれもGoogleが引用する第三者ランキングの結果であり、発表文では中国語での成績には個別に触れていない。

コストを計算する

Gemini APIの料金ページによれば、音声出力は1秒あたり25トークンで計算される。1時間分の音声は9万音声トークンに相当する。出力価格(100万トークンあたり)からざっと1時間あたりのコストを試算すると次のようになる。

モデル2026年末まで2027年1月1日以降
3.8 Flash TTS(9ドル/18ドル)約0.81ドル/時間約1.62ドル/時間
3.8 Flash-Lite TTS(6ドル/12ドル)約0.54ドル/時間約1.08ドル/時間
2.5 Flashプレビュー版TTS(10ドル)約0.90ドル/時間—

テキスト入力は年内が100万トークンあたり0.5ドル、来年からは1ドルだが、1時間分のセリフ量はせいぜい数万文字なので、このコストはほぼ無視できる。バッチ処理を使えばさらに半額になる。

この試算で見る限り、今年の残り3か月あまりは新モデルの方が旧プレビュー版より安い。しかし来年に入るとFlash版は1時間あたり約8割値上がりし、Flash-Liteも旧版より高くなる。「今は半額、期限が来たら倍額」という料金体系についてGoogleは説明していない。オーディオブックやポッドキャスト、カスタマーサポートのように音声を長時間使う用途にとって、1時間あたり1ドル前後のコストは依然として人間のナレーターよりずっと安く、採用を左右するのは音質やクローンの再現度であって、数十セント程度の価格差の影響は限定的だろう。

参考資料:Google公式ブログ、Gemini API料金ページ、CocoLoop、Hume AI。音色数、クローンサンプルの長さ、地域制限、100万音声トークンあたりの出力価格を確認済み。