Gemini 3.8 TTS上線,30秒複製聲音

Google於9月23日發布兩款語音合成模型:Gemini 3.8 Flash TTS與Gemini 3.8 Flash-Lite TTS。前者鎖定需要細膩掌控語氣、塑造角色的創作場景,後者則主打大量、低成本的呼叫需求。兩款模型當天起在Gemini API與Google AI Studio開放使用,企業版Gemini Enterprise隨後跟進。

能做到什麼

聲音來源有三種:30種原生音色、超過2,000種可直接商用的現成音色,以及使用者自訂的音色。自訂音色只需要一段30秒的錄音樣本,Google表示支援100多種語言與方言。多音色混搭功能目前標示為「即將推出」。

控制方式上,開發者可以用自然語言逐句撰寫演出指示,例如哪一句要壓低音量、哪一句要帶笑聲。模型原生支援雙人對話情境,能依腳本插入笑聲、嘆氣、倒抽一口氣,以及「嗯」「對」這類附和語氣。Google還表示,生成長達數小時的內容時音質不會明顯劣化。

兩款模型也落地到消費端產品:Flash TTS已加入Gemini Notebook,Flash-Lite TTS則進駐Google Vids,一般使用者都能使用。Agora、LiveKit、Pipecat、Vercel、Figma、HeyGen等十家公司是首批整合夥伴。

聲音複製有地區限制

Google為複製功能設了幾道防線:所有生成的音檔都會加上SynthID浮水印,複製前必須完成授權同意驗證,並附上C2PA內容憑證。複製功能目前在美國伊利諾州、德州,以及歐洲經濟區、英國、瑞士、印度尚未開放。其中伊利諾州與德州都訂有專門的生物辨識資訊保護法。

評測部分,Google引用Hume AI的音色設計指標,聲稱Flash TTS在總排行榜奪冠、口音建模也排名第一;在Voice Arena的日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西語、印地語榜單上皆名列前茅。這些都是Google轉述的第三方排行成績,官方公告並未單獨提到中文表現。

算一筆帳

Gemini API定價頁面寫明,音訊輸出以每秒25個token計費。一小時語音等於9萬個音訊token。以每百萬token的輸出價粗抓每小時成本:

模型2026年底前2027年1月1日起
3.8 Flash TTS(9美元/18美元)約0.81美元/小時約1.62美元/小時
3.8 Flash-Lite TTS(6美元/12美元)約0.54美元/小時約1.08美元/小時
2.5 Flash預覽版TTS(10美元)約0.90美元/小時—

文字輸入今年底前每百萬token收0.5美元,明年起漲到1美元,但一小時的台詞量頂多幾萬字,這部分成本幾乎可以忽略。批次處理還能再打五折。

照這個算法,今年剩下的三個多月,新模型比舊預覽版便宜;明年起Flash版每小時貴了近八成,Flash-Lite也比舊版貴。Google並未說明為何採用「先半價、到期翻倍」的定價結構。對有聲書、Podcast、客服這類按小時消耗語音的業務來說,一小時1美元上下的成本仍遠低於真人配音,真正決定去留的更可能是音質與複製效果,這幾毛錢的價差影響有限。

參考來源:Google官方部落格、Gemini API定價頁面、CocoLoop、Hume AI;已核對音色數量、複製樣本長度、地區限制與每百萬音訊token的輸出價格。