騰訊混元9月9日開源了語音生成與編輯模型AuK,程式碼放在GitHub的Tencent-Hunyuan組織下,權重同步上架Hugging Face與魔搭,技術報告編號為arXiv 2609.08936。
這個模型的定位不是又一個TTS。它把語音這條鏈上原本分散在十幾個專用模型裡的工作,收進同一個入口:用自然語言指令加一段參考音檔,說清楚要做什麼,模型就輸出改好的音檔。
十幾件事,一個入口
官方文件把任務分成六類。生成端是零樣本文字轉語音與指令式TTS;編輯端分三層——內容層改說出來的字詞和歌詞,聲學層改音高、語速、音量,副語言層改情緒、音色、口音和非語言聲音,還包括把正常說話轉成氣音;處理端則是降噪、去殘響、音樂分離和目標語者擷取。
過去每一項工作基本上都對應一個獨立模型。做配音的團隊得裝一套TTS,要改情緒得再找一套音色轉換工具,去背景音又得配一套分離模型,三者的音訊格式、取樣率、依賴版本各不相同,工程上的大頭往往花在把它們串起來。AuK的做法是把指令當成統一介面,讓模型自己判斷該走哪條路徑。
編碼器部分用的是Qwen2.5-Omni-3B作為多模態基礎模型。倉庫裡除了Python API,還附上Gradio介面與ComfyUI節點,這兩者都是目前開源音訊、影片社群常用的入口。示範影片裡的例子是中文和英文。
AuK-Flash快在哪裡
AuK-Flash是從基礎模型蒸餾出來的快速版,NFE固定為4、CFG設為0。官方描述蒸餾分兩階段:先用軌跡層級一致性初始化把少步數的學生模型帶起來,再切換到按任務路由的解耦DMD目標,分離任務則另外用乾淨預測回歸做監督。
對使用者來說,這些細節的意思是:常規擴散類語音模型一次生成要走幾十步取樣,還得為了品質再跑一次無條件分支,AuK-Flash把這兩筆開銷都省了,代價是與教師模型「接近」而非「等同」的品質。官方給出的是實測4.5倍加速,沒有公布對應的客觀指標損失。
和這個賽道上的其他開源模型比較
今年開源語音這塊發布密度不低。Mistral放出過40億參數的語音模型,評測對標ElevenLabs;阿里巴巴的Qwen3.5-Omni把文字、音訊、影片整合進一套系統並支援語音克隆;混元自己先前也已經開源過Hy4基礎模型和推論加速框架。
AuK的差異點不在跑分,而在「編輯」這兩個字。上面那幾個模型的主線是生成,給定文字產出語音;AuK的一半功能是拿一段已有音檔進來改,改完還得保住原語者的音色和節奏。這是兩類不同的工程問題,後者對一致性的要求更嚴格,也更貼近實際的後期製作流程。
MIT授權這一點值得單獨一提。它允許商用、修改和再散布,只要保留署名,比不少國產開源模型附帶的自訂授權條款寬鬆許多。對想把語音能力做進產品裡的小團隊來說,授權條款有時比參數量更能決定選型。
官方尚未公布與其他模型對比的WER、語者相似度或MOS數字,倉庫裡列了跨生成、編輯、強化、分離四類任務的效能對照,但具體分數需要自行重現。「發布即最強」的說法目前來自社群轉述,還沒有第三方評測跟進。
參考來源:Tencent-Hunyuan/AuK倉庫與技術報告、CocoLoop、Hugging Face論文頁;參數量、授權與加速比已按官方倉庫說明核對,評測分數尚未經獨立驗證。