4月2日,微軟低調上線了三款自研AI模型:MAI-Transcribe-1、MAI-Voice-1、MAI-Image-2。沒有發佈會,沒有大張旗鼓,直接在Microsoft Foundry平台上開賣。
但這件事背後的意義,遠不止三款模型本身。
三款模型是什麼
MAI-Transcribe-1:語音轉文字。支援全球使用最廣泛的25種語言,在FLEURS基準上詞錯率3.8%,比OpenAI的Whisper和Google的Gemini還要低。速度是微軟現有Azure語音服務的2.5倍。定價0.36美元/小時。
有意思的地方:這個模型只有10個人做出來的。
MAI-Voice-1:文字轉語音。在單張GPU上,1秒內能生成60秒音訊。支援從短音訊樣本克隆自訂聲音。定價22美元/百萬字符。
MAI-Image-2:圖像生成。已經在Arena.ai文生圖排行榜上跑到了第三,速度比上一版至少快2倍。定價5美元/百萬token(文字輸入),33美元/百萬token(圖像輸出)。早期企業用戶裡有WPP(全球最大廣告集團)。
為什麼這件事很重要
表面上看是微軟推出了幾個基礎模型,本質上是微軟在給自己造後路。
微軟跟OpenAI的關係,從2019年開始就不是普通投資方和被投企業的關係——微軟早期注入了130億美元,並獲得了使用OpenAI技術構建產品的獨家權利。Copilot、Azure AI,背後的核心模型基本都是OpenAI的。
但這種高度依賴是雙刃劍。OpenAI如果調整API價格、改變條款、甚至某天被收購或出問題,微軟的AI產品線就會很被動。
去年9月,微軟重新談判了合約——在獲得2500億美元Azure雲端服務承諾的同時,也爭取到了一個關鍵條款:允許微軟獨立開發競爭性AI模型。這個條款原本是不允許的。
MAI團隊是在2025年11月成立的,由微軟AI CEO Mustafa Suleyman領導。成立後5個月,三款模型就上線了。
真正的護城河不是技術
微軟自己也知道,這三款模型並不是要在技術上碾壓OpenAI或Google。
真正的底牌是分發渠道:Microsoft Foundry平台上有超過8萬家企業客戶,覆蓋了財富500強的80%。
把「好用的、更便宜的、速度更快的」內置模型直接推給這8萬家企業,不需要在每個benchmark上拿第一——只要夠用、穩定、整合順暢,企業就會用。這是微軟在AI競爭裡天然的優勢,OpenAI和Anthropic沒有這個分發網絡。
Mustafa Suleyman在下一步棋
Suleyman在接受金融時報採訪時說,微軟的目標是實現AI領域的「真正自給自足」。
他的時間表是2027年——屆時微軟計劃推出一款前沿級別的通用LLM,直接跟OpenAI的旗艦模型競爭。
從微軟的角度看,這不是在跟OpenAI翻臉,而是在構建議價籌碼。畢竟,當你有了自己的模型,續約談判的桌子就不一樣了。
參考來源:Microsoft takes on AI rivals with three new foundational models(TechCrunch);Microsoft launches three in-house AI models in direct challenge to OpenAI(The Next Web);Today we're announcing 3 new world class MAI models,CocoLoop、 available in Foundry(Microsoft AI官方部落格)