小米開源MiMo-V2.6,智慧指數46分

小米 MiMo 團隊 9 月 22 日發布並開源 MiMo-V2.6 系列,旗艦版 MiMo-V2.6-Pro 與主打效率的 MiMo-V2.6-Flash 同時上線,網頁版、API 與 Hugging Face 權重下載入口一併開放。兩款都是原生全模態模型,文字、圖片、影片、音訊都能直接輸入模型,官方主打的方向是程式設計、電腦操作、3D 場景與影音內容創作這幾類代理型任務。

同一天,小米還推出了 Pro 的高吞吐量版本 Pro-UltraSpeed,宣稱在同等品質下輸出速度最高可提升 20 倍,目前正逐步開放。桌面用戶端 MiMo Desktop 也轉為正式版,並加入訂閱制。

分數與排名

第三方評測機構 Artificial Analysis 給 MiMo-V2.6-Pro 的綜合智慧指數是 46 分,在開源權重模型中排名第一,超過 Kimi K3 與 Qwen3.8 Max。根據媒體引用的排行榜,這個分數與 Claude Opus 5、GPT-5.6 Sol 落在同一區間,但和 Claude Fable 5.1、GPT-6 Astra 仍有差距。

價格沒有調整,沿用 V2.5 系列的 API 定價。Artificial Analysis 測得的單一任務成本是 0.13 美元;小米自己的說法是,在同等智慧水準下,Pro 的價格只有海外模型的 1/20 到 1/60。這組倍數來自廠商自己的說法,具體是跟哪幾款模型比較、按什麼任務換算,公開資料並未完整列出。

跟四月那一代比較

MiMo-V2.5-Pro 是今年 4 月底開源的,規格是 1.02 兆總參數、420 億啟用參數的 MoE 架構,上下文長度 100 萬 token。當時小米主打的是 token 效率,拿 ClawEval 和 DeepSeek-V4-Pro 相比。到了 7 月,V2.5 在 OpenRouter 上拿下月呼叫量與週呼叫量雙第一,主要靠的是價格。

V2.6-Pro 公開的參數規模仍是 1.02 兆總參數、420 億啟用,量級跟上一代一致。變化集中在後訓練上。負責人羅福莉把這次稱作「目前為止任何開源模型團隊做過規模最大的單次強化學習訓練之一」,並說這個專案背後的研究與工程難度,超過她過去參與的 DeepSeek-R1。

根據媒體披露的訓練帳目,Pro 和 Flash 各跑了 30 步,累積約 75 萬條軌跡,總成本約 350 萬美元,耗時六天。跟動輒上億美元的預訓練相比,這筆錢不算多;但對一次後訓練來說,放到開源團隊裡確實少見。

把 4 月到 9 月的動作串起來看,小米的路線相當清楚:先把底層模型的規模定住,靠價格拿下開發者端的呼叫量,再把資金和算力砸進強化學習拉分數。分數這一步已經走通,下一步要看的是呼叫量能不能在不降價的情況下守住。

訓練方法與一起釋出的東西

羅福莉表示,團隊採用一種叫 MixRL 的方式,把難度中等、結果可驗證的程式與代理任務放在一起聯合訓練;遊戲、3D、主觀評測這類難以驗證或特別冗長的任務則單獨訓練,最後用 MOPD 把各項能力合併起來。

這次開源的範圍比權重更廣。小米同時公開了用 MiMo 訓練軌跡蒸餾出來的 Qwen 模型、約 7000 個多樣化訓練環境,以及完整的強化學習框架。對想要複現或在自家模型上做後訓練的團隊來說,環境和框架的價值可能比權重本身還大。

羅福莉也在個人帳號上表示 MiMo-V2.6「已經是開源模型第一」。這句話目前只靠 Artificial Analysis 的綜合指數撐著,各家細分榜單的名次還沒全部出爐;在程式碼、圖像、語音這些分項上排第幾,會因為參考哪張榜單而有不同結論。小米也還沒公布 V2.6 的開源授權條款是否沿用上一代。

參考來源:小米 MiMo 官方發布頁、Artificial Analysis 智慧指數排行榜、CocoLoop、搜狐科技;智慧指數分數與單一任務成本以 Artificial Analysis 口徑核實,訓練成本與步數以媒體揭露口徑為準。