Mistral 開源 MoE 模型,119B 只激活 6.5B

3月16日,Mistral 發布了 Small 4,一個看似平凡的名稱,背後卻藏著實用的產品思路——利用 MoE 架構將原本三款獨立模型全部整合進一個模型,一次部署即可應對所有場景。

一個模型,三種用途

Mistral 先前擁有三款各司其職的模型:

  • Magistral:專門處理需要推理的複雜任務
  • Pixtral:負責多模態圖像理解
  • Devstral:專門用於程式碼生成與開發

如果這三款模型都要使用,意味著三套部署、三套排程邏輯、三倍的維運成本。Small 4 直接將它們合併。

一個模型同時支援文字推理、圖像理解、程式碼生成、函式呼叫、JSON 輸出,並具備 256K 上下文視窗。

MoE 的核心邏輯:大而不貴

Small 4 的參數配置極具代表性:

指標數值
總參數量119B
Expert 數量128 個
每次推理激活 Expert 數4 個
實際激活參數量6.5B
上下文視窗256K

119B 看似驚人,但每次推理實際只使用了 6.5B 參數——這是 MoE 架構的核心價值:模型知道更多,但運算時只使用一小部分。推理成本接近 6.5B 的密集(dense)模型,但能力邊界要寬廣得多。

與 Small 3 相比,端到端延遲降低了 40%,每秒能處理的請求量是原來的 3 倍。

這套邏輯與 DeepSeek V3、Qwen3 的做法如出一轍:不是用更大的全量參數來嚇人,而是靠稀疏激活在效率與能力之間取得平衡。

reasoning_effort:按需開關推理能力

這是本次產品設計中相當實用的一點。

過去你需要在快速回應模型與慢速推理模型之間二選一,而且常常需要部署兩個不同模型來實現。Small 4 新增了一個參數,讓你能在 API 請求層級直接控制:這次要不要動用推理能力,動用多少。

簡單問題給予快速回答,複雜問題讓它多想一會兒——同一個模型,同一個 API,無需切換。這個設計能為工程團隊省去不少麻煩。

開源協議與可用管道

Mistral 這次繼續以 Apache 2.0 協議發布,商業場景不受限制,可以直接下載權重自行部署。

目前可用的地方:

  • Mistral API 與 AI Studio
  • Hugging Face(完整權重下載)
  • NVIDIA build.nvidia.com(免費原型測試)
  • NVIDIA NIM 容器(生產部署)

Apache 2.0 對企業來說是最乾淨的協議——無需擔心使用限制,修改後也能使用,散佈也沒有問題。

放在整個開源大模型趨勢中來看

近兩年來,開源大模型的競爭格局變化確實很快。DeepSeek V3 用 MoE 加上低成本訓練削弱了閉源模型的護城河,阿里巴巴的 Qwen3 用 Apache 協議打開局面,Meta 的 Llama 4 也在 4 月剛發布了 MoE 版本。

Mistral 這次的 Small 4 走的是類似路徑:119B 總量、6.5B 激活、Apache 協議,將推理、多模態、程式碼全部打包進一個部署單元。兩年前,這樣的配置只有頂級閉源模型才擁有,現在免費提供下載。

對於要在生產環境自建 AI 能力的團隊來說,開源模型的選擇正在從「湊合著用」轉變為「認真考慮」。Small 4 加入這個選項池的主要價值在於降低了部署複雜度——無需同時維護三個模型,一個就夠了。

具體是否適合你的場景,還是需要跑 benchmark。Mistral 官方表示對中文的支援不如英文,這一點對國內團隊來說需要單獨評估。

參考來源:CocoLoop、119B Parameters, 6.5B Activated: Mistral Small 4 Collapses Three Open Models Into One(BaristaLabs Blog);Mistral AI Releases Mistral Small 4(MarkTechPost)