3月16日,Mistral 發布了 Small 4,一個看似平凡的名稱,背後卻藏著實用的產品思路——利用 MoE 架構將原本三款獨立模型全部整合進一個模型,一次部署即可應對所有場景。
一個模型,三種用途
Mistral 先前擁有三款各司其職的模型:
- Magistral:專門處理需要推理的複雜任務
- Pixtral:負責多模態圖像理解
- Devstral:專門用於程式碼生成與開發
如果這三款模型都要使用,意味著三套部署、三套排程邏輯、三倍的維運成本。Small 4 直接將它們合併。
一個模型同時支援文字推理、圖像理解、程式碼生成、函式呼叫、JSON 輸出,並具備 256K 上下文視窗。
MoE 的核心邏輯:大而不貴
Small 4 的參數配置極具代表性:
| 指標 | 數值 |
|---|---|
| 總參數量 | 119B |
| Expert 數量 | 128 個 |
| 每次推理激活 Expert 數 | 4 個 |
| 實際激活參數量 | 6.5B |
| 上下文視窗 | 256K |
119B 看似驚人,但每次推理實際只使用了 6.5B 參數——這是 MoE 架構的核心價值:模型知道更多,但運算時只使用一小部分。推理成本接近 6.5B 的密集(dense)模型,但能力邊界要寬廣得多。
與 Small 3 相比,端到端延遲降低了 40%,每秒能處理的請求量是原來的 3 倍。
這套邏輯與 DeepSeek V3、Qwen3 的做法如出一轍:不是用更大的全量參數來嚇人,而是靠稀疏激活在效率與能力之間取得平衡。
reasoning_effort:按需開關推理能力
這是本次產品設計中相當實用的一點。
過去你需要在快速回應模型與慢速推理模型之間二選一,而且常常需要部署兩個不同模型來實現。Small 4 新增了一個參數,讓你能在 API 請求層級直接控制:這次要不要動用推理能力,動用多少。
簡單問題給予快速回答,複雜問題讓它多想一會兒——同一個模型,同一個 API,無需切換。這個設計能為工程團隊省去不少麻煩。
開源協議與可用管道
Mistral 這次繼續以 Apache 2.0 協議發布,商業場景不受限制,可以直接下載權重自行部署。
目前可用的地方:
- Mistral API 與 AI Studio
- Hugging Face(完整權重下載)
- NVIDIA build.nvidia.com(免費原型測試)
- NVIDIA NIM 容器(生產部署)
Apache 2.0 對企業來說是最乾淨的協議——無需擔心使用限制,修改後也能使用,散佈也沒有問題。
放在整個開源大模型趨勢中來看
近兩年來,開源大模型的競爭格局變化確實很快。DeepSeek V3 用 MoE 加上低成本訓練削弱了閉源模型的護城河,阿里巴巴的 Qwen3 用 Apache 協議打開局面,Meta 的 Llama 4 也在 4 月剛發布了 MoE 版本。
Mistral 這次的 Small 4 走的是類似路徑:119B 總量、6.5B 激活、Apache 協議,將推理、多模態、程式碼全部打包進一個部署單元。兩年前,這樣的配置只有頂級閉源模型才擁有,現在免費提供下載。
對於要在生產環境自建 AI 能力的團隊來說,開源模型的選擇正在從「湊合著用」轉變為「認真考慮」。Small 4 加入這個選項池的主要價值在於降低了部署複雜度——無需同時維護三個模型,一個就夠了。
具體是否適合你的場景,還是需要跑 benchmark。Mistral 官方表示對中文的支援不如英文,這一點對國內團隊來說需要單獨評估。
參考來源:CocoLoop、119B Parameters, 6.5B Activated: Mistral Small 4 Collapses Three Open Models Into One(BaristaLabs Blog);Mistral AI Releases Mistral Small 4(MarkTechPost)