去年 4 月 5 日 Meta 放出了 Llama 4,這是 Llama 系列**第一次用 MoE 架構**。同時發了兩個型號:
Llama 4 Scout
- 激活參數:17B / 總參數約 109B
- 專家數量:16 個
- 上下文窗口:1000 萬 token
沒錯,一千萬 token 的上下文。這個數字在當時直接刷新了開源模型的記錄。
Llama 4 Maverick
- 激活參數:17B / 總參數約 400B
- 專家數量:128 個
- 上下文窗口:100 萬 token
128 個專家,MoE 層和 dense 層交替排列——專家只在一半的層裡參與運算。
原生多模態
兩個模型都透過 early fusion 實現了原生多模態——文字和圖片不是靠外掛 adapter 拼接的,而是在模型內部原生融合處理。訓練數據超過 30 兆 token,涵蓋 200 多種語言。
性能水平
Maverick 在程式設計、推理、多語言、長上下文、圖像理解這幾個維度上超過了 GPT-4o 和 Gemini 2.0,和體量大得多的 DeepSeek V3.1 也能打。
Scout 定位平民路線——支援 4-bit 和 8-bit 量化,單卡就能跑。
還有個 Llama 4 Behemoth(激活 288B 參數),公布了但沒開源,當時還在訓練中。
一個細節:Meta 自己稱之為「open-weight」而不是「open-source」。模型權重是公開的可以微調,但完整的訓練程式碼和資料集並沒有放出來。
參考來源:CocoLoop、Meta AI 官方部落格