Llama 4 首次採用 MoE Scout 與 Maverick 登場

去年 4 月 5 日 Meta 放出了 Llama 4,這是 Llama 系列**第一次用 MoE 架構**。同時發了兩個型號:

Llama 4 Scout

  • 激活參數:17B / 總參數約 109B
  • 專家數量:16 個
  • 上下文窗口:1000 萬 token

沒錯,一千萬 token 的上下文。這個數字在當時直接刷新了開源模型的記錄。

Llama 4 Maverick

  • 激活參數:17B / 總參數約 400B
  • 專家數量:128 個
  • 上下文窗口:100 萬 token

128 個專家,MoE 層和 dense 層交替排列——專家只在一半的層裡參與運算。

原生多模態

兩個模型都透過 early fusion 實現了原生多模態——文字和圖片不是靠外掛 adapter 拼接的,而是在模型內部原生融合處理。訓練數據超過 30 兆 token,涵蓋 200 多種語言。

性能水平

Maverick 在程式設計、推理、多語言、長上下文、圖像理解這幾個維度上超過了 GPT-4o 和 Gemini 2.0,和體量大得多的 DeepSeek V3.1 也能打。

Scout 定位平民路線——支援 4-bit 和 8-bit 量化,單卡就能跑

還有個 Llama 4 Behemoth(激活 288B 參數),公布了但沒開源,當時還在訓練中。

一個細節:Meta 自己稱之為「open-weight」而不是「open-source」。模型權重是公開的可以微調,但完整的訓練程式碼和資料集並沒有放出來。

參考來源:CocoLoop、Meta AI 官方部落格