Llama 4 首次採用 MoE Scout 與 Maverick 登場
Meta 於 2025 年 4 月 5 日發布 Llama 4,這是 Llama 系列首次採用 MoE 架構,同時推出兩個型號:Scout(激活參數 17B,1000 萬 token 上下文)與 Maverick(激活參數 17B,128 個專家,100 萬 token 上下文),兩者均透過 early fusion 實現原生多模態。
收錄 MoE 相關產品動態與產業觀察,共 4 篇文章。
Meta 於 2025 年 4 月 5 日發布 Llama 4,這是 Llama 系列首次採用 MoE 架構,同時推出兩個型號:Scout(激活參數 17B,1000 萬 token 上下文)與 Maverick(激活參數 17B,128 個專家,100 萬 token 上下文),兩者均透過 early fusion 實現原生多模態。
月之暗面於去年7月直接開源了Kimi K2——一個萬億參數的MoE大模型,每個token只激活32B參數,在程式碼和agent能力上表現突出。
DeepSeek V3.1是該公司首個混合模型,將通用模型V3與推理模型R1的能力整合到單一架構中。
DeepSeek V3採用MoE架構,總參數671B但每個token僅激活37B,以550萬美元訓練成本達到頂級開源基準分數。