Meta開源30B本地Agent模型

Meta 4 月用 Muse Spark 表明自己也會做閉源旗艦模型。8 月 10 日,它又把 Muse 系列的一部分拉回開源權重路線:Muse Glimmer 30B 已在 Hugging Face 上架,定位是可在 Mac 或單張消費級 GPU PC 上運行的本地 Agent 模型。

這件事的重點不只在 30B。過去半年,中國和海外開源模型已把參數、上下文和跑分堆到很高。Meta 更想驗證的是:一個可下載、可商用授權的模型,能否在本地完成長任務、讀圖、調用工具、失敗後重試,而不必把每一步都交給雲端 API。

“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”

30B 不是炫參數,是卡記憶體

Hugging Face 模型卡寫得很具體:Muse Glimmer 是約 29.6B 參數的 dense causal Transformer,帶約 1.8B 參數的 ViT-G/14 感知編碼器;上下文長度 131,072+ token,詞表 202,048,訓練覆蓋 100 多種語言,知識截止到 2026 年 1 月 4 日。

最實用的數字是記憶體。Meta 稱 30B 全精度需要 55GB 以上記憶體,消費級設備很難承受;Glimmer 透過約 4-bit 量化,把語言模型壓到 20GB 以下,為 KV cache、圖像感知編碼器和推測解碼 drafter 留出空間,目標落在 24GB 或 32GB 本地配置。

這不是雲端 MaaS 的延遲口徑,也不是價格表。它說的是本地部署門檻。 Meta 還提供基於 DFlash 的輕量 drafter,一次提出 16 個 token 區塊,再由主模型並行驗證。官方數字顯示,在 RTX 5090 上,K-Quant-17GB 模型配合量化 drafter 解碼速度提升 3.1 倍;M5 Max 為 1.8 倍,M4 Max 為 1.5 倍。

評測重點落在 Agent

Muse Glimmer 的材料沒有主打閒聊。Meta 列出的是端到端任務完成、可靠工具調用、多步推理、失敗恢復、多模態輸入、OpenClaw 等 scaffold 相容、reasoning effort 可控,以及多語言支援。

模型卡顯示,Muse Glimmer 在 MCP Atlas Public 上為 75.5,DeepSearch QA 為 74.6,SWE-Bench Pro 為 51.2,SWE-Bench Verified 為 76.0;多模態側,Charxiv Reasoning 為 78.8,ScreenSpot Pro 為 75.4。對照組是 Gemma4-31B Thinking Mode 和 Qwen3.6-27B Thinking Mode。

這些 benchmark 不能直接等於真實工作完成率。企業裡一個 Agent 要接瀏覽器、程式碼倉庫、權限、日誌和資料庫,任何一層工具失敗都會影響體驗。Meta 這次的變化,是把本地模型的驗證重點從「回答是否聰明」推到「能否完成帶工具的長循環」。

開源權重回歸,邊界也更細

授權採 Apache 2.0。Meta 稱權重已可在 Hugging Face 下載,後續可透過 Ollama、LM Studio、Unsloth 跑本地版本,適配 llama.cpp、ExecuTorch、MLX,也可在 vLLM、SGLang 上服務,並接入 Together AI、Fireworks AI、OpenRouter。

這與 4 月 Muse Spark 形成反差。Muse Spark 是閉源旗艦,後續 Muse Spark 1.1 又進入 Meta Model API 計費;Muse Glimmer 則把重點放在下載、量化、本地推理和開放生態。Meta 沒有把最強模型直接開出來,而是給了一個能在個人設備上試錯的 Agent 版本。

限制也要看。模型卡寫明訓練資料包括公開資料、第三方提供資料、Meta 產品與服務資訊,以及外部供應商網絡和 Meta 人員整理增強的資料。安全部分提醒,Glimmer 不應被當成獨立端點裸用,應用側仍需額外護欄,尤其是不可逆操作確認、資料最小化、scaffold 邊界和間接提示注入防護。

下一步可核驗的是三件事:24GB/32GB 設備上的真實速度,OpenClaw、SGLang、Ollama 等工具鏈落地品質,以及社群複測時它在長任務裡的人類接管次數。若能跑穩,Meta 就重新拿到一個 Llama 之後的開放生態入口;若跑不穩,它只是又一個被下載、量化、跑分後很快被新模型蓋過去的 30B。

參考來源:Meta AI Research、Hugging Face 模型卡、Business Insider、FoneArena、CocoLoop;核驗 29.6B 參數、1.8B 感知編碼器、131,072+ token 上下文、Apache 2.0 授權、20GB 以下量化權重、24GB/32GB 本地部署口徑、DFlash 3.1 倍/1.8 倍/1.5 倍解碼加速和 MCP Atlas/SWE-Bench 等 benchmark 口徑。