Meta 在 4 月用 Muse Spark 告诉开发者,它也会做闭源旗舰模型。四个月后,8 月 10 日,Meta 又把 Muse 系列的一部分拉回开源权重路线:Muse Glimmer 30B 已在 Hugging Face 上架,定位是能跑在 Mac 或单张消费级 GPU PC 上的本地 Agent 模型。
这个节点的信号不在“30B”本身。过去半年,中国和海外开源模型已经把参数、上下文和跑分堆到很高。Meta 更想证明的是:一个较小、可下载、可商用许可的模型,能不能在电脑本地完成长任务、读图、调用工具、失败后重试,而不必把每一步都交给云端 API。
Zuckerberg 同日发布了题为 “The Future Is for Everyone” 的长文,Business Insider 抓到其中一句核心表态:
“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”
自然说,就是 Meta 想把“谁能接触高级 AI 能力”这个问题,重新放回开放生态和个人设备上讨论。
30B 不是炫参数,是卡显存
Hugging Face 模型卡给出的硬参数很具体:Muse Glimmer 是约 29.6B 参数的 dense causal Transformer,带约 1.8B 参数的 ViT-G/14 感知编码器;上下文长度为 131,072+ token,词表为 202,048,训练覆盖 100 多种语言,知识截止到 2026 年 1 月 4 日。
这些数字里,最实用的是内存口径。Meta 称,30B 全精度需要 55GB 以上内存,消费级设备很难承受;Glimmer 通过约 4-bit 量化,把语言模型压到 20GB 以下,给 KV cache、图像感知编码器和 speculative decoding drafter 留出余量,目标落在 24GB 或 32GB 的本地配置。
这不是云端 MaaS 的延迟口径,也不是价格表。它说的是本地部署门槛:你的显卡或 Mac 内存够不够把 Agent 循环跑起来。
Meta 还给了一个加速设计。Muse Glimmer 随包带一个基于 DFlash 的轻量 drafter,一次提出 16 个 token 块,再由主模型并行验证。官方博客称,在 RTX 5090 上,K-Quant-17GB 模型配合量化 drafter 的解码速度提升 3.1 倍;M5 Max 上为 1.8 倍,M4 Max 上为 1.5 倍。
这些数字只适用于 Meta 指定的本地硬件和 K-Quant-17GB 配置,不能拿去和云端调用延迟混写。但它说明 Meta 正把“本地 Agent 好不好用”拆成了显存、解码速度和工具循环三件事。
Agent 能力写进模型卡
Muse Glimmer 的发布材料没有主打聊天陪伴。Meta 把能力列成 Agent 清单:端到端任务完成、可靠工具调用、多步推理、失败恢复、多模态输入、OpenClaw 等 scaffold 兼容、reasoning effort 可控,以及多语言支持。
跑分也围着这些场景展开。模型卡显示,Muse Glimmer 在 MCP Atlas Public 上为 75.5,DeepSearch QA 为 74.6,SWE-Bench Pro 为 51.2,SWE-Bench Verified 为 76.0;多模态侧,Charxiv Reasoning 为 78.8,ScreenSpot Pro 为 75.4。对照组是 Gemma4-31B Thinking Mode 和 Qwen3.6-27B Thinking Mode。
这组 benchmark 不能直接等于真实工作完成率。企业里一个 Agent 要接数据库、浏览器、代码仓库、权限系统和审计日志,任何一层工具失败都会拖累体验。Meta 这次的价值在于,它把本地模型的验证重点从“答题聪不聪明”推到“能不能完成带工具的长循环”。
中文读者可以把它放进一个更近的参照系:过去几个月,Qwen、Kimi、DeepSeek、智谱等模型不断把开源权重、长上下文和低成本推理变成默认竞争项。Meta 用 Muse Glimmer 回到开放权重,不只是开源姿态回归,也是在回应中国模型给美国实验室造成的开发者压力。
开源权重回归,边界也写得更细
许可层面,Glimmer 采用 Apache 2.0。Meta 称权重已经可在 Hugging Face 下载,后续会通过 Ollama、LM Studio、Unsloth 跑本地版本,适配 llama.cpp、ExecuTorch、MLX,也可在 vLLM、SGLang 上做规模化服务,并接入 Together AI、Fireworks AI、OpenRouter 等平台。
这让它和 4 月的 Muse Spark 形成反差。Muse Spark 是闭源旗舰,后续 Muse Spark 1.1 又进入 Meta Model API 计费;Muse Glimmer 则把重点放在下载、量化、本地推理和开放生态。Meta 没有把最强模型直接开出来,给开发者的是一个能在个人设备上试错的 Agent 版本。
限制同样要看。模型卡写明训练数据包括公开数据、第三方提供数据、Meta 产品与服务信息,以及外部供应商网络和 Meta 人员整理增强的数据。安全部分也提醒,Glimmer 不应被当成独立端点裸用,应用侧仍需额外护栏,尤其是不可逆操作确认、数据最小化、scaffold 边界和间接提示注入防护。
这句话对本地 Agent 很现实。模型跑在你的电脑上,并不自动等于安全。它能读截图、调用工具、操作文件,权限边界反而更贴近个人设备。后续可核验的指标有三个:24GB/32GB 设备上的真实速度,OpenClaw、SGLang、Ollama 等工具链的落地质量,以及社区复测时它在长任务里的接管次数。
Meta 给出的答案还不完整,但方向足够清楚:闭源旗舰负责追前沿能力,开源权重模型负责抢开发者桌面。Muse Glimmer 如果能在本地 Agent 工作流里跑稳,Meta 就重新拿到一个 Llama 之后的开放生态入口;跑不稳,它只是又一个被下载、量化、跑分,然后很快被新模型盖过去的 30B。
参考来源:Meta AI Research、Hugging Face 模型卡、Business Insider、FoneArena、CocoLoop;核验 29.6B 参数、1.8B 感知编码器、131,072+ token 上下文、Apache 2.0 许可、20GB 以下量化权重、24GB/32GB 本地部署口径、DFlash 3.1 倍/1.8 倍/1.5 倍解码加速和 MCP Atlas/SWE-Bench 等 benchmark 口径。