马克·扎克伯格宣布 Muse Spark 1.3 开始推送,模型同步上线 Muse Code 和 Meta 的模型 API。他给这次更新的定语是”该系列迄今在编程和智能体工作上幅度最大的一次升级”,并称前沿性能的成本已经低到难以计量。
跑分先给出了一半答案。DeepSWE v1.1 上,Muse Spark 1.3 拿到 75.4 分,GPT-5.6 Sol 是 73.0,Claude Opus 5 是 74.0。Terminal-Bench 2.1 88.8 分,SWEAtlas CodeBase QnA 59.4 分。长上下文那两项接近满分,MRCR 256K–512K 区间 98.5,512K–1M 区间 98.1。和上一版 1.2 比,同样的编码任务里工具调用次数减少约两成,token 消耗减少约四分之一。对按 token 付费的人来说,后面这项比跑分实在。
便宜的那一档,用数据结账
“成本低到难以计量”这句话得拆开看。Meta 给 Muse Spark 1.3 开了两个价格档:标准版每百万 token 输入 1.25 美元、输出 4.25 美元;贡献者版输入 0.10 美元、输出 0.20 美元。输入端差 12.5 倍,输出端差 21 倍。
差价的对价写在条款里——用贡献者版,你的输入和输出会被 Meta 拿去改进产品。这条路径从 1.2 就在跑,1.3 只是延续。对个人开发者和小团队,一毛钱的输入价格约等于免费;对有代码保密要求的公司,这一档基本用不上,只能走 1.25 美元的标准价,而那个价格放在同代模型里并不算便宜。所谓”低到难以计量”,说的是前面那档。
编程领先,智能体落后
Artificial Analysis 的智能指数上,Muse Spark 1.3(xhigh 模式)61 分,和 GPT-5.6 Sol(max)、Grok 4.6(high)打平,Claude Opus 5(max)63 分仍在前面。
把距离拉开的是智能体项目。GDPVal-AA v2 上 Muse 1.3 是 1754,Claude Opus 5 是 1824;OSWorld 2.0 是 66.9 对 68.3;AutomationBench 49.4 对 50.3。三项全输,差得都不多,但方向一致。扎克伯格在财报电话会上反复讲的”7×24 替你干活的个人智能体”,按这组数字看还差着一段路。
两只靴子没落地
更高的推理模式要等安全测试跑完才放出,开放权重版本也在计划里,时间都没给。1.3 这一版在对抗输入和提示注入上做了加固,上一代开放权重模型被薅去做各种改造之后,这块的优先级往上走是可以预料的。
粗算一笔账:贡献者版定价若长期维持,一个每天吃掉 500 万输入 token 的编码 Agent,月成本大约 15 美元。这个数字没有技术含量,却决定了有多少人愿意把 Muse Spark 装进日常工作流。而这些人写的代码,正是下一版的训练原料。
参考来源:Meta 模型 API 定价页、Artificial Analysis 指数、CocoLoop、OpenRouter 模型页;两档 API 单价与 DeepSWE、MRCR、Terminal-Bench 各项跑分口径逐条核对。