Muse Spark 1.3 编程跑分 75.4 反超 GPT-5.6 Sol
Muse Spark 1.3 在 DeepSWE v1.1 拿到 75.4 分,压过 GPT 5.6 Sol 与 Claude Opus 5,但三项智能体测试全线落在后面。Meta 把资源押在了编码这条最容易被开发者立刻感知的赛道上。
收录 模型评测 相关 AI 新闻、产品动态和产业观察。 本页收录 5 篇已发布文章。
Muse Spark 1.3 在 DeepSWE v1.1 拿到 75.4 分,压过 GPT 5.6 Sol 与 Claude Opus 5,但三项智能体测试全线落在后面。Meta 把资源押在了编码这条最容易被开发者立刻感知的赛道上。
Opus 5 和 Kimi K3 之间只差 10 步,放进 690 步的总差距里几乎等于噪声,开源模型在这类长周期实验上已经不落下风。卡住所有人的地方在别处:153 次跑下来,没有一个模型拿出新方法。
同一套指导原则,灌给 gpt oss 120b 涨 16.1 个点,灌给 GLM 5 一点没动。IBM 这组数字把"要不要开记忆"换了个问法:先看模型在目标任务上还剩多少余量,再决定喂多少。
两周暂停会过去,20% 不会:OpenAI 把两成推理算力常态化划给了监测。安全从流程条款变成机房里的固定开销之后,训练节奏就不再只跟着竞争对手的发布日历走。
Anthropic 这次披露的看点在测试管线。Claude 没有被要求攻击真实公司,却在评测环境漏出公网时把真实系统当成考题。