馬克·祖克柏宣布Muse Spark 1.3開始推送,模型同步上線Muse Code與Meta的模型API。他將這次更新定調為「該系列迄今在程式設計與Agent工作上幅度最大的一次升級」,並表示前沿性能的成本已經低到難以計較。
跑分先給出了一半答案。在DeepSWE v1.1上,Muse Spark 1.3拿到75.4分,GPT-5.6 Sol是73.0分,Claude Opus 5是74.0分。Terminal-Bench 2.1拿下88.8分,SWEAtlas CodeBase QnA為59.4分。長上下文那兩項成績接近滿分,MRCR在256K–512K區間為98.5,512K–1M區間為98.1。與上一版1.2相比,同樣的程式設計任務中工具呼叫次數減少約兩成,token消耗減少約四分之一。對按token付費的人來說,後面這項比跑分更實在。
便宜的那一檔,用資料結帳
「低到難以計較」這句話得拆開看。Meta為Muse Spark 1.3開出兩個價格檔:標準版每百萬token輸入1.25美元、輸出4.25美元;貢獻者版輸入0.10美元、輸出0.20美元。輸入端差12.5倍,輸出端差21倍。
差價的對價寫在條款裡——使用貢獻者版,你的輸入與輸出會被Meta拿去改善產品。這條路徑從1.2就在跑,1.3只是延續下去。對個人開發者與小團隊而言,一毛錢的輸入價格幾乎等於免費;對有程式碼保密需求的公司來說,這一檔基本用不上,只能走1.25美元的標準價,而這個價格放在同世代模型裡並不算便宜。所謂「低到難以計較」,說的其實是前面那一檔。
程式設計領先,Agent落後
在Artificial Analysis的智慧指數上,Muse Spark 1.3(xhigh模式)拿到61分,與GPT-5.6 Sol(max)、Grok 4.6(high)打平,Claude Opus 5(max)以63分仍在前面。
把差距拉開的是Agent相關項目。GDPVal-AA v2上Muse 1.3是1754分,Claude Opus 5是1824分;OSWorld 2.0是66.9對68.3;AutomationBench是49.4對50.3。三項全輸,差距都不大,但方向一致。祖克柏在財報電話會議上反覆強調的「全天候替你工作的個人Agent」,就這組數字來看還有一段距離。
還有兩隻靴子沒落地
更高階的推理模式要等安全測試跑完才會釋出,開放權重版本也在規劃之中,但兩者都沒有給出時間表。這次1.3版在對抗性輸入與提示注入(prompt injection)上做了強化,考量到上一代開放權重模型在推出後被大量改造利用,這項優先順序的提升並不意外。
粗略估算:若貢獻者版定價長期維持,一個每天吃掉500萬輸入token的程式設計Agent,月成本大約落在15美元。這個數字本身沒有什麼技術含量,卻決定了有多少人願意把Muse Spark納入日常工作流程。而這些人寫出來的程式碼,正是下一版的訓練原料。
參考來源:Meta模型API定價頁、Artificial Analysis指數、CocoLoop、OpenRouter模型頁;兩檔API單價與DeepSWE、MRCR、Terminal-Bench各項跑分口徑逐條核對。