Muse Spark 1.3, 코딩 75.4점으로 GPT-5.6 Sol 추월

마크 저커버그는 Muse Spark 1.3의 배포를 시작한다고 발표했다. 이 모델은 Muse Code와 Meta의 모델 API에 동시에 반영된다. 그는 이번 업데이트를 "이 시리즈에서 코딩과 에이전트 작업 측면에서 지금까지 가장 큰 폭의 업그레이드"라고 표현하며, 최상위 수준 성능을 얻는 데 드는 비용이 이제 셈하기 어려울 정도로 낮아졌다고 말했다.

벤치마크 수치는 이야기의 절반만 보여준다. DeepSWE v1.1에서 Muse Spark 1.3은 75.4점을 기록해 GPT-5.6 Sol의 73.0점, Claude Opus 5의 74.0점을 앞섰다. Terminal-Bench 2.1에서는 88.8점, SWEAtlas CodeBase QnA에서는 59.4점을 받았다. 긴 컨텍스트를 다루는 두 항목은 만점에 가까워 MRCR 256K~512K 구간에서 98.5점, 512K~1M 구간에서 98.1점을 기록했다. 이전 버전인 1.2와 비교하면 동일한 코딩 작업에서 도구 호출 횟수가 약 20% 줄었고, 토큰 소비량은 약 4분의 1 감소했다. 토큰 단위로 비용을 지불하는 사용자에게는 벤치마크 점수보다 이 수치가 더 와닿는다.

저렴한 요금제, 대가는 데이터로 치른다

"셈하기 어려울 정도로 낮아졌다"는 말은 뜯어볼 필요가 있다. Meta는 Muse Spark 1.3에 두 가지 요금제를 마련했다. 표준 요금제는 입력 100만 토큰당 1.25달러, 출력 4.25달러다. 기여자 요금제는 입력 0.10달러, 출력 0.20달러다. 입력 기준 12.5배, 출력 기준 21배 차이가 난다.

이 가격 차이의 대가는 이용 약관에 명시돼 있다. 기여자 요금제를 쓰면 입력과 출력 데이터를 Meta가 제품 개선에 활용한다. 이 방식은 1.2 버전부터 이어져 왔고, 1.3은 이를 그대로 이어받았을 뿐이다. 개인 개발자나 소규모 팀에게는 입력 10센트라는 가격이 사실상 무료나 다름없다. 반면 코드 기밀 유지가 필요한 기업은 이 요금제를 쓰기 어려워 1.25달러짜리 표준 요금제만 선택할 수 있는데, 이 가격은 동세대 모델 중에서 특별히 저렴한 편은 아니다. 결국 "셈하기 어려울 정도로 낮다"는 말은 앞의 요금제를 가리키는 셈이다.

코딩은 앞서고, 에이전트는 뒤처진다

Artificial Analysis의 지능 지수에서 Muse Spark 1.3(xhigh 모드)은 61점으로 GPT-5.6 Sol(max), Grok 4.6(high)과 동점을 이뤘다. Claude Opus 5(max)는 63점으로 여전히 앞서 있다.

격차가 벌어지는 지점은 에이전트 관련 벤치마크다. GDPVal-AA v2에서 Muse 1.3은 1754점, Claude Opus 5는 1824점이다. OSWorld 2.0은 66.9 대 68.3, AutomationBench는 49.4 대 50.3이다. 세 항목 모두 뒤졌고 격차 자체는 크지 않지만 방향은 일관된다. 저커버그가 실적 발표 때마다 언급하는 "하루 24시간 대신 일해주는 개인 에이전트"라는 그림은 이 수치들을 보면 아직 거리가 있어 보인다.

아직 떨어지지 않은 신발 두 짝

더 높은 추론 모드는 안전성 테스트가 끝난 뒤 공개될 예정이며, 오픈 웨이트 버전도 계획돼 있지만 둘 다 구체적인 시기는 나오지 않았다. 이번 1.3에서는 적대적 입력과 프롬프트 인젝션에 대한 방어가 강화됐는데, 이전 세대 오픈 웨이트 모델이 공개 후 다양한 방식으로 개조됐던 점을 감안하면 이런 우선순위 조정은 예상된 수순이다.

대략 계산해보면, 기여자 요금제 가격이 장기적으로 유지된다고 가정할 때 하루 500만 입력 토큰을 소비하는 코딩 에이전트의 월 비용은 약 15달러 수준이다. 이 숫자 자체에 기술적 의미는 없지만, 얼마나 많은 사람이 Muse Spark를 일상 업무 흐름에 들여놓을지를 좌우한다. 그리고 그렇게 쓰인 코드가 다음 버전의 학습 재료가 된다.

참고 출처: Meta 모델 API 가격 페이지, Artificial Analysis 지수, CocoLoop, OpenRouter 모델 페이지. 두 요금제의 API 단가와 DeepSWE, MRCR, Terminal-Bench 각 점수는 항목별로 대조 확인했다.