Claude Sonnet 5.5 출시, 속도↑30% 가격은 그대로

Anthropic는 9월 28일 Claude Sonnet 5.5를 공개했다. Opus 5.5에 이어 Claude 5.5 패밀리의 두 번째 모델이다. 회사가 제시한 핵심 수치는 두 가지다. Sonnet 5보다 30% 이상 빠르고, 대부분의 작업에서 태스크당 비용이 최대 30% 낮다는 것이다. API 가격은 변동이 없어 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러, 캐시 읽기는 0.2달러를 유지한다.

모델은 같은 날 Anthropic 자체 플랫폼과 AWS, Google Cloud, Microsoft Azure에 동시 출시됐다. API 상의 모델명은 claude-sonnet-5-5다. 제로 데이터 보존 옵션도 각 플랫폼에서 그대로 제공된다. 독립 개발자 Simon Willison은 claude.ai 무료 요금제가 이미 Sonnet 5.5로 전환됐다고 밝혔다.

공식이 내놓은 성적표

Anthropic가 발표 페이지에 올린 주요 결과는 다음과 같다.

벤치마크Sonnet 5.5
Terminal-Bench 4.070.6%
OSWorld 2.1(부분)80.1%
Humanity's Last Exam(도구 사용)64.5%
CursorBench 4.055.5%
FrontierCode 1.1(Max)46.2%
GDPval-AA v2.11844

초기 도입 기업들의 피드백은 속도에 집중돼 있다. Box는 신모델이 이전 버전보다 2.4배 빠르다고 밝혔고, Slack은 프롬프트를 바꾸지 않았는데도 더 좋고 더 빠른 결과를 얻었다고 전했다.

"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."

—Every, Tyler Nishida

제3자 테스트가 보여준 다른 면

Artificial Analysis는 Sonnet 5.5의 지능 지수를 56점으로 매겨 2위에 올렸다. Opus 5.5의 58점과는 2점 차이다. 자체 Terminal-Bench 4.0 테스트에서는 Sonnet 5.5가 64%를 기록했고, Opus 5.5와 GPT-6 Astra는 모두 60%였다. 약점은 사실 확인형 문제로, 사실 정확도는 54%로 Opus 5.5의 66%에 못 미쳤고, 과학적 추론 테스트에서도 Opus 5.5보다 6점 낮았다.

비용 항목은 공식 설명과 어긋난다. Artificial Analysis가 최고 추론 단계(max)로 전체 테스트를 돌린 결과, Sonnet 5.5는 작업당 평균 약 19만 3천 개의 출력 토큰을 소비했다. 이는 Opus 5.5와 Sonnet 5의 max 단계보다 약 60% 많고, GPT-6 Astra의 7배에 달한다. 단가는 그대로인데 토큰 수가 늘어난 결과, 작업당 비용은 약 7.6달러로 Sonnet 5보다 약 50% 높아졌다.

양측의 기준이 다르다. Anthropic가 말하는 "대부분의 작업"은 기본 단계에서 이뤄지는 일상적인 코딩·작문 작업을 뜻한다. 반면 Artificial Analysis가 측정한 것은 사고 예산을 최대로 쓴 극단적인 경우다. Willison도 같은 현상을 겪었다. max 단계에서 모델에 작은 WebGL 앱을 만들게 했을 때는 12만 8천 토큰을 소비해 1.28달러가 들었지만, xhigh 단계로 바꾸자 41초 만에 끝났고 비용은 약 0.06달러에 그쳤다. 그는 또 Sonnet 5.5가 Opus 5.5와 같은 문제를 갖고 있어 max 단계에서는 토큰 한도를 금방 써버리기 쉽다고 지적했다.

동급 모델과 비교하면

가로로 놓고 보면 Sonnet 라인의 위치는 분명해졌다. Opus 능력의 80~90%를 더 낮은 가격에 제공하는 것이다. Sonnet 5는 출시 당시 에이전트형 작업 비용이 Opus의 약 3분의 1이라는 점을 내세웠다. 5.5 세대는 속도를 끌어올리면서 벤치마크 점수도 Opus 5.5에 더 가까워졌다. Artificial Analysis 순위표에서 두 모델의 차이는 이제 2점뿐이다.

무료 요금제의 변화는 더 많은 사람에게 영향을 준다. Willison의 판단으로는 claude.ai 무료 사용자가 이제 ChatGPT 무료 요금제가 쓰는 Luna 시리즈보다 훨씬 강력한 모델을 쓰게 됐다. OpenAI의 GPT-6 Luna는 저가 노선을 택하고 있으며, Arena의 최신 데이터에 따르면 작업당 비용이 약 0.05달러에 불과하다. Anthropic는 아직 Haiku 5.5를 발표하지 않았지만, Willison은 몇 주 안에 나올 것으로 보고 있으며 그때가 되면 저가 단계에서 Luna와 정면으로 경쟁하게 된다.

개발자에게 가장 직접적인 조언은 max 단계를 서둘러 켜지 말라는 것이다. 현재 공개된 데이터로 보면 기본 단계나 xhigh 단계가 공식이 주장하는 "속도는 올리고 비용은 낮춘다"에 더 가깝고, max 단계 청구액은 이전 세대보다 오히려 높아질 수 있다. 특정 작업에서 실제로 이득인지는 Anthropic가 단계별 비용 내역을 공개하지 않아 직접 테스트해봐야 알 수 있다.

참고 출처: Anthropic 공식 발표 페이지, Simon Willison 블로그, CocoLoop, Artificial Analysis 벤치마크 리포트. API 가격은 Anthropic 발표 페이지 기준이며, 작업당 비용과 토큰 사용량은 Artificial Analysis 지능 지수 max 단계 기준이다.