지금 Claude Opus 4.6의 API 크레딧을 구매할지 고민하고 있다면, 이 글이 비용을 절약해줄 수 있다.
Anthropic은 2월에 Claude Sonnet 4.6을 출시했다. 가격은 Sonnet 4.5와 완전히 동일——입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러——하지만 벤치마크 점수는 5배 비싼 Opus 4.6에 직접적으로 근접했다.
숫자로 보기
가장 직관적인 비교부터 살펴보자:
| 벤치마크 | Sonnet 4.6 | Opus 4.6 | 격차 |
|---|---|---|---|
| SWE-bench Verified (코딩) | 79.6% | 80.8% | -1.2% |
| OSWorld-Verified (컴퓨터 조작) | 72.5% | 72.7% | -0.2% |
| 수학 (MATH-500) | 89% | 미공개 | — |
| GPQA Diamond (과학적 추론) | 74.1% | 91.3% | -17.2% |
코딩과 컴퓨터 조작——즉 대부분의 기업이 Claude에 시키는 작업——에서 Sonnet 4.6은 이미 Opus 4.6과 거의 동등하다. 실제 격차가 나타나는 것은 과학적 추론 같은 학술적 작업으로, Opus 4.6의 91.3% 대 Sonnet의 74.1%는 무시할 수 없는 차이다.
하지만 주된 사용 사례가 코드 작성, 브라우저 조작, 장문 문서 처리라면, 코딩에서 1.2%포인트 향상을 위해 5배의 가격을 지불하는 것은 어떤 계산으로도 현명한 선택이 아니다.
컴퓨터 조작 성능 곡선은 얼마나 가파른가
Anthropic은 지난 16개월간 OSWorld-Verified(AI의 자율 컴퓨터 조작 능력을 측정하는 표준 테스트) 점수의 변화를 공개했다:
- Sonnet 3.5: 14.9%
- Sonnet 3.5 v2: 28.0%
- Sonnet 3.6: 42.2%
- Sonnet 4.5: 61.4%
- Sonnet 4.6: 72.5%
1년 반 만에 14.9%에서 72.5%로——이 곡선은 대부분의 사람이 인식하는 것보다 더 가파르다. 보험업계 워크플로 자동화 테스트에서 Sonnet 4.6은 94%의 정확도를 기록했으며, 복잡한 Excel 표 조작, 다단계 웹 양식 작성, 레거시 데스크톱 애플리케이션 호출과 같은 까다로운 작업을 처리했다.
수학에서 큰 도약
Sonnet 4.5는 수학에서 62점을 받았지만, Sonnet 4.6은 89점으로 직접 뛰어올랐다. 이 폭은 같은 세대 제품 중 가장 큰 단일 항목 개선이다. Anthropic은 구체적인 이유를 공개하지 않았지만, 추론 능력의 전반적인 향상을 고려할 때 더 나은 사고 사슬(chain-of-thought) 품질과 관련이 있을 가능성이 높다.
사용자 선호도 데이터
Anthropic은 Claude Code 내부 테스트를 진행하여 개발자들이 어떤 모델의 출력인지 모르는 상태에서 품질을 비교하게 했다:
- Sonnet 4.6 vs Sonnet 4.5: 사용자의 70%가 Sonnet 4.6 선택
- Sonnet 4.6 vs Opus 4.5: 사용자의 59%가 Sonnet 4.6 선택
후자의 데이터가 더 흥미롭다. Opus 4.5는 Sonnet 4.6보다 훨씬 비싸지만, 실제 코딩 출력에 대한 주관적 평가에서는 Sonnet 4.6이 오히려 더 선호되었다. 이유로는 지시 따르기의 정확성, 환각(할루시네이션) 감소, 과도한 엔지니어링 방지——이는 Opus 시리즈의 지속적인 문제로, 단순한 요구를 복잡하게 만드는 경향이 있다——등이 꼽혔다.
100만 토큰 컨텍스트는 과장이 아니다
이번 Sonnet 4.6에는 100만 토큰 컨텍스트 윈도우(베타)도 탑재되어 있으며, 추가 헤더가 필요하지 않다. 20만 토큰을 초과하는 요청은 자동으로 이 채널을 통해 처리되며, 가격은 표준 요금제를 따른다.
100만 토큰은 어느 정도 규모일까? 중견 기업의 전체 코드베이스 또는 수십 편의 논문을 단일 요청으로 처리할 수 있다. 기존에는 RAG 청킹이 필요했던 시나리오도 이제는 그냥 입력하여 모델이 스스로 관련성을 찾도록 할 수 있다.
결국 무엇을 선택해야 할까
Sonnet 4.6을 선택할 이유:
- 주요 작업이 코드 작성, 브라우저 조작, 장문 문서 처리
- 사용량이 많고 가격에 민감함
- 박사 수준의 과학적 추론이 필요하지 않음
Opus 4.6을 선택할 이유:
- 고강도 과학적 추론 또는 학술적 작업이 필요함
- 컨텍스트 요구사항이 극도로 복잡함
- 가격 차이를 신경 쓰지 않고 최고의 결과만 원함
대부분의 개발자와 기업에게 Sonnet 4.6은 현재 가장 비용 효율적인 Claude 진입점이다. Opus 4.6의 가격은 15달러/75달러, Sonnet 4.6은 3달러/15달러로, 동일한 코딩 능력에서 5배 차이가 난다. 계산은 어렵지 않다.
출처: Introducing Claude Sonnet 4.6(Anthropic 공식); CocoLoop, Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide(NxCode); Claude Sonnet 4.6: 1M context and stronger computer use(Gend.co)