Anthropic이 9월 22일 Claude Opus 5.5를 공개했다. Claude 5.5 시리즈의 첫 번째 모델이다. 회사 측 설명은 크게 두 가지로, 대부분의 작업에서 성능은 Claude Fable 5.1과 비슷한 수준이며 전체 운영 비용은 Opus 5보다 40% 낮다는 것이다.
가격표를 항목별로 보면 입력은 100만 토큰당 4달러, 출력은 20달러로 각각 약 20% 인하됐다. 캐시 읽기는 0.50달러에서 0.20달러로 60% 낮아졌다. 출력 속도는 Opus 5보다 30% 이상 빠르다고 밝혔으며, 8달러·40달러로 책정된 fast 모드도 별도로 제공돼 최대 2.5배 빠른 속도를 낼 수 있다. 모델은 Claude 플랫폼 API(모델 ID 'claude-opus-5-5')와 AWS, 구글 클라우드, 마이크로소프트 애저에서 제공되며, 소비자용 각 플랫폼에서도 동시에 이용할 수 있다. 1회 최대 출력은 12만 8000토큰이다.
벤치마크
공식 발표 페이지가 제시한 비교는 다음과 같다.
| 벤치마크 | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% |
| GDPval-AA v2.1 | 1846 Elo | 1735 | 1708 |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% |
제3자 평가 기관인 Artificial Analysis는 지능 지수 순위에서 Opus 5.5를 1위로 꼽았으며 점수는 58점이다. 같은 날 출시된 Claude Code 2.1.280 버전에서는 이미 Opus 5.5가 기본 Opus 모델로 설정됐다.
발표 페이지에는 여러 고객사의 시험 사용 후기도 인용됐다. GitHub는 동일한 터미널 작업을 해결하는 데 필요한 단계 수가 Opus 5의 절반 이하로 줄었다고 밝혔고, Optiver는 품질은 Opus 5와 비슷한 수준을 유지하면서 턴 수가 약 절반으로 줄었고 비용도 40~50% 낮아졌다고 전했다. Deloitte는 사고(thinking) 수준을 최저로 설정한 상태에서 알려진 결함의 72%를 찾아냈다고 밝혔으며, Opus 5는 최고 수준에서도 56%에 그쳤다고 덧붙였다. 이 수치들은 모두 벤더의 발표 페이지에 실린 고객사의 발언으로, 제3자 검증을 거치지 않았다.
안전성에 대해 공식적으로 밝힌 내용
Anthropic에 따르면 Opus 5.5는 자동화된 행동 감사를 통과했으며 정렬(alignment) 점수는 역대 최고 수준이다. 샌드박스 경계를 우회하려는 시도는 Opus 5보다 85% 줄었다고 한다. 사이버보안 관련 작업 대부분은 여전히 Opus 4.8로 라우팅되며, 생물학 분야의 보호 수준은 Fable 5.1과 동일하다. 모델은 증류(distillation) 방지를 위한 추론 과정 보호 장치를 유지하고, EU AI법에 맞춰 워터마크를 적용했으며, 기업 고객은 제로 데이터 보존 옵션을 선택할 수 있다. 출시 전에는 METR와 Frontier Design이 평가에 참여했다.
구체적인 실패율, 거부율, 레드팀 결과는 시스템 카드 전문이 공개돼야 확인할 수 있으며, 공식 페이지 자체에는 이 수치들이 나와 있지 않다.
같은 날 발표된 가격표와 비교하면
9월 22일 OpenAI도 GPT-6 Sol과 Luna를 발표했으며, API 가격은 이전 세대보다 약 절반으로 낮아졌다. Sol은 2달러와 10달러, Luna는 0.10달러와 0.50달러다. 단순 비교하면 Opus 5.5의 토큰당 단가는 여전히 Sol의 두 배지만, Anthropic이 내세우는 것은 같은 가격대에서의 점수와 더 적은 단계 수다. Optiver와 GitHub의 설명대로 작업당 턴 수가 줄어들면 실제 청구서에서 단가 차이는 어느 정도 상쇄된다. 얼마나 상쇄되는지는 작업의 구체적인 형태에 따라 달라지며 일률적인 답은 없다.
개발자 진영에서는 이미 반대 사례도 나왔다. 기술 블로거 Simon Willison이 최고 사고 수준으로 Opus 5.5에 복잡한 SVG를 생성하게 한 테스트에서, 모델은 12만 8000토큰의 출력 한도를 전부 소진하고도 작업을 완료하지 못했다. 높은 사고 수준과 긴 출력을 함께 쓰면 출력 예산을 통째로 소모하기 쉬우므로, 자동화 파이프라인에 연결하기 전에 이 상한선을 미리 계산에 넣어야 한다.
이미 Opus 5를 쓰고 있는 팀이라면 전환 비용은 주로 두 곳에서 발생한다. 모델 ID를 바꿔야 하고, 출력 속도와 턴 수 변화로 인해 기존 타임아웃·재시도 설정이 더 이상 맞지 않을 수 있다. 가격 인하 효과는 호출 빈도가 높은 시나리오일수록 크게 체감되며, 특히 캐시 읽기의 60% 인하 폭이 그렇다. 상주 시스템 프롬프트가 길고 요청이 촘촘할수록 절감 비율이 커진다.
참고 출처: Anthropic 공식 발표 페이지, Artificial Analysis, CocoLoop, Simon Willison 블로그; 각 등급별 단가와 벤치마크, 안전 조치는 Anthropic 공식 발표 페이지 기준으로 확인했다.