Anthropic은 4월 16일 Claude Opus 4.7을 출시했다. 이번 버전의 프로그래밍 능력 향상 폭은 많은 이들의 예상을 뛰어넘었다. 프로덕션 코드 수정 작업은 전 세대의 3배에 달했고, SWE-bench Pro는 53.4%에서 64.3%로 도약했다.
주목할 만한 세 가지 벤치마크 점수
핵심 데이터를 먼저 제시한다:
| 벤치마크 | Opus 4.6 | Opus 4.7 | 변화 |
|---|---|---|---|
| SWE-bench Pro | 53.4% | 64.3% | +10.9% |
| CursorBench | 58% | 70% | +12% |
| Rakuten-SWE-Bench (프로덕션 작업) | 기준선 | 3배 | 대폭 향상 |
SWE-bench Pro는 현재 가장 까다로운 프로그래밍 벤치마크로 인정받고 있다. 64.3%는 3월에 출시된 GPT-5.4와 2월의 Google Gemini 3.1 Pro를 넘어선 수치다. Anthropic 내부의 93개 프로그래밍 작업 테스트에서 Opus 4.7은 4.6보다 13% 향상되었으며, 4.6이 전혀 해결하지 못한 4개의 문제를 추가로 풀어냈다.
Rakuten의 수치가 가장 흥미롭다. "프로덕션 코드 수정 작업이 전 세대의 3배"라는 것은 합성 데이터셋이 아닌 실제 기업 코드베이스의 버그 수정을 의미한다. 실제 프로덕션 코드로 얻은 수치는 실험실의 합성 문제보다 더 큰 참고 가치가 있다.
Anthropic은 자체 금융 에이전트 평가(Finance Agent Evaluation)와 경제적 가치 지식 작업 벤치마크(GDPval-AA)도 실행했으며, 두 항목 모두에서 현재 최고 점수를 기록했다.
시각 능력 3배 이상 향상, 그러나 거의 언급되지 않음
프로그래밍 외에도 Opus 4.7은 이미지 처리에서 큰 업그레이드를 이루었다:
- 긴 변 최대 2576픽셀(약 375만 화소) 지원
- 기존 Claude 시리즈 이미지 해상도 상한의 3배 이상
- 화학 분자 구조도, 복잡한 엔지니어링 도면 인식이 확연히 개선
이는 연구 현장, 기술 문서 분석, 엔지니어링 도면을 읽는 사람들에게 큰 영향을 미칠 것이다. 코드 작성 시에는 직접적인 체감이 덜할 수 있지만, 멀티모달 엔지니어링에 종사하는 사람이라면 테스트해볼 만하다.
또 하나 간과하기 쉬운 변화: 토크나이저가 업데이트되어, 동일한 텍스트 입력이 이제 1.0~1.35배의 토큰 수를 생성한다. 나쁜 소식처럼 들릴 수 있지만(토큰이 많아지면 비용이 증가), 실제로는 모델이 정보를 더 세밀한 단위로 처리한다는 의미이며, 긴 문서와 복잡한 코드 이해가 더 견고해져야 한다.
Anthropic이 의도적으로 사이버 보안 기능을 차단한 이유
이것이 4.7 릴리스에서 가장 반직관적인 결정이다: Opus 4.7은 적극적으로 안전 가드레일을 추가하여, 고위험 사이버 보안 요청을 자동으로 감지하고 차단한다.
잠깐 — Anthropic은 지난주 사이버 보안에 특화된 Claude Mythos Preview를 출시하고, Amazon, Apple, Microsoft와 함께 Project Glasswing 전문 프로그램을 시작했다. 두 가지가 어떻게 동시에 성립할 수 있을까?
정답은 제품 계층화에 있다:
- Mythos는 보안 전문가를 위해 설계된 통제된 모델로, Cyber Verification Program을 통한 신원 확인 후에만 사용 가능
- Opus 4.7은 일반 대중을 위한 범용 플래그십으로, Anthropic은 누구나 쉽게 호출할 수 있는 공격 도구가 되는 것을 원하지 않는다
논리는 타당하다. 고위험 기능을 검증 가능한 전문 채널에 집중시키고 API를 통해 모든 사람에게 개방하지 않는 것 — 이것은 실용적인 보안 계층화 접근법이다.
새 기능 개요
이번에 동시에 여러 보조 기능이 출시되었다:
- Task budgets (공개 베타): 장시간 실행 작업에서 Claude가 자체 토큰 소비 속도를 관리하여 마지막 단계에서 갑자기 예산이 소진되는 것을 방지
- /ultrareview 명령어: 전용 코드 리뷰 세션으로, 버그와 설계 문제를 지적하며 일반 리뷰보다 더 깊은 분석 제공
- xhigh 노력 수준: 기존에는 high만 있었으나, 이제 xhigh가 추가되어 추론 깊이와 응답 속도 사이에서 더 세밀한 조정 가능
- Auto mode 확장: Max Claude Code 사용자가 사용 가능
가격은 변함없다: API 호출은 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러로 Opus 4.6과 완전히 동일하다. 플랫폼 지원: claude.ai, API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry에서 모두 사용 가능하며, 모델 ID는 claude-opus-4-7이다.
경쟁사와의 격차는 얼마나 큰가
Anthropic에 따르면, Opus 4.7은 에이전틱 프로그래밍, 대규모 도구 호출, 에이전틱 컴퓨터 사용, 금융 분석 항목에서 GPT-5.4(3월 출시)와 Gemini 3.1 Pro(2월 출시)를 모두 능가한다.
물론 벤치마크는 벤치마크일 뿐이다. 실제 경험상의 차이는 커뮤니티가 사용하기 시작한 후에 더 많은 증거가 나올 것이다. 그러나 Rakuten-SWE-Bench의 '3배'라는 수치만으로도 프로덕션 코드 수정 시나리오에서는 충분히 설득력이 있다.
Opus 4.6에서 4.7로의 전환은 단순한 스킨 체인지 수준의 소폭 반복 업데이트가 아니다 — 적어도 프로그래밍 작업에 있어서는 이번 향상 폭을 진지하게 받아들일 만하다.
출처: CocoLoop, Introducing Claude Opus 4.7(Anthropic Blog); Anthropic's Claude Opus 4.7 makes a big leap in coding, while deliberately scaling back cyber capabilities(The Decoder); Anthropic releases Claude Opus 4.7, narrowly retaking lead for most powerful generally available LLM(VentureBeat)