Claude Opus 4.7, 코드 능력 3배 향상…프로덕션 버그 수정 3배

Anthropic은 4월 16일 Claude Opus 4.7을 출시했다. 이번 버전의 프로그래밍 능력 향상 폭은 많은 이들의 예상을 뛰어넘었다. 프로덕션 코드 수정 작업은 전 세대의 3배에 달했고, SWE-bench Pro는 53.4%에서 64.3%로 도약했다.

주목할 만한 세 가지 벤치마크 점수

핵심 데이터를 먼저 제시한다:

벤치마크 Opus 4.6 Opus 4.7 변화
SWE-bench Pro 53.4% 64.3% +10.9%
CursorBench 58% 70% +12%
Rakuten-SWE-Bench (프로덕션 작업) 기준선 3배 대폭 향상

SWE-bench Pro는 현재 가장 까다로운 프로그래밍 벤치마크로 인정받고 있다. 64.3%는 3월에 출시된 GPT-5.4와 2월의 Google Gemini 3.1 Pro를 넘어선 수치다. Anthropic 내부의 93개 프로그래밍 작업 테스트에서 Opus 4.7은 4.6보다 13% 향상되었으며, 4.6이 전혀 해결하지 못한 4개의 문제를 추가로 풀어냈다.

Rakuten의 수치가 가장 흥미롭다. "프로덕션 코드 수정 작업이 전 세대의 3배"라는 것은 합성 데이터셋이 아닌 실제 기업 코드베이스의 버그 수정을 의미한다. 실제 프로덕션 코드로 얻은 수치는 실험실의 합성 문제보다 더 큰 참고 가치가 있다.

Anthropic은 자체 금융 에이전트 평가(Finance Agent Evaluation)와 경제적 가치 지식 작업 벤치마크(GDPval-AA)도 실행했으며, 두 항목 모두에서 현재 최고 점수를 기록했다.

시각 능력 3배 이상 향상, 그러나 거의 언급되지 않음

프로그래밍 외에도 Opus 4.7은 이미지 처리에서 큰 업그레이드를 이루었다:

  • 긴 변 최대 2576픽셀(약 375만 화소) 지원
  • 기존 Claude 시리즈 이미지 해상도 상한의 3배 이상
  • 화학 분자 구조도, 복잡한 엔지니어링 도면 인식이 확연히 개선

이는 연구 현장, 기술 문서 분석, 엔지니어링 도면을 읽는 사람들에게 큰 영향을 미칠 것이다. 코드 작성 시에는 직접적인 체감이 덜할 수 있지만, 멀티모달 엔지니어링에 종사하는 사람이라면 테스트해볼 만하다.

또 하나 간과하기 쉬운 변화: 토크나이저가 업데이트되어, 동일한 텍스트 입력이 이제 1.0~1.35배의 토큰 수를 생성한다. 나쁜 소식처럼 들릴 수 있지만(토큰이 많아지면 비용이 증가), 실제로는 모델이 정보를 더 세밀한 단위로 처리한다는 의미이며, 긴 문서와 복잡한 코드 이해가 더 견고해져야 한다.

Anthropic이 의도적으로 사이버 보안 기능을 차단한 이유

이것이 4.7 릴리스에서 가장 반직관적인 결정이다: Opus 4.7은 적극적으로 안전 가드레일을 추가하여, 고위험 사이버 보안 요청을 자동으로 감지하고 차단한다.

잠깐 — Anthropic은 지난주 사이버 보안에 특화된 Claude Mythos Preview를 출시하고, Amazon, Apple, Microsoft와 함께 Project Glasswing 전문 프로그램을 시작했다. 두 가지가 어떻게 동시에 성립할 수 있을까?

정답은 제품 계층화에 있다:

  • Mythos는 보안 전문가를 위해 설계된 통제된 모델로, Cyber Verification Program을 통한 신원 확인 후에만 사용 가능
  • Opus 4.7은 일반 대중을 위한 범용 플래그십으로, Anthropic은 누구나 쉽게 호출할 수 있는 공격 도구가 되는 것을 원하지 않는다

논리는 타당하다. 고위험 기능을 검증 가능한 전문 채널에 집중시키고 API를 통해 모든 사람에게 개방하지 않는 것 — 이것은 실용적인 보안 계층화 접근법이다.

새 기능 개요

이번에 동시에 여러 보조 기능이 출시되었다:

  • Task budgets (공개 베타): 장시간 실행 작업에서 Claude가 자체 토큰 소비 속도를 관리하여 마지막 단계에서 갑자기 예산이 소진되는 것을 방지
  • /ultrareview 명령어: 전용 코드 리뷰 세션으로, 버그와 설계 문제를 지적하며 일반 리뷰보다 더 깊은 분석 제공
  • xhigh 노력 수준: 기존에는 high만 있었으나, 이제 xhigh가 추가되어 추론 깊이와 응답 속도 사이에서 더 세밀한 조정 가능
  • Auto mode 확장: Max Claude Code 사용자가 사용 가능

가격은 변함없다: API 호출은 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러로 Opus 4.6과 완전히 동일하다. 플랫폼 지원: claude.ai, API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry에서 모두 사용 가능하며, 모델 ID는 claude-opus-4-7이다.

경쟁사와의 격차는 얼마나 큰가

Anthropic에 따르면, Opus 4.7은 에이전틱 프로그래밍, 대규모 도구 호출, 에이전틱 컴퓨터 사용, 금융 분석 항목에서 GPT-5.4(3월 출시)와 Gemini 3.1 Pro(2월 출시)를 모두 능가한다.

물론 벤치마크는 벤치마크일 뿐이다. 실제 경험상의 차이는 커뮤니티가 사용하기 시작한 후에 더 많은 증거가 나올 것이다. 그러나 Rakuten-SWE-Bench의 '3배'라는 수치만으로도 프로덕션 코드 수정 시나리오에서는 충분히 설득력이 있다.

Opus 4.6에서 4.7로의 전환은 단순한 스킨 체인지 수준의 소폭 반복 업데이트가 아니다 — 적어도 프로그래밍 작업에 있어서는 이번 향상 폭을 진지하게 받아들일 만하다.

출처: CocoLoop, Introducing Claude Opus 4.7(Anthropic Blog); Anthropic's Claude Opus 4.7 makes a big leap in coding, while deliberately scaling back cyber capabilities(The Decoder); Anthropic releases Claude Opus 4.7, narrowly retaking lead for most powerful generally available LLM(VentureBeat)