오퍼스 5.5, 텍스트 아레나 1위 등극

모델 평가 플랫폼 아레나(Arena)는 베이징 시간 9월 27일 새벽, 클로드 오퍼스 5.5(High)가 텍스트 아레나에 처음 등장하자마자 1위에 올랐으며 점수는 1509점이라고 발표했다. 이는 이전 세대인 오퍼스 5(High)보다 18점 높은 수치로, 오퍼스 5(High)는 현재 11위에 머물러 있다.

텍스트 아레나는 아레나에서 가장 오래된 순위표로, 사용자가 익명 처리된 두 모델의 답변을 동시에 보고 더 나은 쪽에 투표하면 플랫폼이 이를 Elo와 유사한 방식으로 점수화한다. 이 순위표는 글쓰기, 코딩, 수학, 일상적인 질의응답 등 다양한 분야에서 누적 투표 수 850만 표를 넘어섰다.

상위 6위를 모두 차지한 Anthropic

이번 업데이트 이후 텍스트 아레나 상위 6개 자리는 모두 Anthropic 모델이 차지했다. 아레나 공식 순위 페이지 기준으로는 다음과 같다.

순위모델점수투표 수
1Claude Opus 5.5(High)1509 ±122,307
2Claude Opus 4.6(High)1505 ±376,518
3Claude Fable 5(High)1504 ±436,462
4Claude Opus 4.7(High)1502 ±464,007
5Claude Fable 5.1(Max)1501 ±79,942
6Claude Opus 4.61498 ±380,836

7위는 메타의 뮤즈 스파크 1.2(xHigh)로 1496점이었고, 구글에서 가장 순위가 높은 모델은 10위인 제미나이 3.8 플래시(High)로 1492점을 기록했다. 상위 15위 안에는 Anthropic, 메타, 구글 세 회사만 이름을 올렸으며, OpenAI가 9월 22일 공개한 GPT-6 시리즈는 이 구간에 보이지 않는다.

아레나는 또한 오퍼스 5.5를 텍스트 아레나의 가성비 프런티어 선상에도 위치시켰다. 입력·출력 가격을 환산하면 혼합 단가는 토큰 100만 개당 16달러다. Anthropic이 오퍼스 5.5에 책정한 API 가격은 입력 4달러, 출력 20달러로, 각각 오퍼스 5보다 약 5분의 1가량 낮다.

아직은 너무 적은 투표 수

1위와 6위의 점수 차는 11점에 불과한데, 오퍼스 5.5 자체의 신뢰구간이 ±12점이다. 다시 말해 1위부터 6위까지는 통계적으로 아직 우열을 가릴 수 없는 상태다.

원인은 투표 수 부족이다. 오퍼스 5.5는 출시된 지 일주일도 안 돼 투표가 2307표밖에 쌓이지 않았다. 바로 뒤를 잇는 오퍼스 4.6(High)은 7만 6000표가 넘어 신뢰구간이 ±3점까지 좁혀져 있다. 새로 등재된 모델의 구간이 넓고 점수 변동이 큰 것은 아레나에서 흔한 일로, 앞으로 몇 주 사이에 점수가 오를지 내릴지는 알 수 없다.

아레나는 발표문에서 “데뷔와 동시에 1위에 올랐다”고만 언급했을 뿐, 분야별 순위는 공개하지 않았다. 코딩, 수학, 창작 글쓰기 세부 순위표에서 오퍼스 5.5가 몇 위를 차지하는지는 아직 알려지지 않았다.

구형 모델에 밀린 오퍼스 5

이 순위표에서 더 흥미로운 것은 오퍼스 5다. 출시 순서로는 오퍼스 4.6, 4.7보다 더 최신 모델인데도 텍스트 아레나에서는 11위에 그쳐, 오퍼스 4.6(High)에 14점, 같은 세대인 페이블 5(High)에도 13점 뒤처져 있다.

텍스트 아레나가 측정하는 것은 익명 비교에서 사용자가 어느 답변을 더 선호하는지이며, 문제 해결 정확도와는 다른 지표다. 답변의 길이, 어조, 형식도 투표에 영향을 미치기 때문에 추론 능력이 더 뛰어난 모델이라도 답변이 장황하거나 설명서처럼 느껴진다면 선호 투표에서 질 수 있다.

Anthropic은 이번 세대에서 글쓰기 품질에 공을 들였다. 회사 엔지니어들은 이전에 클로드의 글쓰기가 나빠진 이유에 대해, 강화학습 보상 비중이 모델을 마치 AI 독자를 향해 쓰는 것처럼 만들었기 때문이라고 공개적으로 설명한 바 있다. 오퍼스 5.5는 문장의 명료함을 겨냥해 조정한 첫 번째 버전이라고 한다. 오퍼스 5.5가 오퍼스 5보다 18점 높은 것 중 얼마만큼이 이 글쓰기 조정 덕분이고 얼마만큼이 능력 자체의 향상 덕분인지는 아레나의 데이터로는 구분할 수 없으며, Anthropic도 이에 대응하는 평가 결과를 내놓지 않았다.

세대를 이어서 보면 오퍼스 4.6과 4.7은 여전히 상위 4위 안에 머물러 있고, 오퍼스 5는 출시 이후 1위 자리를 넘겨받지 못했으며, 오퍼스 5.5에 이르러서야 새로운 얼굴이 1위에 올랐다. 지금 이 선호도 순위표에서 Anthropic의 주된 경쟁자는 바로 자사의 구형 버전인 셈이다.

참고 출처: 아레나 공식 계정, 아레나 텍스트 순위표, CocoLoop, Anthropic 모델 가격 페이지. 점수, 신뢰구간, 투표 수는 작성 시점 아레나 페이지 기준이다.