평가 플랫폼 Arena는 10월 2일 Claude Sonnet 5.5(Max 등급)와 GPT-6.1 Sol(Max 등급)을 Agent Arena 리더보드에 추가했다. 두 모델은 각각 3위와 5위에 올랐으며, 순개선율은 12.52%와 11.23%였다. 상위 2위는 여전히 Anthropic 자사 모델인 Claude Fable 5.1(14.31%)과 Opus 5.5(13.82%)가 차지했고, 4위는 GPT-6 Astra(12.27%)였다.
Agent Arena의 채점 방식은 익숙한 텍스트 대결형 벤치마크와는 다르다. 실제 사용자가 모델을 에이전트로 사용한 세션을 집계하는 방식으로, 모델이 도구를 호출하고 여러 단계의 작업을 수행한 뒤 최종적으로 사용자가 만족했는지로 평가한다. 리더보드 페이지에 따르면 누적 세션 수는 약 215만 8천 건, 51개 모델을 대상으로 한다. 순개선율은 도구 호출 신뢰성, 작업 완료율, 유도성(steerability)을 종합한 지표로, 9월 30일 Arena는 유도성 채점 알고리즘을 개정해 "수정 후 고쳤는지"만 보던 방식에서 대화의 모든 턴 중 판단 가능한 응답을 모두 평가하는 방식으로 확장했다. 한 번에 정답을 내는 모델이 더 많은 점수를 받게 된 셈이다.
3위와 5위, 그 차이는 오차 범위 안에
순위만 보면 Sonnet 5.5는 GPT-6 Astra와 GPT-6.1 Sol을 모두 앞선다. 그러나 오차 범위를 더하면 그림이 달라진다. Sonnet 5.5의 점수는 12.52%±3.09%, GPT-6.1 Sol은 11.23%±2.76%로 두 구간은 크게 겹치며, 4위 Astra와의 차이도 0.25%포인트에 불과하다. 두 모델 모두 새로 순위에 올라 세션 샘플이 아직 적어, Opus 5.5의 ±2.17%보다 오차 범위가 더 넓다. 현재 데이터만으로는 3위부터 5위 중 어느 모델이 실제로 더 우수한지 단정하기 어렵다.
세부 지표에서는 두 모델이 각자의 강점을 갖고 있다. Sonnet 5.5는 "Bash 명령 실패 후 복구" 항목에서 1위를 차지했으며 점수는 15.05%다. GPT-6.1 Sol은 "도구 환각"(존재하지 않는 도구를 만들어내는 비율) 항목에서 1위에 올랐고, 그 비율은 단 0.49%에 그쳤다. 또한 "사용자가 확인한 작업 완료" 항목에서는 15.47%로 2위를 기록했다.
비용에서 격차가 벌어졌다
두 모델의 API 단가는 동일하다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러다. 하지만 에이전트 작업에서는 작업당 비용이 몇 배씩 차이가 난다. Arena의 비용 페이지에는 다음과 같이 나와 있다:
| 모델 | 순개선율 | 작업당 비용 |
|---|---|---|
| Claude Fable 5.1 | 14.31% | 약 4.91달러 |
| Claude Opus 5.5 | 13.82% | 약 1.56달러 |
| Claude Sonnet 5.5 | 12.52% | 약 2.99달러 |
| GPT-6 Astra | 12.27% | 약 3.10달러 |
| GPT-6.1 Sol | 11.23% | 약 0.58달러 |
| DeepSeek V4.1 Flash | 4.02% | 약 0.11달러 |
단가가 같은데도 작업당 비용이 약 5배 차이 나는 것은 토큰 사용량의 차이 때문이다. Max 등급에서 Sonnet 5.5는 더 길게 쓰고 더 오래 "생각하는" 경향이 있으며, 서드파티 테스트에서도 이전 세대보다 작업당 토큰 소모가 눈에 띄게 늘었다는 결과가 나온 바 있다. 그 결과 자사의 더 큰 모델인 Opus 5.5보다 점수는 낮으면서 비용은 더 많이 쓰는 셈이 됐고, Arena가 표시하는 비용 효율 프런티어(파레토 프런티어)에도 들지 못했다. 이 프런티어는 현재 Fable 5.1, Opus 5.5, GPT-6.1 Sol, DeepSeek V4.1 Flash 네 점으로 그려져 있다.
이번에 그 프런티어를 새로 그린 모델은 GPT-6.1 Sol이다. Arena가 출시 당시 공개한 비교에 따르면, 작업당 중간 비용은 이전 버전 GPT-6 Sol보다 39% 낮으면서 점수는 1.52%포인트 더 높다. GPT-6 Astra와 비교하면 81% 더 저렴하면서 점수 차이는 1.04%포인트 이내다. GPT-6.1 Sol은 출시 후 일주일여 만에 GPT-6 Sol을 대체했고, 이번 리더보드는 OpenAI에 "더 싸졌지만 점수는 떨어지지 않았다"는 제3자 검증을 더해준 셈이다.
이 비용 수치에도 집계 방식의 한계가 있다. Arena가 집계하는 것은 자사 플랫폼에서 사용자가 시작한 세션으로, 작업 유형은 코딩, 자료 조사, 명령 실행에 치우쳐 있어 실제 기업 내부 워크플로우의 분포와는 다를 수 있다. 비용은 Arena가 실제로 API를 호출하며 지불한 금액을 환산한 것으로, 캐시 할인이나 대량 할인을 적용받는 기업의 청구서는 이보다 낮을 수 있다. 이 표를 구매 결정에 활용하려면 먼저 자신의 작업으로 샘플을 뽑아 재검증하는 것이 좋다.
이전 세대와 비교하면
시야를 넓히면 Sonnet 계열은 Agent Arena 순위에서 꾸준히 앞으로 나아가고 있다. 이전 세대인 Sonnet 5는 처음 등재됐을 때 6위였지만, 이번 5.5는 상위 3위 안에 들었다. OpenAI 쪽은 다른 속도로 움직이고 있다. GPT-6 Sol은 9월 25일 처음 등재됐을 때 순개선율 9.71%였는데, 일주일 뒤 6.1 Sol이 그 자리를 넘겨받으며 점수는 1.5%포인트가량 오르고 비용은 약 40% 낮아졌다.
개발자 입장에서는 에이전트 작업을 어떤 모델로 돌릴지가 작업량에 따라 달라진다. 간혹 복잡한 작업을 처리한다면 점수가 높고 단가도 과하지 않은 Opus 5.5 같은 모델이 더 편하다. 대량으로 작업을 돌리며 사용량에 따라 비용을 내야 한다면 GPT-6.1 Sol이나 DeepSeek V4.1 Flash 같은 저비용 모델이 더 적합하다. Sonnet 5.5의 경우, 더 낮은 추론 등급으로 전환했을 때 비용과 점수가 어디쯈에 자리할지는 아직 알 수 없다. Arena가 지금까지 테스트한 것은 Max 등급뿐이다.
참고 출처: Arena Agent Arena 리더보드, Arena 비용 프런티어 페이지, CocoLoop, Arena 공식 계정, Artificial Analysis. 각 모델의 순개선율, 오차 범위, 작업당 비용은 Arena 페이지에 표시된 수치를 기준으로 한다.