Sonnet 5.5が3位、GPT-6.1 Solは5位に

評価プラットフォームのArenaは10月2日、Claude Sonnet 5.5(Maxティア)とGPT-6.1 Sol(Maxティア)をAgent Arenaのランキングに追加した。両モデルはそれぞれ3位と5位にランクインし、ネット改善率は12.52%と11.23%だった。上位2位は依然としてAnthropic自社のモデルが占めており、Claude Fable 5.1が14.31%、Opus 5.5が13.82%。4位はGPT-6 Astra(12.27%)だった。

Agent Arenaの採点方式は、おなじみのテキスト対戦型ベンチマークとは異なる。実際のユーザーがモデルをエージェントとして使った会話を集計するもので、モデルはツールを呼び出し、複数ステップのタスクを実行し、最終的にユーザーが満足したかどうかで判定される。ランキングページによると、累計セッション数は約215.8万件、51モデルを対象としている。ネット改善率はツール呼び出しの信頼性、タスク完了率、誘導性(steerability)を総合したもので、9月30日にArenaは誘導性の採点アルゴリズムを改訂し、「修正された後に直せたか」だけを見る方式から、会話の各ターンで判定可能な応答すべてを評価する方式に拡張した。一度で正解を出せるモデルほど加点されるようになったわけだ。

3位と5位、その差は誤差の範囲内

順位だけ見ればSonnet 5.5はGPT-6 AstraとGPT-6.1 Solの両方を上回っている。しかし誤差範囲を含めると様相は変わる。Sonnet 5.5のスコアは12.52%±3.09%、GPT-6.1 Solは11.23%±2.76%で、両者の区間は大きく重なり合い、4位のAstraとの差もわずか0.25ポイントしかない。新たにランクインした両モデルはまだセッションのサンプル数が少なく、Opus 5.5の±2.17%より誤差帯が広い。現在のデータだけでは、3位から5位のどのモデルが本当に優れているかを断定するのは難しい。

細かい指標では両モデルにそれぞれ強みがある。Sonnet 5.5は「Bashコマンド失敗後の復旧」で1位を獲得し、スコアは15.05%。GPT-6.1 Solは「ツールの幻覚」(存在しないツールを作り出す割合)で1位となり、その割合はわずか0.49%。さらに「ユーザーによるタスク完了確認」でも15.47%で2位に入った。

料金で差がついた

両モデルのAPI単価は同じで、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルだ。しかしエージェントタスクでは、1タスクあたりのコストに数倍の差が生まれる。Arenaのコストページによると:

モデルネット改善率1タスクあたりコスト
Claude Fable 5.114.31%約4.91ドル
Claude Opus 5.513.82%約1.56ドル
Claude Sonnet 5.512.52%約2.99ドル
GPT-6 Astra12.27%約3.10ドル
GPT-6.1 Sol11.23%約0.58ドル
DeepSeek V4.1 Flash4.02%約0.11ドル

単価が同じでも1タスクあたりのコストが約5倍違うのは、トークン消費量の差によるものだ。Maxティアでは、Sonnet 5.5はより長く書き、より長く「考える」傾向があり、サードパーティの検証でも前世代よりタスクごとのトークン消費が明らかに増えていることが確認されている。結果として、自社のより大きなモデルであるOpus 5.5よりスコアが低く、コストは高いという状況になり、Arenaが定義するコスト効率のフロンティア(パレートフロンティア)には入れなかった。このフロンティアは現在、Fable 5.1、Opus 5.5、GPT-6.1 Sol、DeepSeek V4.1 Flashの4点で構成されている。

今回そのフロンティアを書き換えたのはGPT-6.1 Solだ。Arenaが発表時に示した比較によると、1タスクあたりの中央コストは前バージョンのGPT-6 Solより39%低いにもかかわらず、スコアは1.52ポイント高い。GPT-6 Astraと比べても81%安く、スコアの差も1.04ポイント以内にとどまる。GPT-6.1 Solは発売からわずか1週間余りでGPT-6 Solを置き換えており、このランキングはOpenAIにとって「安くてもスコアは落ちない」ことを裏付ける第三者の注釈となった。

このコストの数字にも集計上の限界がある。Arenaが集計しているのは自社プラットフォーム上でユーザーが開始したセッションであり、タスクの種類はコーディング、調査、コマンド実行が中心で、企業内の実際のワークフローの分布とは必ずしも一致しない。コストはArenaが実際にAPIを呼び出した際の支出から換算されたものであり、キャッシュ割引やボリューム割引を使う企業の請求額はこれより低くなる可能性がある。この表を調達の判断材料にする場合は、まず自分たちのタスクでサンプルを取って再検証したほうがいい。

前世代との比較

時間軸を広げると、Sonnetシリーズのランキングは着実に前進している。前世代のSonnet 5は初登場時に6位だったが、今回の5.5はトップ3に入った。OpenAI側は別のペースで進んでいる。GPT-6 Solは9月25日の初登場時にネット改善率9.71%だったが、1週間後に6.1 Solが引き継ぎ、スコアは1.5ポイントほど上がり、コストは約4割下がった。

開発者にとって、どのモデルでエージェントタスクを動かすかはタスク量次第だ。たまに複雑なタスクを実行するだけなら、スコアが高く単価もそこまで高くないOpus 5.5のようなモデルが扱いやすい。大量のタスクを従量課金で実行するなら、GPT-6.1 SolやDeepSeek V4.1 Flashのような低コストのモデルが向いている。Sonnet 5.5については、より低い推論ティアに切り替えた場合にコストとスコアがどこに落ち着くのかはまだ分かっていない。Arenaが今のところ検証しているのはMaxティアのみだ。

参考資料:Arena Agent Arenaランキング、Arenaコストフロンティアページ、CocoLoop、Arena公式アカウント、Artificial Analysis。各モデルのネット改善率、誤差範囲、1タスクあたりコストはArenaのページに表示された数値に基づく。