Claude Sonnet 5.5登場、3割高速化も価格は維持

Anthropicは9月28日、Claude Sonnet 5.5を発表した。Opus 5.5に続く、Claude 5.5ファミリー第2弾のモデルとなる。同社が示した2つの核心的な数字は、Sonnet 5より30%以上高速であること、そして大半の作業で1タスクあたりのコストが最大30%下がることだ。API価格に変更はなく、入力100万トークンあたり2ドル、出力100万トークンあたり10ドル、キャッシュ読み込みは0.2ドルのままとなる。

モデルは同日、Anthropic自社プラットフォームに加え、AWS、Google Cloud、Microsoft Azureでも利用可能になった。APIでのモデル名はclaude-sonnet-5-5。ゼロデータ保持オプションも各プラットフォームで従来どおり提供される。独立開発者のSimon Willison氏は、claude.aiの無料プランがすでにSonnet 5.5に切り替わっていることを指摘した。

公式が示した成績

Anthropicが発表ページで挙げた主な結果は次の通り。

ベンチマークSonnet 5.5
Terminal-Bench 4.070.6%
OSWorld 2.1(一部)80.1%
Humanity's Last Exam(ツール利用)64.5%
CursorBench 4.055.5%
FrontierCode 1.1(Max)46.2%
GDPval-AA v2.11844

初期の導入企業からのフィードバックは速度に集中している。Boxは新モデルが前バージョンより2.4倍速いと述べ、Slackはプロンプトを変えずに、より良く、より速い結果が得られたとしている。

"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."

——Every社 Tyler Nishida氏

第三者機関が見せたもう一つの顔

Artificial AnalysisはSonnet 5.5の智能指数を56点とし、2位に位置づけた。Opus 5.5の58点にわずか2点差だ。同社独自のTerminal-Bench 4.0テストでは、Sonnet 5.5が64%を記録し、Opus 5.5とGPT-6 Astraはいずれも60%だった。弱点は事実系の設問で、事実正答率は54%とOpus 5.5の66%を下回り、科学的推論のテストでもOpus 5.5より6点低かった。

コストの項目では公式の説明と食い違いが出た。Artificial Analysisが最高推論ティア(max)でテスト一式を実行したところ、Sonnet 5.5は1タスクあたり平均で約19.3万個の出力トークンを消費し、Opus 5.5とSonnet 5のmaxティアよりおよそ6割多く、GPT-6 Astraの7倍に達した。単価は変わらずトークン数が増えた結果、1タスクあたりのコストは約7.6ドルとなり、Sonnet 5より約50%高くなった。

両者の見方には前提の違いがある。Anthropicが言う「大半の作業」とは、デフォルトティアでの日常的なコーディングや文章作成のことだ。一方でArtificial Analysisが計測したのは、思考予算を全開にした極端なケースだ。Willison氏も同様の現象に遭遇している。maxティアでモデルに小さなWebGLアプリを作らせたところ、12.8万トークンを消費し1.28ドルかかった。xhighティアに切り替えると、41秒で完了し、コストは約0.06ドルにとどまった。同氏はまた、Sonnet 5.5にはOpus 5.5と同じ弱点があり、maxティアではトークン上限をすぐに使い切りやすいと指摘している。

同格モデルと比べる

横並びで見ると、Sonnetラインの位置づけは明確になっている。Opusの8〜9割の性能を、より低い価格で提供するというものだ。Sonnet 5は発売時、エージェント型タスクのコストがOpusの約3分の1で済むことを打ち出していた。5.5世代では速度が上がり、ベンチマークのスコアもOpus 5.5にさらに近づいた。Artificial Analysisのランキングでは両者の差はわずか2点だ。

無料プランの変化はより多くの人に影響する。Willison氏の見立てでは、claude.aiの無料ユーザーは現在、ChatGPTの無料プランが使うLunaシリーズよりかなり強力なモデルを利用できるようになった。OpenAIのGPT-6 Lunaは低価格路線を取っており、Arenaの最新データでは1タスクあたりのコストは約0.05ドルにとどまる。AnthropicはまだHaiku 5.5を発表していないが、Willison氏は数週間以内の登場を見込んでおり、その時点で低価格帯がLunaと直接競合することになる。

開発者にとって最も直接的な対応は、maxティアをすぐに使わないことだ。現時点で公開されているデータによれば、デフォルトまたはxhighティアの方が、公式が主張する「高速化・低コスト化」に近い結果になる。maxティアの請求額は、前世代より高くなる可能性さえある。自分のタスクにとって割に合うかどうかについて、Anthropicはティアごとのコスト内訳を示していないため、実際に試してみるしかない。

参考資料:Anthropic公式発表ページ、Simon Willison氏のブログ、CocoLoop、Artificial Analysisベンチマークレポート。API価格はAnthropic発表ページに基づく。1タスクあたりのコストとトークン使用量はArtificial Analysis智能指数のmaxティアの数値に基づく。