Grok 4.7、価格据え置きでトークン消費倍増

SpaceXAIは9月21日、Grok 4.7を発表した。同社は「コーディングと知識労働において自社史上最も高性能なモデル」と位置付けている。API価格と処理速度はGrok 4.6と同水準で、入力100万トークンあたり2ドル、出力100万トークンあたり6ドル。価格と出力速度がそれぞれ2倍になる高速版プランも用意される。モデルはすでにCursor、Grok Build、API管理コンソール、サードパーティ製プラットフォームで利用可能になっている。

"our most capable model for coding and knowledge work."

SpaceXAIはGrok 4.7をコーディングと知識労働向けと位置付けている。

公式によると、新モデルは4.6より大きなベースモデルを採用し、強化学習の学習期間を延ばした。重点的に鍛えたのは数時間続く長時間タスクで、自己検証と長いコンテキストの処理に強くなったほか、Grok Botともネイティブに連携した。

公式ベンチマークとサードパーティ評価

SpaceXAIが自ら公表した数値は、DeepSWE v1.1が71.0%、CursorBench 4.0が46.3%、Terminal-Bench 4.0が37.6%、電気工学分野のEEBenchが64.0%。安全性については、拒否応答とジェイルブレイク耐性が業界トップクラスだとし、HackerBench v0.3におけるリスク警告の通過率は3.3%。レッドチーム機能は招待制で、一部のサイバーセキュリティパートナーにのみ公開されている。

サードパーティ評価機関のArtificial Analysisによる結果は、総合インテリジェンス指数が46点で4.6より2点高く、Grok Buildと組み合わせたコーディングエージェント指数は56点で4.6より9点高い。個別項目ではDeepSWE v1.1が65%から73%、Terminal-Bench 4.0が18%から33%、SWE-Atlas-QnAが58%から63%に上昇した。この評価によると、Grok 4.7とGrok Buildの組み合わせはコーディングエージェント部門で4位となり、上位はClaude Fable 5.1、GPT-6 Astra、Claude Opus 5が占める。長時間の知識労働を測るAA-BriefcaseではEloレーティング1657を獲得し、4.6より111高い。

SpaceXAIの公式発表ページは競合との直接比較を示しておらず、サードパーティ評価での順位についてもSpaceXAIから回答はない。

利用コストを計算する

価格表は動いていないが、Artificial Analysisが記録したトークン消費量は変わった。Grok 4.7(xhighモード)は1タスクあたり平均約8万1000トークンを出力し、同モードの4.6は約3万8000トークンで、125%の増加となる。出力速度は毎秒約188トークンで、1タスクの実行時間は平均7.1分。

出力分だけで大まかに計算すると、1タスクのコストは4.6で約0.23ドル、4.7で約0.49ドル。価格表は据え置きのまま、タスクあたりの実質コストは2倍以上に膨らんでおり、スコア向上のかなりの部分は「長く考える」ことと引き換えに得られている。

今週の価格改定と並べると、この計算はさらに際立つ。Grok 4.7発表の翌日、AnthropicのClaude Opus 5.5とOpenAIのGPT-6 Solが相次いで公開された。Opus 5.5は入力100万トークンあたり4ドル、出力20ドル。GPT-6 Solは2ドルと10ドルに値下げされた。100万トークンあたりの価格表で見ると、Grok 4.7の出力単価は依然として3社の中で最も低い。ただしタスクあたりの実質コストで見た場合にその差がどこまで縮まるかは、他の2モデルのトークン消費量次第で、この部分のサードパーティデータはまだ揃っていない。

Grok 4.7の46点というスコアが出てから2日も経たないうちに、Opus 5.5とGPT-6の新2世代がArtificial Analysisの評価キューに入った。ランキング表の上位は、まだ動きそうだ。

参考資料:SpaceXAI公式発表ページ、CocoLoop、Artificial Analysis評価レポート。API価格と公式ベンチマークはSpaceXAIの発表ページで確認、インテリジェンス指数・コーディングエージェント指数・トークン消費量はArtificial Analysisの基準に基づく。1タスクあたりの出力コストは価格表に基づく概算。