GPT-6.1 Sol登場、価格はAstraの5分の1

OpenAIは9月29日のDevDayでGPT-6.1 Solを発表した。位置付けはコーディングエージェント、コンピュータ操作、専門的なオフィス業務向けだ。API標準価格は入力100万トークンあたり2ドル、キャッシュ入力0.10ドル、出力10ドルで、GPT-6 Solと同水準。フラッグシップのGPT-6 Astra(10ドル、0.20ドル、50ドル)と比べると、入力・出力とも5分の1に抑えられている。

リリースのペースは非常に速い。GPT-6 Astraの登場から26日、GPT-6 Solの登場からはわずか7日で6.1版に置き換わった格好だ。OpenAIによれば、新モデルはコーディングとコンピュータ操作の性能で「Astraに近づいた」という。

フラッグシップに肉薄、一部で差も

OpenAIが公表した成績では、GPT-6.1 SolはDeepSWE v1.1で高推論レベル時に75.2%を記録し、Astraと同水準ながらコストは約5分の1。OSWorld 2.0では最高推論レベルで71.4%となり、Astraを2.1ポイント下回ったが、1タスクあたりのコストは約7分の1。コマンドライン型の研究ワークフローを検証するTerminal-Bench Science 0.1では、1タスク平均5.47ドルで、Claude Opus 5.5の23.21ドル、Astraの23.80ドルを大きく下回った。

サードパーティのArtificial Analysisによる独立検証も近い結論を示した。知能指数はGPT-6 Solより4ポイント高く、GPT-6 Astraより1ポイント低い。知識精度を測るテストではハルシネーション率が60%から54%に低下した。代償として出力が冗長になり、同じタスクをこなすのに出力トークンが10~30%多く必要になる。キャッシュ読み込みの割引率が90%から95%に引き上げられたことで、このコスト増の一部は相殺される。

すべての項目でこれほど接近しているわけではない。OpenAI自身が示したデータでは、内部ベンチマークのExploitBenchでSolが21.5%、Astraが31.5%。トラブルシューティング系のTroubleshootingBenchでは47.96%対63.46%となった。長い連鎖的なデバッグが求められる場面では、フラッグシップにまだ明確な優位性がある。

利用条件といくつかの制限

GPT-6.1 Solは現在、ChatGPT WorkとCodexでPlus、Pro、Business、Enterprise、Eduの各ユーザーに提供されている。無料版とGoユーザーはまだ利用できず、通常のチャット画面にも実装されていない。開発者はgpt-6.1-solとして呼び出せ、コンテキストウィンドウは約105万トークン、1回あたりの最大出力は12万8000トークンだ。

留意すべき点がいくつかある。

  • 1回のプロンプトが27万2000トークンを超えた部分は、入力が2倍、出力が1.5倍の料金になる
  • noneとminimalの推論強度レベルには対応していない
  • Chat Completions経由ではツール呼び出しができず、Responses APIへの切り替えが必要

2点目はリアルタイム対話を扱うチームに最も影響する。従来のように推論をオフにして低遅延化する手法は、6.1 Solでは使えなくなった。

中国の開発者はどこから利用できるか

OpenAIの公式APIは2024年7月から中国本土向けに提供されておらず、この状況に変わりはない。今回の初期提供先に含まれるサードパーティ経由のサービスは、中国の開発者の実情により近い。OpenRouterとVercel AI Gatewayが同時に対応し、GitHub CopilotのPro+、Max、Business、Enterpriseの各プランでも利用可能になった。

中国のチームにとってより直接的な比較対象は、国産モデルの価格帯だ。GLM-5.3が公表しているAPI価格は出力100万トークンあたり4.4ドルで、GPT-6.1 Solの半分以下にとどまる。Solがフラッグシップ級のコーディング性能を10ドル帯まで引き下げたことで、コーディング領域で国産モデルが築いていた価格差はやや縮まった格好だ。各社が追随して値下げに動くかどうかは今後の焦点となる。

もう一つの変数はOpenAI自身にある。同社は前日、10月発売を予定していたGPT-6.1 Astraを取り下げたばかりで、理由は安全性基準を満たしていないためとしている。フラッグシップ系列の次の更新時期は未定だ。それまでの間、6.1 SolはOpenAIが開発者に最も強く推す型番になりそうだ。

参考資料:OpenAI公式発表ページおよびDevDayの振り返り、Artificial Analysisの独立検証、CocoLoop、DataCampとVellumによる評価まとめ。API各層の単価、コンテキスト長、長文プロンプトの課金倍率はOpenAIの公表値に基づく。