GPT-6 SolとLuna発表、API価格半額に

OpenAIは9月22日、GPT-6 SolとGPT-6 Lunaを発表した。API上のモデルIDはそれぞれgpt-6-solgpt-6-lunaで、同日から利用可能になった。両モデルの価格は前世代GPT-5.6の対応モデルの半額で、コンテキストウィンドウは110万トークン。ChatGPT側ではWork、Pro、Business、Enterprise、Eduの各プランで両モデルを利用でき、Lunaはデスクトップの無料版とGo版にも展開される。CodexもChatGPT Workと同時に対応する。OpenAIは重みを公開しておらず、両モデルともAPI経由のみの提供となる。

公式発表の性能

OpenAIは発表資料でいくつかのベンチマーク結果を挙げている。

  • AutomationBench 1.0.6(職業タスク):Solはxhigh思考モードで正答率33.2%、タスクあたりのコストは0.27ドル。Lunaはhighモードで前世代より5.4ポイント高く、コストは58%低い。
  • DeepSWE v1.1(コーディング):Solはmaxモードで68.8%、Lunaは66.6%。
  • OSWorld 2.0オフライン版(PC操作):Solはxhighモードで60.5%、公式によるとOpus 5の中位モードと同等でコストは80%低い。Lunaはmaxモードで前世代のSolを上回り、コストは約10分の1。
  • Agents' Last Exam:Solはmaxモードで56.4%。

あわせて改良版のプロンプトキャッシュシステムも導入された。OpenAIによると、エージェントは毎ターン同じ指示・ツール定義・履歴を送り直しており、新システムはデフォルトでキャッシュヒット率を高め、キャッシュ読み込みのコストを最大90%削減する。

第三者の見立て:価格は下がったがスコアは横ばい

Artificial Analysisによる独自検証は、性能面で公式資料と食い違う。同社によると両モデルのインテリジェンス指数とコーディングエージェント指数はGPT-5.6とほぼ同水準だという。コーディングエージェント指数では、Solはmaxモードで57点と前世代より2点高く、Lunaは41点と前世代より2点低い。

今回の発表の主眼はむしろコスト面にある。同じインテリジェンス指数のベンチマークで、Solはmaxモードでタスクあたり1.06ドル(前世代は1.99ドル)、Lunaは0.07ドル(前世代は0.18ドル)。

コストを試算する

Artificial Analysisの数値を単純に外挿すると、同種のタスクを1日1万回実行するチームの場合、Solの利用で1日あたり約9300ドル、月換算で約28万ドル近く節約できる計算になる。Lunaのような軽量モデルに切り替えれば、同じタスク量のコストは1日1800ドルから700ドルまで下がる。これはベンチマークのコスト水準をそのまま外挿した数字であり、実際の請求額はタスクの長さ、思考モード、キャッシュヒット率によって変わる。とりわけキャッシュヒット率は、同じシステムプロンプトを繰り返し送るエージェントアプリケーションにとって、10ポイント上がるごとの節約額が単価引き下げ以上に大きくなりうる。

同日にはAnthropicもClaude Opus 5.5を発表しており、全体の運用コストはOpus 5より40%低く、価格は入力100万トークンあたり4ドル、出力20ドル。両社は同じ日にフラッグシップモデルの価格を引き下げた形で、Solの単価はOpus 5.5の半額、Lunaは軽量モデルの価格帯を0.10ドルまで押し下げた。

中国国内の開発者にとって、今回の値下げの実際の影響は利用経路によって異なる。公式APIを直接利用するチームは値下げをそのまま享受できるが、中継サービスやクラウドベンダー経由で利用している場合、上乗せ比率が追従するかどうかは各社の発表待ちとなる。タスクあたりのコストで課金するエージェント系プロダクトは利益構造への影響を先に受けるだろう。同じ機能で推論コストが半減すれば、これまで呼び出し回数を制限してコストを抑えていた設計にも余裕が生まれるが、競合も同様に余裕を得ることになる。

参考資料:OpenAI発表資料、Artificial Analysisの検証記事、CocoLoop、MarkTechPost。第三者検証はタスクあたりコストとコーディングエージェント指数のスコアを確認したもの。