OpenAIはUltrafast推論モードをより多くの開発者に開放する準備を進めている。9月26日、海外メディアがResponses APIのPlayground画面の中に、まだ有効化されていない速度選択オプションを発見した。Standard、Fast、Ultrafastの3段階だ。解禁のタイミングは9月29日のDevDay前後になる可能性があるが、OpenAIはまだ正式な発表をしておらず、対象範囲は公式情報を待つ必要がある。
Ultrafastは現在、招待された一部の顧客にしか提供されていない。3段階の選択肢が正式に導入されれば、速度は限定的な先行体験から、開発者がタスクに応じて選べる通常の課金オプションへと変わる。
8月のプレビューで示された数字
Ultrafastは8月13日、GPT-5.6 Solのみを対象とした限定プレビューとして登場した。OpenAIによると、最大で毎秒750トークンを出力でき、Standardと比べて最大14倍速い。基盤となる計算資源はCerebrasのウエハースケールチップだ。
Cerebrasは、この枠が蒸留版や量子化された軽量モデルではないと強調している。モデル構造、重み、精度、コンテキスト設定、推論設定はいずれも標準エンドポイントのGPT-5.6 Solと同一だという。速度差はハードウェアに由来する。ウエハースケールチップ1枚あたり44GBのオンチップSRAMを搭載し、重みをチップ上に常駐させることで、メモリと演算ユニットの間でデータをやり取りする時間を省いている。
プレビュー期間の制限も明確にされている。APIでのみ提供され、ChatGPTやCodexでは使えず、拡大のペースは計算資源の状況次第だ。
Cerebrasは独自に2つの比較結果を公開している。知識労働を測るGDP-Valのテストでは、Ultrafastはエンドツーエンドで5.6倍高速化し、品質の低下は見られなかったという。Humanity's Last Examの2500問をすべて解いたところ、Ultrafast版は11時間11分、Claude Fable 5は78時間27分かかった。いずれの数値もCerebrasのブログが公表したもので、テスト条件は同社自身が設定しており、第三者による再現は今のところない。
"It now finishes for me before I even have the opportunity to context-switch."
OpenAIの研究者Jeffrey Wang氏の発言で、別の作業に切り替える間もなく結果が出てしまう、という意味だ。
Cerebrasとの3つ目の一手
OpenAIとCerebrasの協業を通して見ると、Ultrafastは3つ目の節目にあたる。
今年1月、OpenAIはCerebrasと計算資源に関する契約を結び、2028年までに最大750メガワットの容量を段階的に導入することで合意した。2月のGPT-5.3-Codex-Sparkがその第一弾で、専用に軽量化されたコーディングモデルをCerebrasのWSE-3上で動かし、毎秒1000トークン超を実現、ChatGPT Pro内のCodexのみに提供された。4月には、OpenAIが約200億ドル分の調達契約を追加したとも伝えられた。
Codex-Sparkは速度のために専用の小型モデルを作るという手法だった。一方Ultrafastは、フラッグシップモデルをそのまま高速なハードウェア上で動かす方式だ。前者は能力の一部を犠牲にし、後者は能力を犠牲にしない代わりに、コストを計算資源側に転嫁している。Cerebrasの生産能力がより広い開放を支えられるかどうかが、今回の解禁範囲の広さを左右する。
3段階の使い分け
3段階が並ぶことで、開発者はタスクに応じて遅延を選べるようになる。コーディング支援やリアルタイムのカスタマーサポートのように、画面の前で結果を待つ場面では速度が体験を直接左右する。一方、夜間に流すバッチ処理や評価タスクでは、多少遅くても安い方が合理的だ。同じモデルを応答速度で段階分けする発想は、クラウド事業者がインスタンスのスペックごとに課金するやり方に近い。
まだ答えの出ていないことも2つある。1つは価格で、Ultrafastはプレビュー開始以来、単価を公表しておらず、Fast枠との価格差も不明だ。もう1つは対象範囲で、GPT-6 SolやGPT-6 Astraが相次いで登場しているが、GPT-6系の各モデルがリリース時点でUltrafastに対応するかどうかは確認できていない。
DevDay当日に本当に解禁されるなら、開発者がまず見るのは料金ページになるだろう。
参考資料:OpenAI Developer CommunityのUltrafastプレビュー告知、Cerebras公式ブログ、CocoLoop、TestingCatalog。毎秒750トークン、14倍高速化、GDP-Valでの5.6倍高速化はいずれもOpenAIとCerebras自身の発表による数値。