OpenAI、Ultrafast正式提供 価格は標準の6倍

Ultrafast推論ティアが招待制プレビューを終えた。OpenAIは10月8日、Responses API内のGPT-6.1 Sol向けにこのサービスティアを正式に開放し、価格ページに初めて価格を明記した。呼び出し時のモデル名は従来どおりgpt-6.1-solのままで、service_tierを"ultrafast"に設定するだけでよい。モデル自体は変わっておらず、短縮されたのは出力トークン同士の間隔だ。

このティアは全APIユーザーに開放され、レート制限の対象となる。グローバル処理に対応し、米国とEUでのデータレジデンシーもサポートする。CodexとChatGPT Workでも同時に提供が始まったが、対象はPro 500、条件を満たす従量課金の企業プラン、ポイント制の教育プランに限られる。企業版では管理者が手動で有効にする必要がある。

5段階の料金はこうなる

OpenAIの価格ページによると、入力27.2万トークン以内は短コンテキストとされ、各ティアの価格は次のとおり(100万トークンあたりの米ドル)。

ティア入力キャッシュ入力キャッシュ書き込み出力
Batch / Flex10.051.255
Standard20.102.5010
Fast40.20520
Ultrafast120.601560

27.2万トークンを超える長コンテキストでは、Ultrafastは入力24ドル、出力90ドルまで上がる。いずれの単価もStandardティアの6倍で、キャッシュ関連の2項目も同様だ。

実際にどれだけ速いのか

OpenAIの文書には相対的な倍率しか記載がなく、絶対的な速度は書かれていない。OpenAIの開発者向けアカウントは「最大約8倍」としているが、複数のメディアが引用したより詳細な内訳では、Codexでは最大約8倍、APIでは最大約6倍とされる。VentureBeatは毎秒約300トークンという速度を報じているが、この数値は公式文書には出てこないため、倍率表記を基準とすべきだ。

Ultrafastには専用のレート制限がある。Buildティアは毎分100万トークン、Launchティアは400万トークン、Growティアは4000万トークンで、StandardやFastティアの枠は消費しない。

OpenAIが挙げる想定用途は次のとおりだ。

"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."

(速度と知能の両方が重要な作業のために設計されている。障害のデバッグ、アプリを操作するエージェント、一秒を争うライブ体験などだ。)

コストを計算してみる

キャッシュを考慮せず、あるエージェントタスクが20万トークンを読み込み、2万トークンを出力すると仮定する。概算では、Standardが約0.6ドル、Fastが約1.2ドル、Ultrafastが約3.6ドルになる。

APIでの最大6倍という速度を前提にすると、元は6分かかっていたタスクが約1分に短縮でき、5分の節約に対して追加コストは約3ドル、つまり待ち時間を1分減らすごとに約0.6ドルを多く払う計算になる。これは最も理想的なケースで、実際の高速化が上限に届かない場合、1分あたりの価格はさらに高くなる。

障害対応に当たるエンジニアにとって、この程度の金額はほとんど気にならない。オフラインでバッチ処理を回すチームは、Standardの半額であるBatchとFlexを使い続けるだろう。

このティアには以前プレビュー期間があった。8月13日、Ultrafastは限定プレビューとして登場したが、当時対応していたのはGPT-5.6 Solのみで、OpenAIは毎秒最大750トークン、標準処理より最大14倍速いとし、Cerebrasのウェーハスケールチップがこれを支えていると説明していた。GPT-6.1 Solで正式提供に至った今回、公式の倍率は最大6倍から8倍に変わり、今回の発表では基盤となるハードウェアについて言及はなかった。

Ultrafastの呼び出し量や有料ユーザーの利用割合について、OpenAIはまだ公表していない。Astraなど他のモデルに拡張されるかどうかも、文書には記載がない。

参考資料:OpenAI開発者向け更新ログ、CocoLoop、OpenAI API価格ページ(各ティアの短コンテキストと長コンテキストの単価)、VentureBeat、Runtime Wire。レート制限と提供範囲はRuntime Wireが確認した。