Ultrafast 추론 티어가 초청제 프리뷰를 마쳤다. OpenAI는 10월 8일 Responses API 내 GPT-6.1 Sol에 이 서비스 티어를 정식으로 열었고, 가격 페이지에 처음으로 가격을 명시했다. 호출 시 모델명은 여전히 gpt-6.1-sol이며, service_tier를 "ultrafast"로 설정하면 된다. 모델 자체는 바뀌지 않았고, 짧아진 것은 출력 토큰 간의 간격이다.
이 티어는 모든 API 사용자에게 열려 있으며 속도 제한의 대상이 된다. 글로벌 처리를 지원하고, 미국과 EU의 데이터 레지던시도 지원한다. Codex와 ChatGPT Work도 동시에 도입했지만, 대상은 Pro 500, 조건을 충족하는 사용량 기반 기업 플랜, 포인트제 교육 플랜으로 한정된다. 기업용은 관리자가 수동으로 켜야 한다.
다섯 단계 요금은 이렇다
OpenAI 가격 페이지에 따르면 입력 27만 2000토큰 이내는 짧은 컨텍스트로 분류되며, 각 티어의 가격은 다음과 같다(100만 토큰당 미국 달러).
| 티어 | 입력 | 캐시 입력 | 캐시 기록 | 출력 |
|---|---|---|---|---|
| Batch / Flex | 1 | 0.05 | 1.25 | 5 |
| Standard | 2 | 0.10 | 2.50 | 10 |
| Fast | 4 | 0.20 | 5 | 20 |
| Ultrafast | 12 | 0.60 | 15 | 60 |
27만 2000토큰을 넘는 긴 컨텍스트에서는 Ultrafast가 입력 24달러, 출력 90달러까지 오른다. 모든 단가가 표준 티어의 6배이며, 캐시 관련 두 항목도 마찬가지다.
실제로 얼마나 빠른가
OpenAI 문서는 상대적인 배수만 제시할 뿐 절대적인 속도는 밝히지 않는다. OpenAI 개발자 계정은 "최대 약 8배"라고 설명하지만, 여러 매체가 인용한 더 세분화된 수치는 Codex에서 최대 약 8배, API에서 최대 약 6배라고 전한다. VentureBeat는 초당 약 300토큰이라는 속도를 보도했지만, 이 수치는 공식 문서에는 나오지 않으므로 배수 기준을 따라야 한다.
Ultrafast는 별도의 속도 제한을 둔다. Build 티어는 분당 100만 토큰, Launch 티어는 400만 토큰, Grow 티어는 4000만 토큰이며, Standard나 Fast 티어의 할당량을 소비하지 않는다.
OpenAI가 제시하는 활용 사례는 다음과 같다.
"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."
(속도와 지능이 모두 중요한 작업을 위해 만들어졌다. 장애 디버깅, 앱을 조작하는 에이전트, 1초가 아쉬운 실시간 경험 등이다.)
비용을 계산해보면
캐싱을 고려하지 않고, 한 에이전트 작업이 20만 토큰을 읽고 2만 토큰을 출력한다고 가정해보자. 대략적으로 계산하면 Standard는 약 0.6달러, Fast는 약 1.2달러, Ultrafast는 약 3.6달러다.
API 환경의 최대 6배 속도를 기준으로 하면, 원래 6분 걸리던 작업이 약 1분으로 줄어 5분을 아끼고 약 3달러를 더 쓰는 셈이며, 이는 기다리는 시간 1분을 줄일 때마다 약 0.6달러를 더 내는 꼴이다. 이는 가장 이상적인 경우이며, 실제 속도 향상이 상한에 못 미치면 분당 가격은 더 올라간다.
장애를 처리하는 엔지니어에게는 이 정도 비용은 거의 신경 쓸 필요가 없다. 오프라인 배치 작업을 돌리는 팀은 표준의 절반 가격인 Batch와 Flex를 계속 사용할 것이다.
이 티어는 이전에도 프리뷰 단계를 거쳤다. 8월 13일 Ultrafast는 제한된 프리뷰로 처음 등장했는데, 당시에는 GPT-5.6 Sol에만 적용됐고 OpenAI는 초당 최대 750토큰, 표준 처리보다 최대 14배 빠르다고 설명했으며 이는 Cerebras의 웨이퍼 스케일 칩이 뒷받침했다. GPT-6.1 Sol에서 정식 출시된 지금은 공식 배수가 최대 6배에서 8배로 바뀌었고, 이번 발표에서는 기반 하드웨어에 대한 언급이 없었다.
Ultrafast의 호출량과 유료 사용자 비중은 OpenAI가 아직 공개하지 않았다. Astra 등 다른 모델로 확장될지도 문서에는 나와 있지 않다.
참고 출처: OpenAI 개발자 업데이트 로그, CocoLoop, OpenAI API 가격 페이지(각 티어의 짧은 컨텍스트와 긴 컨텍스트 단가), VentureBeat, Runtime Wire. 속도 제한과 제공 범위는 Runtime Wire가 확인했다.