OpenAI 14배 빠른 API 등급, 확대 예고

OpenAI가 Ultrafast 추론 모드를 더 많은 개발자에게 열 준비를 하고 있다. 9월 26일 외신은 Responses API의 플레이그라운드 화면 안에 아직 활성화되지 않은 속도 선택 옵션이 숨어 있는 것을 발견했다. Standard, Fast, Ultrafast 세 단계로 나뉜다. 공개 시점은 9월 29일 DevDay 전후가 될 가능성이 있지만, OpenAI는 아직 공식 발표를 내지 않았고 구체적인 범위는 공식 입장에 따라 달라진다.

Ultrafast는 현재 초대받은 일부 고객에게만 제공된다. 세 등급 옵션이 정식으로 출시되면 속도는 제한된 테스트 특권에서 개발자가 작업에 맞춰 고르는 일반적인 과금 옵션으로 바뀐다.

8월 프리뷰에서 공개된 수치

Ultrafast는 8월 13일 GPT-5.6 Sol 모델에만 적용되는 제한적 프리뷰로 처음 등장했다. OpenAI에 따르면 초당 최대 750토큰을 출력하며, Standard보다 최대 14배 빠르다. 기반 연산은 Cerebras의 웨이퍼 스케일 칩에서 이뤄진다.

Cerebras는 이 등급이 증류되거나 양자화된 축소판이 아니라고 강조했다. 모델 구조, 가중치, 정밀도, 컨텍스트 설정, 추론 설정 모두 표준 엔드포인트의 GPT-5.6 Sol과 동일하다는 것이다. 속도 차이는 하드웨어에서 나온다. 웨이퍼 스케일 칩 한 개당 44GB의 온칩 SRAM을 탑재해 가중치를 칩에 상주시키면서, 메모리와 연산 유닛 사이에서 데이터를 주고받는 시간을 줄였다.

프리뷰 기간의 제약도 분명히 밝혔다. API에서만 제공되고 ChatGPT와 Codex에서는 사용할 수 없으며, 확장 속도는 연산 자원 상황에 달려 있다.

Cerebras는 자체적으로 두 가지 비교 결과를 공개했다. 지식 노동을 측정하는 GDP-Val 테스트에서 Ultrafast는 엔드투엔드로 5.6배 빨라졌으며 품질 저하는 없었다고 한다. Humanity's Last Exam의 2500개 문제를 모두 푸는 데 Ultrafast 버전은 11시간 11분, Claude Fable 5는 78시간 27분이 걸렸다. 두 수치 모두 Cerebras 블로그에서 나온 것으로, 테스트 조건은 자체적으로 설정했으며 아직 제3자의 재현은 없었다.

"It now finishes for me before I even have the opportunity to context-switch."

OpenAI 연구원 Jeffrey Wang의 말로, 다른 작업으로 전환할 틈도 없이 결과가 나온다는 뜻이다.

Cerebras와의 세 번째 걸음

OpenAI와 Cerebras의 협력을 이어서 보면 Ultrafast는 세 번째 이정표다.

올해 1월 OpenAI는 Cerebras와 연산 자원 계약을 맺고 2028년까지 최대 750메가와트 용량을 단계적으로 배치하기로 합의했다. 2월의 GPT-5.3-Codex-Spark가 그 첫 결과물로, 속도를 위해 별도로 경량화한 코딩 모델을 Cerebras의 WSE-3에서 구동해 초당 1000토큰 이상을 냈으며 ChatGPT Pro 안의 Codex에만 제공됐다. 4월에는 OpenAI가 약 200억 달러 규모의 구매 계약을 추가했다는 소식도 전해졌다.

Codex-Spark의 방식은 속도만을 위해 별도의 소형 모델을 만드는 것이었다. 반면 Ultrafast는 플래그십 모델을 그대로 빠른 하드웨어에서 구동하는 방식이다. 전자는 성능의 일부를 내주고, 후자는 성능을 내주지 않는 대신 비용을 연산 자원 쪽으로 넘긴다. Cerebras의 생산 능력이 더 넓은 개방을 뒷받침할 수 있는지가 이번 확대 범위를 결정한다.

세 등급은 어떻게 나뉘나

세 등급이 나란히 놓이면서 개발자는 작업에 맞춰 지연 시간을 고를 수 있게 된다. 코딩 어시스턴트나 실시간 고객 상담처럼 화면 앞에서 결과를 기다리는 상황에서는 속도가 경험을 직접 좌우한다. 반대로 야간에 돌리는 배치 처리나 평가 작업에서는 다소 느리더라도 저렴한 쪽이 더 합리적이다. 같은 모델을 응답 속도로 등급을 나누는 방식은 클라우드 업체들이 인스턴스 사양별로 과금하는 방식과 비슷하다.

아직 답이 없는 것도 두 가지 있다. 하나는 가격으로, Ultrafast는 프리뷰 이후 단가를 공개한 적이 없고 Fast 등급과의 가격 차이도 알려지지 않았다. 다른 하나는 적용 범위로, GPT-6 Sol과 GPT-6 Astra가 잇따라 출시됐지만 GPT-6 계열 모델이 출시 시점에 모두 Ultrafast를 지원하는지는 확인되지 않았다.

DevDay 당일 실제로 공개된다면 개발자들이 가장 먼저 확인할 곳은 요금 페이지가 될 것이다.

참고 출처: OpenAI 개발자 커뮤니티의 Ultrafast 프리뷰 공지, Cerebras 공식 블로그, CocoLoop, TestingCatalog. 초당 750토큰, 14배 고속화, GDP-Val 5.6배 고속화 수치는 모두 OpenAI와 Cerebras가 자체적으로 밝힌 것이다.