OpenAI, Codex-Spark를 Cerebras에서 실행…15배 빨라져

최근 ChatGPT Pro에서 Codex를 사용하고 있다면 Codex-Spark라는 새로운 옵션을 발견했을 수도 있다. 응답 속도가 거의 비현실적일 정도로 빠르다.

이는 파라미터 튜닝의 결과가 아니다. 기본 하드웨어가 변경된 것이다.

어떤 칩에서 실행되나

GPT-5.3-Codex-Spark는 Nvidia GPU가 아닌 Cerebras WSE-3(Wafer Scale Engine 3)에서 실행된다.

OpenAI가 Nvidia 이외의 추론 하드웨어에 정식 프로덕션 등급 모델을 배포한 것은 이번이 처음이다.

WSE-3는 저녁 접시 크기의 실리콘 웨이퍼로, 4조 개 이상의 트랜지스터를 집적하고 있으며 칩 내부 메모리가 방대해 데이터 이동으로 인한 지연 병목 현상을 제거하도록 설계되었다.

실제 효과: 초당 1,000개 이상의 토큰.

일반 GPT-5.3-Codex는 약 65토큰/초로 실행된다. Codex-Spark는 약 15배 더 빠르다.

OpenAI와 Cerebras의 계약 규모

OpenAI는 올해 1월 Cerebras와 다년 계약을 체결했다. 약속: 2028년까지 750메가와트의 Cerebras 컴퓨팅 파워를 단계적으로 가동하며, 총 계약 가치는 1,000억 달러를 넘는다.

하지만 Sam Altman은 Nvidia를 부정하지도 않았다. 그는 "Nvidia는 세계 최고의 칩을 만든다"고 말하며 장기적인 파트너십은 변함없다고 밝혔다. OpenAI의 현재 전략은 멀티 벤더다. Nvidia는 트레이닝 주력, Cerebras는 저지연 추론, AMD와는 6GW 계약, Broadcom 맞춤형 칩도 개발 중이다.

Cerebras 측에서는 Sachin Katti가 이렇게 말했다. "웨이퍼 스케일 컴퓨팅을 프로덕션 환경에 도입함으로써 지연에 민감한 작업에서 Codex의 응답성을 유지할 수 있는 새로운 방법을 얻었습니다."

Codex-Spark의 용도

OpenAI는 이를 "개발자를 위한 일상적인 생산성 도구"로定位하고 있다. 깊고 복잡한 추론을 위한 것이 아니라 빠른 반복과 즉각적인 피드백이 필요한 작업을 위한 것이다.

  • 빠른 코드 편집 및 로컬 리팩토링
  • 실시간 디버깅 및 오류 위치 파악
  • PRD, 사용자 조사 문서, 모니터링 지표 작성
  • 테스트 관리 및 작업 진행 상황 추적

핵심 가치는 기다리지 않는 것이다. 함수 수정, 질문, 로직 테스트 — 거의 즉각적인 응답이다.

"중간 개입"이 가능한 워크플로를 지원한다. AI의 실행을 언제든지 중단하고 방향을 조정할 수 있으며, 긴 블록이 끝날 때까지 기다렸다가 결과를 볼 필요가 없다.

벤치마크 데이터

지표 GPT-5.2-Codex GPT-5.3-Codex-Spark
Terminal-Bench 2.0 64% 77.3%
추론 속도 ~65토큰/초 1000+토큰/초
상대적 출력 속도 기준 약 25% 더 빠름
일부 작업 토큰 소비 기준 약 50% 감소

벤치마크 점수가 향상되고 속도도 15배 빨라졌다. 이 두 가지가 동시에 일어나는 경우는 드물다.

이번 움직임의 더 큰 의미

현재 Codex-Spark는 ChatGPT 유료 사용자에게만 공개되었으며, API 액세스는 아직 준비 중이고 별도의 가격은 발표되지 않았다.

OpenAI는 Codex의 주간 활성 사용자가 100만 명을 넘었다고 밝혔다. 이 규모에서 추론 지연은 제품 경험을 직접적으로 결정하며, 단순한 사양표의 숫자가 아니다.

더 중요한 신호는 Cerebras가 "이론적으로 Nvidia를 대체할 수 있다"에서 "OpenAI가 처음으로 프로덕션에 투입한 Nvidia 이외의 하드웨어"가 되었다는 점이다. 이 변화는 칩 업계에서 구체적인 무게를 지닌다.

Nvidia가 영향을 받을지에 대해 — 트레이닝 분야에서는 단기간에 누구도 흔들 수 없다. 하지만 추론 시장에서는 이 균열이 이미 열렸다. 그리고 그 균열을 연 것은 OpenAI다.

참고 출처: OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware); Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog); CocoLoop; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)