OpenAI cho Codex-Spark chạy trên Cerebras, nhanh hơn 15 lần

Nếu gần đây bạn đang sử dụng Codex trong ChatGPT Pro, có thể bạn đã để ý thấy một tùy chọn mới có tên Codex-Spark với tốc độ phản hồi nhanh đến bất thường.

Đây không phải kết quả của việc tinh chỉnh tham số, mà là do phần cứng bên dưới đã thay đổi.

Chạy trên chip gì

GPT-5.3-Codex-Spark chạy trên Cerebras WSE-3 (Wafer Scale Engine 3), không phải GPU Nvidia.

Đây là lần đầu tiên OpenAI triển khai một mô hình sản xuất chính thức trên phần cứng suy luận không phải của Nvidia.

WSE-3 là một tấm silicon có kích thước bằng một cái đĩa ăn, tích hợp hơn 4 nghìn tỷ bóng bán dẫn, với bộ nhớ trên chip khổng lồ, được thiết kế để loại bỏ nút thắt cổ chai về độ trễ do di chuyển dữ liệu.

Hiệu quả thực tế: hơn 1000 token/giây.

GPT-5.3-Codex thông thường chạy khoảng 65 token/giây. Codex-Spark nhanh hơn khoảng 15 lần.

Quy mô hợp đồng giữa OpenAI và Cerebras

OpenAI đã ký hợp đồng nhiều năm với Cerebras vào tháng 1 năm nay. Cam kết: triển khai theo giai đoạn 750 megawatt sức mạnh tính toán Cerebras trước năm 2028, với tổng giá trị hợp đồng vượt quá 10 tỷ đô la Mỹ.

Tuy nhiên, Sam Altman cũng không phủ nhận Nvidia, ông tuyên bố "Nvidia đã tạo ra những con chip tốt nhất thế giới" và hợp tác dài hạn vẫn không thay đổi. Chiến lược hiện tại của OpenAI là đa nhà cung cấp song song: Nvidia là chủ lực cho huấn luyện, Cerebras phụ trách suy luận độ trễ thấp, AMD đã ký thỏa thuận 6GW, và chip tùy chỉnh Broadcom cũng đang được phát triển.

Về phía Cerebras, Sachin Katti cho biết: "Việc đưa tính toán wafer-scale vào môi trường sản xuất mang đến cho chúng tôi một cách mới để giữ cho Codex phản hồi nhanh trong các tác vụ nhạy cảm với độ trễ."

Codex-Spark có thể dùng để làm gì

OpenAI định vị nó là "công cụ năng suất hàng ngày cho nhà phát triển", không dành cho suy luận phức tạp sâu, mà cho các công việc cần lặp lại nhanh và phản hồi tức thì:

  • Chỉnh sửa mã nhanh và tái cấu trúc cục bộ
  • Gỡ lỗi thời gian thực và xác định vị trí lỗi
  • Viết PRD, tài liệu nghiên cứu người dùng, chỉ số giám sát
  • Quản lý kiểm thử và theo dõi tiến độ tác vụ

Giá trị cốt lõi là không phải chờ đợi. Sửa một hàm, hỏi một câu, kiểm tra một đoạn logic — phản hồi gần như tức thì.

Nó hỗ trợ phương thức làm việc "can thiệp giữa chừng" — bạn có thể ngắt quá trình thực thi của AI bất cứ lúc nào, điều chỉnh hướng đi, thay vì đợi nó chạy xong một đoạn dài mới xem kết quả.

Dữ liệu benchmark

Chỉ số GPT-5.2-Codex GPT-5.3-Codex-Spark
Terminal-Bench 2.0 64% 77,3%
Tốc độ suy luận ~65 token/s 1000+ token/s
Tốc độ đầu ra tương đối Cơ sở Nhanh hơn khoảng 25%
Tiêu thụ token một số tác vụ Cơ sở Ít hơn khoảng 50%

Điểm số được cải thiện, trong khi tốc độ còn nhanh hơn 15 lần — hai điều này hiếm khi xảy ra cùng lúc.

Ý nghĩa lớn hơn của sự việc này

Hiện tại Codex-Spark chỉ khả dụng cho người dùng trả phí của ChatGPT, quyền truy cập API vẫn đang trên đường và chưa có định giá riêng.

OpenAI tiết lộ Codex hiện có hơn 1 triệu người dùng hoạt động hàng tuần. Ở quy mô này, độ trễ suy luận trực tiếp quyết định trải nghiệm sản phẩm, không chỉ là một con số trên bảng thông số kỹ thuật.

Tín hiệu quan trọng hơn nằm ở chỗ: khi Cerebras chuyển từ "về mặt lý thuyết có thể thay thế Nvidia" thành "phần cứng đầu tiên không phải của Nvidia được OpenAI đưa vào môi trường sản xuất", sự thay đổi này mang một trọng lượng cụ thể trong ngành công nghiệp chip.

Còn về việc Nvidia có bị ảnh hưởng hay không — trong mảng huấn luyện, ngắn hạn không ai có thể lay chuyển được. Nhưng thị trường suy luận, vết nứt này đã được mở ra, và người mở ra là OpenAI.

Nguồn tham khảo: OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware); Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog); CocoLoop; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)