OpenAI đang chuẩn bị mở chế độ suy luận Ultrafast cho nhiều nhà phát triển hơn. Ngày 26 tháng 9, truyền thông nước ngoài phát hiện trong giao diện Playground của Responses API có một tùy chọn tốc độ chưa được kích hoạt, chia thành ba bậc: Standard, Fast và Ultrafast. Thời điểm mở có thể rơi vào khoảng sự kiện DevDay ngày 29 tháng 9, nhưng OpenAI chưa đưa ra thông báo chính thức nào, phạm vi cụ thể vẫn phải chờ hãng xác nhận.
Hiện tại Ultrafast chỉ dành cho một số ít khách hàng được mời riêng. Nếu tùy chọn ba bậc chính thức ra mắt, tốc độ sẽ chuyển từ một đặc quyền thử nghiệm nội bộ thành một lựa chọn tính phí mà nhà phát triển bình thường có thể chọn theo từng tác vụ.
Những con số được công bố trong bản xem trước tháng 8
Ultrafast ra mắt dưới dạng xem trước giới hạn vào ngày 13 tháng 8, chỉ gắn với một mô hình duy nhất là GPT-5.6 Sol. Theo OpenAI, chế độ này có thể xuất tối đa 750 token mỗi giây, nhanh hơn tới 14 lần so với xử lý ở chế độ Standard, nhờ hạ tầng tính toán của Cerebras với chip cấp độ tấm bán dẫn (wafer-scale).
Cerebras đặc biệt nhấn mạnh rằng đây không phải là phiên bản chưng cất hay lượng tử hóa thu gọn: kiến trúc mô hình, trọng số, độ chính xác, cấu hình ngữ cảnh và thiết lập suy luận đều giống hệt với GPT-5.6 Sol chạy trên endpoint tiêu chuẩn. Khoảng cách tốc độ đến từ phần cứng — mỗi chip wafer-scale có 44GB SRAM ngay trên chip, trọng số được lưu thường trực trên chip, giúp loại bỏ thời gian di chuyển dữ liệu qua lại giữa bộ nhớ và đơn vị tính toán.
Giới hạn của giai đoạn xem trước cũng được nêu rõ: chỉ cung cấp qua API, ChatGPT và Codex chưa dùng được, và tốc độ mở rộng phụ thuộc vào năng lực tính toán sẵn có.
Cerebras đã công bố hai bộ số liệu so sánh. Trong bài kiểm tra GDP-Val đo lường công việc tri thức, Ultrafast tăng tốc toàn trình 5,6 lần mà chất lượng không giảm; khi chạy hết 2.500 câu hỏi của Humanity's Last Exam, phiên bản Ultrafast mất 11 giờ 11 phút, trong khi Claude Fable 5 mất 78 giờ 27 phút. Cả hai bộ số liệu này đều lấy từ blog của Cerebras, điều kiện thử nghiệm do chính hãng thiết lập, hiện chưa có bên thứ ba tái hiện lại kết quả.
"It now finishes for me before I even have the opportunity to context-switch."
Đây là lời của nhà nghiên cứu Jeffrey Wang của OpenAI, ý nói kết quả đã ra xong trước khi ông kịp chuyển sang làm việc khác.
Bước thứ ba cùng Cerebras
Nhìn lại toàn bộ quan hệ hợp tác giữa OpenAI và Cerebras, Ultrafast là cột mốc thứ ba.
Tháng 1 năm nay, OpenAI ký thỏa thuận tính toán với Cerebras, cam kết triển khai dần công suất 750 megawatt cho đến năm 2028. GPT-5.3-Codex-Spark ra mắt tháng 2 là lần triển khai đầu tiên — đây là một mô hình lập trình được thu gọn riêng, chạy trên chip Cerebras WSE-3, đạt trên 1.000 token mỗi giây, nhưng chỉ dành cho Codex trong ChatGPT Pro. Đến tháng 4, có thêm tin OpenAI bổ sung cam kết mua sắm khoảng 20 tỷ USD.
Cách làm của Codex-Spark là tạo riêng một mô hình nhỏ để đạt tốc độ; Ultrafast thì khác, để mô hình chủ lực chạy nguyên bản trên phần cứng nhanh. Cách trước đánh đổi một phần năng lực, cách sau không đánh đổi năng lực mà chuyển chi phí sang phía tính toán. Năng lực sản xuất của Cerebras có gánh nổi việc mở rộng quy mô lớn hơn hay không sẽ quyết định lần mở này rộng đến đâu.
Ba bậc được chia như thế nào
Khi ba bậc được xếp cạnh nhau, nhà phát triển có thể chọn độ trễ theo từng tác vụ. Với các trợ lý lập trình, dịch vụ khách hàng thời gian thực — những tình huống có người ngồi chờ kết quả trên màn hình — tốc độ ảnh hưởng trực tiếp đến trải nghiệm; còn các tác vụ xử lý hàng loạt hay đánh giá chạy ban đêm thì chậm hơn một chút để đổi lấy chi phí rẻ hơn lại hợp lý hơn. Việc chia bậc cùng một mô hình theo tốc độ phản hồi khá giống cách các nhà cung cấp đám mây tính phí theo cấu hình instance.
Vẫn còn hai điều chưa có câu trả lời. Một là giá cả: từ khi xem trước đến nay, Ultrafast chưa từng công bố đơn giá, chênh lệch giá với bậc Fast cũng chưa rõ. Hai là phạm vi bao phủ: GPT-6 Sol, GPT-6 Astra đã lần lượt ra mắt, nhưng hiện chưa thể xác nhận mỗi mẫu GPT-6 khi phát hành đều hỗ trợ Ultrafast.
Nếu thực sự ra mắt vào đúng ngày DevDay, trang giá sẽ là nơi đầu tiên các nhà phát triển tìm đến xem.
Nguồn tham khảo: thông báo xem trước Ultrafast trên cộng đồng nhà phát triển OpenAI, blog chính thức của Cerebras, CocoLoop, TestingCatalog; các số liệu 750 token/giây, tăng tốc 14 lần và tăng tốc 5,6 lần trong GDP-Val đều là số liệu tự công bố từ OpenAI và Cerebras.