Gói suy luận Ultrafast đã kết thúc giai đoạn xem trước theo lời mời. Ngày 8/10, OpenAI chính thức mở gói dịch vụ này cho GPT-6.1 Sol trong Responses API, và lần đầu tiên niêm yết giá trên trang định giá. Khi gọi API, tên model vẫn là gpt-6.1-sol, chỉ cần đặt service_tier thành "ultrafast". Model không đổi, thứ được rút ngắn là khoảng cách giữa các token đầu ra.
Gói này mở cho mọi người dùng API, có giới hạn tốc độ gọi, hỗ trợ xử lý toàn cầu, cũng hỗ trợ lưu trú dữ liệu tại Mỹ và EU. Codex và ChatGPT Work cùng ra mắt, nhưng chỉ dành cho Pro 500, các gói doanh nghiệp trả theo lượng dùng đủ điều kiện và gói giáo dục trả theo điểm; bản doanh nghiệp cần quản trị viên tự bật.
Năm gói tính giá thế nào
Theo trang định giá của OpenAI, dưới 272K token đầu vào được tính là ngữ cảnh ngắn, giá mỗi gói như sau (đô la / triệu token):
| Gói | Đầu vào | Đầu vào đã cache | Ghi cache | Đầu ra |
|---|---|---|---|---|
| Batch / Flex | 1 | 0.05 | 1.25 | 5 |
| Standard | 2 | 0.10 | 2.50 | 10 |
| Fast | 4 | 0.20 | 5 | 20 |
| Ultrafast | 12 | 0.60 | 15 | 60 |
Vượt quá 272K là ngữ cảnh dài, Ultrafast tăng lên 24 đô la đầu vào, 90 đô la đầu ra. Mọi mức giá đều gấp 6 lần gói chuẩn, hai mục liên quan đến cache cũng vậy.
Nhanh hơn bao nhiêu
Tài liệu của OpenAI chỉ đưa ra hệ số tương đối, không nêu tốc độ tuyệt đối. Tài khoản nhà phát triển của OpenAI công bố mức "tối đa khoảng 8 lần"; nhiều báo đưa ra con số chi tiết hơn: trong Codex tối đa khoảng 8 lần, trong API tối đa khoảng 6 lần. VentureBeat đưa tin tốc độ khoảng 300 token/giây, con số này không xuất hiện trong tài liệu chính thức, nên lấy hệ số làm chuẩn.
Ultrafast có hạn mức tốc độ riêng: gói Build 1 triệu token/phút, gói Launch 4 triệu, gói Grow 40 triệu, không dùng chung hạn mức với gói chuẩn và gói Fast.
Trường hợp sử dụng mà OpenAI liệt ra được viết như sau:
"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."
(Được tạo ra cho công việc mà tốc độ và trí tuệ đều quan trọng: xử lý sự cố ngừng hoạt động, các agent điều khiển ứng dụng, và những trải nghiệm trực tiếp mà từng giây đều có giá trị.)
Làm một bài toán
Giả sử một tác vụ agent đọc vào 200.000 token, xuất ra 20.000 token, chưa tính cache. Tính nhanh: gói chuẩn khoảng 0,6 đô la, gói Fast khoảng 1,2 đô la, Ultrafast khoảng 3,6 đô la.
Tính theo tốc độ tối đa 6 lần trong kịch bản API, tác vụ vốn mất 6 phút có thể rút xuống còn khoảng 1 phút, tiết kiệm 5 phút, trả thêm khoảng 3 đô la, tức mỗi phút chờ ít đi tốn thêm 0,6 đô la. Đây là trường hợp lý tưởng nhất; khi tốc độ thực tế không đạt mức tối đa, giá mỗi phút sẽ cao hơn.
Với một kỹ sư đang xử lý sự cố ngừng hoạt động, số tiền này hầu như không đáng kể; các nhóm chạy tác vụ ngoại tuyến theo lô sẽ tiếp tục dùng Batch và Flex, hai gói này giá chỉ bằng một nửa gói chuẩn.
Gói này từng có một giai đoạn xem trước trước đó. Ngày 13/8, Ultrafast ra mắt dưới dạng xem trước hạn chế, chỉ gắn trên GPT-5.6 Sol, khi đó OpenAI cho biết tối đa 750 token/giây, nhanh hơn xử lý chuẩn tối đa 14 lần, năng lực tính toán đến từ chip wafer-scale của Cerebras. Đến khi GPT-6.1 Sol mở chính thức, hệ số chính thức đổi thành tối đa 6 đến 8 lần, phần cứng nền tảng lần này không được nêu trong thông báo.
Lượng sử dụng của Ultrafast và tỷ lệ người dùng trả phí, OpenAI chưa công bố. Liệu nó có mở rộng sang các model khác như Astra hay không, tài liệu cũng chưa đề cập.
Nguồn tham khảo: nhật ký cập nhật dành cho nhà phát triển của OpenAI, CocoLoop, trang định giá API của OpenAI (giá từng gói cho ngữ cảnh ngắn và dài), VentureBeat, Runtime Wire; Runtime Wire kiểm chứng hạn mức tốc độ và phạm vi mở.