OpenAI đã nâng tốc độ xuất mặc định của GPT-6 Astra và GPT-6.1 Sol trong các sản phẩm trả phí lên một mức mới. Thibault Sottiaux, người đứng đầu Codex, thông báo trên mạng xã hội ngày 5 tháng 10 rằng tốc độ mặc định của cả hai mô hình tăng tổng thể khoảng 50%, từ khoảng 30 token mỗi giây lên khoảng 50 token, áp dụng cho toàn bộ sản phẩm của OpenAI cũng như mọi ứng dụng đối tác kết nối qua "Sign in with ChatGPT".
Người dùng không cần thay đổi bất kỳ cài đặt nào. Theo Sottiaux, bản cập nhật sẽ được triển khai dần tới tất cả người dùng trong vòng hai giờ.
Bản "cải tiến" nộp bài ngày hôm sau
Thời điểm tăng tốc lần này không bất ngờ. Ngày 4 tháng 10, Sottiaux đặt ra cho nhóm Codex một thời hạn công khai 28 ngày: mỗi ngày phải công bố một thay đổi mà phần lớn người dùng Codex và ChatGPT Work cảm nhận được rõ ràng, nếu không sẽ phải đặt lại toàn bộ hạn mức sử dụng cho mọi người.
Việc tăng tốc độ vừa khớp với tiêu chí "phần lớn người dùng cảm nhận được". Nó không kén tình huống sử dụng: viết code, tra cứu thông tin, chạy tác vụ agent đều được hưởng lợi, và cũng không yêu cầu người dùng học thêm tính năng mới. Trong một lời cam kết phải "nộp bài" mỗi ngày, kiểu thay đổi này dễ được công nhận nhất.
Phạm vi áp dụng cũng rộng hơn so với việc chỉ thay đổi ChatGPT. Các đối tác được Sottiaux nêu tên gồm công cụ lập trình mã nguồn mở OpenCode, Pi, Amp, và Devin của Cognition. Những sản phẩm này cho phép người dùng đăng nhập trực tiếp bằng gói trả phí ChatGPT, sử dụng hạn mức của gói đăng ký thay vì tính phí theo API, nên tốc độ tăng ở phía đăng ký sẽ được truyền nguyên vẹn sang các ứng dụng này.
Từ 30 lên 50, tính ra không chỉ một nửa
Tiêu đề chính thức nói "khoảng 50%", nhưng nếu tính theo hai con số được đưa ra, từ 30 token mỗi giây lên 50 token, mức tăng thực tế khoảng 67%. Sottiaux không giải thích sự khác biệt giữa hai cách nói này. Một khả năng là con số 50% chỉ trải nghiệm tổng thể từ đầu đến cuối, bao gồm cả thời gian chờ token đầu tiên, còn nếu chỉ tính riêng giai đoạn sinh văn bản thì mức tăng là khoảng hai phần ba.
Quy đổi sang thời gian mà người dùng cảm nhận được, có thể ước tính thô như sau:
| Độ dài đầu ra | 30 token/giây | 50 token/giây |
|---|---|---|
| Một đoạn code 2.000 token | khoảng 67 giây | khoảng 40 giây |
| Một tác vụ agent xuất 20.000 token | khoảng 11 phút | khoảng 6,7 phút |
Đây chỉ là thời gian mô hình sinh văn bản. Trong một tác vụ agent còn có thời gian gọi công cụ, chạy kiểm thử, chờ mạng — những phần này không ngắn lại vì tốc độ sinh tăng, nên tỷ lệ thời gian tiết kiệm được trên thực tế khi hoàn thành một tác vụ sẽ thấp hơn số liệu trong bảng.
Bộ tách token và mức tiêu thụ token
Sottiaux cũng cho biết cả hai mô hình đã dùng bộ tách token (tokenizer) được tối ưu, giúp giảm số token cần để hoàn thành cùng một tác vụ. OpenAI không đưa ra số liệu cụ thể về mức giảm này.
Điểm này có thể ảnh hưởng đến người dùng trả phí trực tiếp hơn cả tốc độ. Hạn mức của Codex và ChatGPT Work được tính theo lượng token tiêu thụ, nếu cùng một tác vụ dùng ít token hơn thì cùng một hạn mức sẽ làm được nhiều việc hơn. Ngược lại, việc tăng tốc đơn thuần không làm thay đổi hạn mức: sinh chữ nhanh hơn chỉ khiến người dùng chạm giới hạn của khung 5 giờ sớm hơn. Một số báo đưa tin đã chỉ ra điểm này.
Khi GPT-6.1 Sol ra mắt tại DevDay ngày 29 tháng 9, các bên thử nghiệm độc lập phát hiện mô hình này dùng nhiều hơn 10% đến 30% token đầu ra so với thế hệ trước để hoàn thành cùng một tác vụ. Bộ tách token mới bù được bao nhiêu phần trong số đó còn phải chờ các bài kiểm thử độc lập chạy lại mới biết.
Phía API chưa có thay đổi
Sự phân vai giữa hai mô hình rất rõ ràng. GPT-6 Astra là mô hình chủ lực, giá API tiêu chuẩn là 10 USD cho mỗi triệu token đầu vào và 50 USD cho đầu ra; GPT-6.1 Sol tập trung vào agent lập trình và vận hành máy tính, giá đầu vào 2 USD, đầu ra 10 USD, cả hai đều chỉ bằng một phần năm so với Astra. Lần tăng tốc ở phía đăng ký này áp dụng cho cả hai mô hình cùng lúc.
Điều chỉnh lần này chỉ liên quan đến tốc độ mặc định trong các sản phẩm trả phí theo gói đăng ký. Người dùng API trả tiền theo token, còn tốc độ có thay đổi tương ứng hay không thì phát biểu của Sottiaux không đề cập, và tài liệu API của OpenAI cũng chưa cập nhật nội dung liên quan.
Nguồn tham khảo: phát biểu công khai của Thibault Sottiaux trên mạng xã hội, CocoLoop, RuntimeWire, Crypto Briefing; tốc độ xuất được tính theo số token mỗi giây do hãng công bố, mức tăng và thời gian là suy ra theo cách tính đó.