Ngày 21 tháng 8, OpenAI đã hạ giá gọi API của GPT-5.6 Sol: giá đầu vào giảm từ 5 USD xuống 4 USD trên một triệu token, giá đầu ra từ 30 USD xuống 20 USD, giá đầu vào lấy từ bộ nhớ đệm (cached input) từ 0,5 USD xuống 0,4 USD. Mức giá mới áp dụng trong ba tháng, kết thúc vào ngày 21 tháng 11.
Phạm vi áp dụng được nêu rõ. Các lệnh gọi API tính theo giá mới, phần credit tiêu hao trong ChatGPT Work và Codex cũng được giảm theo. Phí thuê bao hằng tháng của ba gói Pro, Plus, Business không thay đổi. Lý do OpenAI đưa ra là năng lực mô hình đang được cải thiện song song với hiệu suất, nên một phần chi phí tiết kiệm được sẽ nhường lại cho người dùng.
Tính theo mức sử dụng thực tế
Cách nói chính thức là "giảm hơn 20%", nhưng mức giảm ở ba mức giá không đồng đều: đầu vào giảm 20%, đầu vào từ cache giảm 20%, còn đầu ra giảm tới một phần ba. Mức đầu ra là nơi bị ép mạnh nhất, và số tiền tiết kiệm thực tế phụ thuộc vào hình dạng của khối lượng công việc.
Thử tính nhanh cho một tác vụ agent lập trình. Loại tác vụ này có đặc điểm đầu vào nặng, đầu ra nhẹ, và thường đọc lại cùng một đoạn ngữ cảnh mã nguồn nên tỷ lệ trúng cache cao. Giả sử một tác vụ tiêu tốn 1 triệu token đầu vào, 100.000 token đầu ra, trong đó 80% đầu vào trúng cache: với giá cũ là 0,2×5 + 0,8×0,5 + 0,1×30 = 4,4 USD, với giá mới là 0,8 + 0,32 + 2 = 3,12 USD, tiết kiệm khoảng 29%.
Chuyển sang các tác vụ như trò chuyện hay sinh văn bản dài — nơi tỷ trọng đầu ra cao — mức tiết kiệm sẽ tăng lên, tiệm cận mức giảm một phần ba của đầu ra. Ngược lại, nếu là hỏi đáp ngắn kiểu tra cứu thuần túy, đầu ra chỉ vài trăm token, thì mức tiết kiệm gần như chỉ bằng đúng 20% của phần đầu vào. Cùng một thông báo nhưng áp vào các sản phẩm khác nhau có thể chênh nhau tới hơn chục điểm phần trăm.
Vị trí tụt xuống dưới Opus 5
Sau đợt giảm giá, vị trí của Sol trên bảng giá đã thay đổi. Claude Fable 5 của Anthropic có giá 10 USD cho đầu vào và 50 USD cho đầu ra trên một triệu token, còn Opus 5 là 5 USD và 25 USD. Mức giá cũ 5/30 của Sol từng nhỉnh hơn Opus 5 một chút, còn mức giá mới 4/20 giờ đã rơi hẳn xuống dưới Opus 5.
Cuộc cạnh tranh ở phân khúc này rất trực diện. Những nhà phát triển sẵn sàng trả tiền cho mô hình flagship thường là nhóm đưa mô hình vào trợ lý lập trình, hệ thống chăm sóc khách hàng hoặc các luồng agent chạy tác vụ dài, hóa đơn tích lũy theo tháng, và động lực chuyển đổi chỉ gắn với chi phí trên mỗi đơn vị. Sự hiện diện của Anthropic trong mảng lập trình, cùng với việc các mô hình Trung Quốc liên tục ép giá ở cùng phân khúc, đều dồn áp lực lên nhóm người dùng trả tiền theo lượng này.
Ngoài đơn giá, còn một khoản dễ bị bỏ qua: giá trị tuyệt đối của đầu vào từ cache. Khi giảm xuống còn 0,4 USD, phần đầu vào trúng cache rẻ hơn mười lần so với phần không trúng cache; trong các tình huống gọi lặp lại với ngữ cảnh dài, tỷ lệ này quyết định con số cuối tháng nhiều hơn là bảng giá niêm yết. Những đội ngũ giữ được hóa đơn thấp phần lớn đang tối ưu tỷ lệ trúng cache, còn giá niêm yết cao hay thấp lại là chuyện thứ yếu.
Vì sao chỉ giảm trong ba tháng
Ba tháng là một khoảng thời gian khá ngắn. Dòng GPT-5.6 ra mắt ba mức vào đầu tháng 7, cuối tháng 7 Luna và Terra đã có một đợt giảm giá — Luna giảm 80%, Terra giảm 20%. Đến lượt mô hình flagship, OpenAI đưa ra mức giá có thời hạn, chứ không sửa đổi bảng giá gốc.
Cái lợi của việc đặt thời hạn là để lại đường lui: sau ngày 21 tháng 11, giá sẽ tự động trở về 5/30, không cần phải ra thông báo "tăng giá" một lần nữa, cũng không phải hạch toán khoản giảm giá này như một cam kết dài hạn. Cái giá phải trả là nhà phát triển cũng thừa hiểu điều đó, nên họ sẽ viết lại bao nhiêu logic gọi API, di chuyển bao nhiêu lưu lượng hiện có chỉ vì một mức giá có đồng hồ đếm ngược — đó vẫn là một dấu hỏi. Những ai thực sự chuyển sang vì mức giá này phần lớn vốn đã là nhóm so sánh giá qua lại giữa hai bên.
"As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months."
Việc giá thuê bao không hề dịch chuyển cũng mang nhiều thông tin. Thuê bao hằng tháng là nguồn thu cố định có thể dự đoán được, còn phía sử dụng theo lượng mới là chiến trường va chạm trực diện với đối thủ. Đợt giảm giá lần này nhắm chính xác vào API và credit của Codex — tức nhóm tài khoản có thể đốt vài nghìn USD mỗi tháng và sẵn sàng đổi base_url bất cứ lúc nào.
Đối với nhà phát triển tại Trung Quốc, tác động thực tế còn tùy thuộc vào việc họ đi qua kênh nào. Gọi trực tiếp API sẽ được tính theo giá mới, còn đi qua các dịch vụ trung chuyển hoặc proxy thì phải chờ các bên này cập nhật theo, và khoảng chênh lệch giá ở giữa thường chính là nguồn lợi nhuận trong vài tháng tới. Đến khi ba tháng trôi qua và giá quay về mức cũ, liệu cùng một lượng lệnh gọi có dịch chuyển theo hay không, câu trả lời chỉ có lúc đó mới rõ.
Nguồn tham khảo: Thông báo chính thức của OpenAI, CocoLoop, thông báo từ cộng đồng nhà phát triển OpenAI, Reuters; đã đối chiếu với trang giá của OpenAI để xác nhận ba mức giá đầu vào, đầu ra, đầu vào từ cache và thời hạn thực hiện ba tháng.