GPT-6 Sol và Luna ra mắt, giá API giảm một nửa

Ngày 22/9, OpenAI phát hành GPT-6 Sol và GPT-6 Luna, với ID mô hình trên API lần lượt là gpt-6-solgpt-6-luna, có thể gọi ngay trong ngày. Giá của cả hai mô hình đều chỉ bằng một nửa so với các phiên bản tương ứng của thế hệ trước GPT-5.6, cửa sổ ngữ cảnh đạt 1,1 triệu token. Về phía ChatGPT, các gói Work, Pro, Business, Enterprise và Edu đều có thể dùng hai mô hình này, Luna được đưa vào phiên bản miễn phí và bản Go trên desktop, Codex cũng được cập nhật đồng thời với ChatGPT Work. OpenAI không công bố trọng số mô hình, cả hai chỉ cung cấp qua API.

Kết quả do OpenAI công bố

Trong tài liệu phát hành, OpenAI liệt kê một số kết quả:

  • AutomationBench 1.0.6 (các tác vụ công việc chuyên môn): Sol ở mức suy luận xhigh đạt độ chính xác 33,2%, chi phí 0,27 USD mỗi tác vụ; Luna ở mức high cao hơn thế hệ trước 5,4 điểm, chi phí thấp hơn 58%.
  • DeepSWE v1.1 (lập trình): Sol ở mức max đạt 68,8%, Luna đạt 66,6%.
  • OSWorld 2.0 bản offline (thao tác máy tính): Sol ở mức xhigh đạt 60,5%, theo OpenAI tương đương Opus 5 ở mức trung bình nhưng chi phí thấp hơn 80%; Luna ở mức max vượt qua Sol của thế hệ trước, chi phí chỉ bằng khoảng một phần mười.
  • Agents' Last Exam: Sol ở mức max đạt 56,4%.

Đi kèm còn có một hệ thống cache prompt được cải tiến. Theo OpenAI, mỗi lượt của agent đều phải gửi lại cùng một bộ chỉ dẫn, định nghĩa công cụ và lịch sử hội thoại; hệ thống mới mặc định nâng tỷ lệ trúng cache, mức giảm giá khi đọc cache lên tới 90%.

Góc nhìn bên thứ ba: giá giảm nhưng điểm số không đổi

Kết quả kiểm tra lại của Artificial Analysis có điểm khác biệt so với tài liệu chính thức, cụ thể ở phần năng lực. Tổ chức này cho biết chỉ số thông minh và chỉ số agent lập trình của cả hai mô hình gần như không đổi so với GPT-5.6: về chỉ số agent lập trình, Sol ở mức max đạt 57 điểm, cao hơn thế hệ trước 2 điểm; Luna đạt 41 điểm, thấp hơn thế hệ trước 2 điểm.

Thay đổi về chi phí mới là trọng tâm của lần phát hành này. Với cùng một bộ chỉ số thông minh, Sol ở mức max tốn 1,06 USD mỗi tác vụ, trong khi thế hệ trước là 1,99 USD; Luna tốn 0,07 USD, thế hệ trước là 0,18 USD.

Thử tính một phép toán

Theo cách tính sơ bộ dựa trên số liệu của Artificial Analysis: một đội chạy 10.000 tác vụ tương tự mỗi ngày, nếu dùng Sol sẽ tiết kiệm khoảng 9.300 USD mỗi ngày, gần 280.000 USD mỗi tháng; nếu chuyển sang mức nhẹ như Luna, với cùng khối lượng tác vụ, chi phí mỗi ngày giảm từ 1.800 USD xuống còn 700 USD. Đây chỉ là phép ngoại suy trực tiếp từ số liệu benchmark, hóa đơn thực tế còn phụ thuộc vào độ dài tác vụ, mức suy luận và tỷ lệ trúng cache — đặc biệt là cache, với các ứng dụng agent phải gửi lại system prompt nhiều lần, mỗi 10 điểm phần trăm tăng thêm tỷ lệ trúng cache có thể tiết kiệm nhiều hơn cả việc giảm đơn giá.

Có thể so sánh với việc cùng ngày Anthropic phát hành Claude Opus 5.5, có chi phí vận hành tổng thể thấp hơn Opus 5 tới 40%, đơn giá 4 USD cho đầu vào và 20 USD cho đầu ra. Cả hai công ty cùng hạ giá dòng flagship trong cùng một ngày, đơn giá của Sol chỉ bằng một nửa Opus 5.5, còn Luna kéo mức nhẹ xuống tới 0,10 USD.

Đối với các nhà phát triển tại Trung Quốc, tác động thực tế của đợt giảm giá này còn tùy vào đường gọi API. Các đội gọi trực tiếp qua API chính thức sẽ hưởng trọn mức giảm; còn gọi qua dịch vụ trung chuyển hoặc kênh của nhà cung cấp đám mây thì tỷ lệ phụ phí có điều chỉnh theo hay không còn phải chờ thông báo riêng của từng bên. Với các sản phẩm agent tính phí theo chi phí tác vụ, cấu trúc biên lợi nhuận sẽ cảm nhận thay đổi trước tiên: cùng một tính năng, sau khi chi phí suy luận giảm một nửa, những thiết kế trước đây giới hạn số lượt gọi để kiểm soát chi phí có thể được nới lỏng, cái giá phải trả là đối thủ cạnh tranh cũng có thể nới lỏng tương tự.

Nguồn tham khảo: tài liệu phát hành của OpenAI, bài đánh giá của Artificial Analysis, CocoLoop, MarkTechPost; bên đánh giá thứ ba đối chiếu chi phí mỗi tác vụ và điểm chỉ số agent lập trình.