GPT-6.1 Sol ra mắt, giá API bằng một phần năm Astra

OpenAI đã giới thiệu GPT-6.1 Sol tại sự kiện DevDay ngày 29 tháng 9, định vị cho các tác vụ agent lập trình, thao tác máy tính và công việc văn phòng chuyên nghiệp. Giá API tiêu chuẩn là 2 đô la Mỹ cho mỗi triệu token đầu vào, 0,10 đô la Mỹ cho token đầu vào được cache và 10 đô la Mỹ cho token đầu ra, ngang bằng với GPT-6 Sol; so với model chủ lực GPT-6 Astra ở mức 10 đô la Mỹ, 0,20 đô la Mỹ và 50 đô la Mỹ, cả đầu vào lẫn đầu ra của Sol đều chỉ bằng một phần năm.

Nhịp độ ra mắt khá dày đặc. GPT-6 Astra lên sóng 26 ngày trước, còn GPT-6 Sol mới chỉ tồn tại 7 ngày đã bị phiên bản 6.1 thay thế. Theo OpenAI, model mới "gần bằng Astra" về khả năng lập trình và thao tác máy tính.

Điểm benchmark áp sát model chủ lực, một số hạng mục vẫn còn khoảng cách

Trong số liệu OpenAI công bố, GPT-6.1 Sol đạt 75,2% trên DeepSWE v1.1 ở mức suy luận cao, ngang bằng Astra nhưng chi phí chỉ bằng khoảng một phần năm. Trên OSWorld 2.0 ở mức suy luận cao nhất, Sol đạt 71,4%, thấp hơn Astra 2,1 điểm phần trăm, còn chi phí mỗi tác vụ chỉ bằng khoảng một phần bảy. Trên Terminal-Bench Science 0.1, bài kiểm tra quy trình nghiên cứu khoa học dòng lệnh, Sol tốn trung bình 5,47 đô la Mỹ mỗi tác vụ, trong khi Claude Opus 5.5 tốn 23,21 đô la Mỹ và Astra tốn 23,80 đô la Mỹ.

Bài test độc lập của bên thứ ba Artificial Analysis cho kết quả tương tự: chỉ số thông minh cao hơn GPT-6 Sol 4 điểm, thấp hơn GPT-6 Astra 1 điểm; trong bài kiểm tra độ chính xác kiến thức, tỷ lệ ảo giác giảm từ 60% xuống 54%. Cái giá phải trả là model "nói nhiều hơn" — để hoàn thành cùng một tác vụ, nó cần dùng thêm 10% đến 30% token đầu ra. Mức chiết khấu cho token đọc từ cache được nâng từ 90% lên 95%, phần nào bù lại chi phí này.

Không phải hạng mục nào cũng áp sát như vậy. Theo số liệu chính OpenAI công bố, trên bản nội bộ ExploitBench, Sol đạt 21,5% còn Astra đạt 31,5%; trên TroubleshootingBench, bài test về khắc phục sự cố, con số là 47,96% so với 63,46%. Ở những tình huống cần chuỗi xử lý sự cố dài, model chủ lực vẫn có lợi thế rõ rệt.

Ngưỡng sử dụng và vài hạn chế

GPT-6.1 Sol đã có mặt trên ChatGPT Work và Codex cho người dùng Plus, Pro, Business, Enterprise và Edu; người dùng bản miễn phí và gói Go hiện chưa dùng được, giao diện chat thông thường cũng chưa tích hợp. Nhà phát triển gọi model qua tên gpt-6.1-sol, cửa sổ ngữ cảnh khoảng 1,05 triệu token, đầu ra tối đa mỗi lần là 128.000 token.

Có vài chi tiết cần lưu ý:

  • Phần vượt quá 272.000 token trong một lời nhắc sẽ tính giá gấp 2 lần cho đầu vào và gấp 1,5 lần cho đầu ra;
  • Không hỗ trợ hai mức suy luận none và minimal;
  • Khi gọi qua Chat Completions thì không dùng được công cụ (tool), phải chuyển sang Responses API.

Điều thứ hai ảnh hưởng nhiều nhất đến các đội làm tương tác thời gian thực. Cách làm cũ — tắt suy luận để đổi lấy độ trễ thấp — không còn khả thi trên 6.1 Sol.

Nhà phát triển tại Trung Quốc có thể dùng qua đâu

API chính thức của OpenAI không phục vụ Trung Quốc đại lục kể từ tháng 7 năm 2024, điều này không thay đổi. Trong danh sách ra mắt lần này, các kênh bên thứ ba lại sát với thực tế của nhà phát triển tại Trung Quốc hơn: OpenRouter, Vercel AI Gateway cũng lên kệ cùng lúc, các gói Pro+, Max, Business, Enterprise của GitHub Copilot cũng đã có thể chọn.

Với các đội tại Trung Quốc, tham chiếu trực tiếp hơn là dải giá của các model nội địa. GLM-5.3 trước đó công bố giá API là 4,4 đô la Mỹ cho mỗi triệu token đầu ra, chưa bằng một nửa của GPT-6.1 Sol. Lần này Sol đưa năng lực lập trình cấp chủ lực xuống mức giá 10 đô la Mỹ, khoảng cách mà các model nội địa tạo ra nhờ giá trong mảng lập trình đã bị thu hẹp phần nào; liệu các hãng có điều chỉnh giá theo hay không thì còn phải chờ xem.

Một biến số khác nằm ở chính OpenAI. Một ngày trước đó, hãng vừa rút lại kế hoạch phát hành GPT-6.1 Astra dự kiến vào tháng 10, với lý do chưa đạt tiêu chuẩn an toàn, và thời điểm cập nhật tiếp theo cho dòng chủ lực vẫn chưa được ấn định. Trước khi điều đó xảy ra, 6.1 Sol nhiều khả năng sẽ là model mà OpenAI tập trung giới thiệu cho nhà phát triển.

Nguồn tham khảo: Trang phát hành chính thức và tổng kết DevDay của OpenAI, đánh giá độc lập của Artificial Analysis, CocoLoop, tổng hợp đánh giá từ DataCamp và Vellum; đơn giá các gói API, độ dài ngữ cảnh và hệ số tính giá cho lời nhắc dài lấy theo công bố chính thức của OpenAI.