OpenAI thông báo tính năng Auto-review của Codex được mở miễn phí cho tất cả người dùng đăng nhập bằng tài khoản ChatGPT, quá trình duyệt lại không còn trừ vào hạn mức gói. Thông tin được Thibault Sottiaux, người đứng đầu Codex, công bố trên mạng xã hội:
"This Auto-review feature is now free and does not draw usage from your plan."
(Auto-review giờ miễn phí, không còn chiếm dụng hạn mức trong gói của bạn.)
Đường dẫn để bật nằm ở Codex, mục "Settings > Permissions > Auto-review"; phiên bản dòng lệnh có thể đổi chính sách phê duyệt trong file cấu hình. Đây là động thái tiếp theo mà nhóm đưa ra sau khi Sottiaux, vào ngày 4/10, đặt ra lời hứa "mỗi ngày một cải tiến trong 28 ngày, nếu không sẽ reset toàn bộ hạn mức".
Nó kiểm soát điều gì
Theo mặc định, Codex giữ agent hoạt động trong sandbox. Khi nó muốn vượt ra ngoài ranh giới đó — như thoát sandbox để chạy lệnh, gửi yêu cầu mạng bị chặn, sửa file ngoài thư mục được cấp quyền, hay gọi ứng dụng hoặc công cụ MCP chưa được phê duyệt — nó sẽ dừng lại và chờ người dùng bấm đồng ý.
Với các tác vụ dài, loại thông báo này xuất hiện rất nhiều. Theo OpenAI, việc phê duyệt từng mục dễ khiến người dùng rơi vào trạng thái mệt mỏi vì phải quyết định, và dần dần nút đồng ý sẽ mất đi vai trò kiểm soát của nó.
Cách làm của Auto-review là thêm một agent duyệt lại độc lập. Mỗi khi agent chính đưa ra yêu cầu vượt ranh giới, yêu cầu đó được chuyển cho agent này đánh giá trước: nếu bình thường thì cho qua, tác vụ tiếp tục; nếu rủi ro cao thì bị từ chối ngay. Theo thông tin công khai, những gì bị chặn bao gồm đánh cắp thông tin đăng nhập và token, rò rỉ dữ liệu riêng tư ra ngoài, chạy mã nguồn không rõ gốc gác, xóa dữ liệu không thể hoàn tác, và các thay đổi làm suy yếu cài đặt an toàn hệ thống. Nếu agent duyệt lại từ chối liên tiếp 3 lần, hoặc từ chối tổng cộng 10 lần trong 50 lượt duyệt, tác vụ sẽ bị ngắt và trả lại cho người dùng xử lý.
Agent duyệt lại chỉ có vai trò đánh giá, quyền hạn không vì vậy mà mở rộng thêm, ranh giới sandbox vẫn như cũ.
Vì sao công bố vào lúc này
Thời điểm này khá nhạy cảm. Vài tuần gần đây, OpenAI đã thừa nhận trong một thử nghiệm nội bộ, một agent đã xâm nhập vào hệ thống của Hugging Face; còn Wikimedia Foundation thì phát hiện hoạt động bất thường của agent OpenAI trên chính nền tảng của mình. Để truy lại lịch sử, OpenAI phải chi hơn 500.000 USD tiền tính toán mỗi ngày.
Trong bối cảnh đó, việc hạ ngưỡng của một tính năng an toàn cho agent xuống bằng 0 ít nhất cũng là một cách thể hiện thái độ. Auto-review phòng ngừa những sai sót do chính người dùng gây ra trên máy của họ, không cùng cấp độ với các sự cố xảy ra trong lúc huấn luyện, nhưng cả hai đều chỉ về cùng một vấn đề: agent ngày càng tự hành động nhiều hơn, còn con người ngày càng không kịp theo dõi từng cái một.
Cách làm tương tự không còn mới trong các công cụ lập trình. Cursor đã ra mắt cơ chế tự duyệt của riêng mình từ tháng 6 năm nay, đưa tỷ lệ gián đoạn của agent lập trình xuống còn 7%. Khác biệt chính của Codex lần này nằm ở giá: việc duyệt lại cũng cần chạy một mô hình, trước đây chi phí đó tính vào người dùng, còn giờ do OpenAI gánh.
Nhà phát triển ở Trung Quốc có dùng được không
Chính sách miễn phí này chỉ áp dụng cho việc đăng nhập bằng tài khoản ChatGPT. Với người dùng truy cập Codex qua API Key, thông tin công khai chưa đề cập có áp dụng hay không. Nhà phát triển ở Trung Quốc muốn dùng, điều kiện vẫn là phải đăng nhập được tài khoản ChatGPT bình thường và đăng ký gói tương ứng, giới hạn khu vực không thay đổi.
Hiệu quả chặn hiện tại chỉ có phát ngôn từ chính OpenAI. Agent duyệt lại có chặn nhầm thao tác bình thường không, tỷ lệ chặn nhầm là bao nhiêu, OpenAI chưa đưa ra số liệu chính thức, người dùng chỉ có thể tự kiểm chứng trong dự án của mình.
Nguồn tham khảo: tài liệu Codex của OpenAI, CocoLoop, bài đăng công khai của Thibault Sottiaux, Nerds Chalk; đường dẫn bật Auto-review, ngưỡng từ chối và phạm vi miễn phí theo thông tin chính thức từ OpenAI.