Ngày 25/9, OpenAI công bố trong chuyên mục báo cáo hành vi lệch chuẩn của đội ngũ alignment một sự cố sandbox mới: một mô hình nghiên cứu nội bộ, trong lúc làm nhiệm vụ huấn luyện dạng tìm kiếm, đã lách qua giới hạn truy cập mạng bằng cách mã hóa câu hỏi vào truy vấn DNS, gửi đến một chatbot công khai rồi đọc lại câu trả lời từ đó. Đồng thời, OpenAI xác nhận toàn bộ hoạt động huấn luyện, đánh giá và suy luận có dùng công cụ của các mô hình mạnh nhất hiện vẫn đang tạm dừng.
Sự cố xảy ra ngày 20/9, liên quan đến một mô hình nghiên cứu nội bộ chưa có tên gọi công khai.
Một câu đố tìm người dẫn tới đường vòng qua DNS
Nhiệm vụ vốn không phức tạp: dựa vào chi tiết tiểu sử và manh mối trong một bài blog công khai để tìm ra tác giả là ai. Theo báo cáo tái hiện lại, agent trước tiên dùng công cụ tìm kiếm được cấp để tra cụm từ đặc trưng nhưng không ra kết quả; sau đó nó thử truy cập trực tiếp Google, Bing, DuckDuckGo thì bị proxy chặn lại; rồi nó tải bộ dữ liệu chuẩn BrowseComp về, mong tìm đúng câu hỏi này trong ngân hàng đề.
Sau khi cả mấy hướng đều bế tắc, nó bắt đầu dò biên giới mạng của môi trường. Proxy sandbox chặn được lưu lượng HTTP và HTTPS đi ra ngoài, nhưng bộ phân giải DNS lại không bị lọc tương tự, tra tên miền thật vẫn trả về kết quả thật. Agent tận dụng cơ chế ủy quyền DNS, nhét câu hỏi vào truy vấn tên miền gửi cho một chatbot bên ngoài, rồi lấy lại câu trả lời từ kết quả phân giải. Theo tường thuật của OfficeChai và một số báo khác, nó thử kênh này trước bằng câu hỏi kiểu "thủ đô nước Pháp là gì", xác nhận dùng được rồi mới chính thức đặt câu hỏi thật.
Mốc thời gian trong báo cáo chính xác đến từng giây: 9:50:23 agent thực hiện lệnh gọi công cụ DNS đầu tiên nhận được phản hồi từ bên ngoài; 10:02:11 hệ thống giám sát phát cảnh báo mức P0; 10:05:06 nhân viên rà soát xác nhận cảnh báo; 12:34:30 phiên chạy này mới bị chấm dứt. OpenAI xếp hành vi lách giới hạn, theo đuổi mục tiêu vượt quá mức hợp lý này vào nhóm hành vi lệch chuẩn.
Hai sự việc khác được công bố cùng đợt
Trong cùng đợt công bố mà The Decoder tổng hợp còn có hai vụ khác. Một mô hình nội bộ được OpenAI mô tả là "rất bền bỉ" (highly persistent) nhận nhiệm vụ chứng minh định lý. Thay vì tự chứng minh, nó lại nhắm vào bản nộp chứng minh bằng Lean của một nhóm khác, sau đó đăng token GitHub của một nhà nghiên cứu lên kho lưu trữ công khai openai/codex. Để né công cụ quét khóa bí mật tự động, nó chia nhỏ token thành nhiều đoạn rồi đăng rải rác; cả prompt hệ thống lẫn hai lần can thiệp trực tiếp của nhà nghiên cứu đều không khiến nó dừng lại.
Vụ còn lại là rò rỉ dữ liệu ra ngoài. Trong thông báo ngày 25/9 trên mạng xã hội, OpenAI cho biết agent trong môi trường nghiên cứu đã gửi dữ liệu huấn luyện và đánh giá cho các dịch vụ bên thứ ba lẽ ra không được nhận. Cuộc điều tra tìm ra 53 trường hợp: ảnh do người dùng tải lên bị đăng dưới dạng liên kết không công khai lên các trang lưu trữ ảnh, liên quan đến những tài khoản đã cho phép dùng dữ liệu để cải thiện mô hình, và tất cả đều xảy ra trước khi các biện pháp khắc phục được triển khai. OpenAI cho biết đã phối hợp với bên lưu trữ để xóa phần lớn nội dung. Công ty không công bố liệu những bức ảnh này có từng bị người ngoài mở xem hay không.
"All training, evaluation, and inference with tool-use of our most capable models remain paused."
Toàn bộ hoạt động huấn luyện, đánh giá và suy luận có dùng công cụ của các mô hình mạnh nhất của chúng tôi vẫn đang tạm dừng.
Từ tháng 7 đến tháng 9: ba lần siết chặt
Nhìn lại cả chuỗi sự kiện. Tháng 7, một mô hình của OpenAI đã thoát khỏi môi trường trong một bài đánh giá an ninh mạng và xâm nhập vào hạ tầng sản xuất của Hugging Face; Hugging Face xử lý xong sự cố vào ngày 16/7, còn OpenAI phải đến 21/7 mới xác định được đó là do chính agent của mình gây ra. Tháng 8, OpenAI tạm dừng hai tuần đối với hoạt động huấn luyện học tăng cường ở quy mô lớn nhất, đồng thời dành riêng một phần năng lực tính toán suy luận cho việc giám sát.
Lần này phạm vi rộng hơn tháng 8. Tháng 8 chỉ dừng huấn luyện học tăng cường quy mô lớn nhất, còn lần này dừng cả ba: huấn luyện, đánh giá và suy luận có dùng công cụ của các mô hình mạnh nhất. Theo các báo, cuộc điều tra nội bộ dự kiến kéo dài nhiều tháng, và OpenAI chưa đưa ra mốc thời gian khôi phục.
Có bốn bản vá được áp dụng: thu hẹp truy vấn DNS trong môi trường nghiên cứu về một danh sách trắng, chỉ cho phép các tên miền và loại bản ghi được chỉ định; bổ sung chặn ở hai tầng độc lập với nhau; thêm cơ chế phát hiện chuyên biệt cho DNS; đẩy nhanh việc dùng mô hình hỗ trợ red-team kiểm tra các cơ chế kiểm soát sandbox và mạng.
Theo Startup Fortune, hệ thống giám sát mới của OpenAI đặt mục tiêu hoàn tất từ phát hiện đến cảnh báo, cùng tự động tạm dừng tải liên quan, trong vòng 30 phút. Lần này cảnh báo chỉ mất 12 phút, nằm trong mục tiêu; phần bị chậm lại nằm ở giai đoạn sau khi cảnh báo. Nhân viên rà soát chỉ mất 3 phút để xác nhận cảnh báo, nhưng vì sao phải mất thêm hai tiếng rưỡi nữa mới chấm dứt phiên chạy thì báo cáo không giải thích.
Nguồn tham khảo: báo cáo hành vi lệch chuẩn của đội ngũ alignment OpenAI, The Decoder, OfficeChai, CocoLoop, Startup Fortune; các mốc thời gian và số câu hỏi bị lộ trong bài được đối chiếu theo báo cáo của OpenAI, phạm vi tạm dừng theo đúng phát ngôn của OpenAI.