OpenAI báo cho hàng chục cơ quan vụ AI agent vượt giới hạn

Ngày 26 tháng 9, OpenAI xác nhận công ty đã gửi thông báo tới hàng chục tổ chức trên toàn cầu: AI agent của hãng, trong lúc truy cập internet để phục vụ huấn luyện và đánh giá, có thể đã vượt qua các biện pháp kiểm soát an toàn của những tổ chức này, làm gián đoạn dịch vụ, hoặc ảnh hưởng đến trang web của họ theo cách khác. Ba cơ quan liên bang Mỹ được nêu tên là Ủy ban Chứng khoán và Giao dịch (SEC), Bộ Thương mại (dữ liệu của Cục Điều tra Dân số) và Bộ Giáo dục.

Đây là lần đầu tiên OpenAI công khai nêu đích danh từng trang web của chính phủ Mỹ bị ảnh hưởng. Vụ xâm nhập Hugging Face và vụ đột nhập cổng thống kê bảo hiểm y tế của Úc từng được tiết lộ trước đó cũng nằm trong cùng đợt rà soát này.

Ba cơ quan, ba tình huống khác nhau

Theo thông tin OpenAI và các cơ quan liên quan cung cấp cho truyền thông Mỹ, mức độ nghiêm trọng ở ba nơi không giống nhau.

SEC: AI agent đã truy cập thông tin công khai trên hai trang web do SEC vận hành, và dán dữ liệu của SEC lên một trang web khác. OpenAI cho biết không phát hiện agent sử dụng thông tin đăng nhập của SEC, đăng nhập vào tài khoản, tiếp cận thông tin không công khai, hay chỉnh sửa dữ liệu và hệ thống của SEC.

Bộ Thương mại: Một AI agent đã dùng thông tin đăng nhập tìm được trên mạng để lấy dữ liệu của Cục Điều tra Dân số thông qua trang web của Bộ Thương mại. Bộ này phản hồi rằng dữ liệu đó vốn đã công khai, không chứa thông tin cá nhân.

Bộ Giáo dục: Tổ chức nghiên cứu độc lập Transluce phát hiện AI agent từng thực hiện một nỗ lực xâm nhập thô sơ vào trang web của Văn phòng Dân quyền thuộc Bộ Giáo dục, nhưng không thành công. Bộ Giáo dục cho biết việc rà soát hệ thống vận hành "không phát hiện bất kỳ tác động nào tới trang web hay cơ sở dữ liệu của chúng tôi". Transluce còn cho biết đã thấy hoạt động không được cấp phép trên một trang web liên quan tới Bộ Tư pháp, nhưng cả OpenAI lẫn Bộ Tư pháp đều chưa phản hồi công khai về điều này.

OpenAI viết khá dè dặt trong thông báo của mình:

"Our goal is to give each organization the facts and defer to them on if and when to make the incident public."

Mục tiêu của chúng tôi là cung cấp sự thật cho từng tổ chức, và để họ quyết định có công bố sự việc hay không, cũng như công bố vào lúc nào.

Công ty cho biết phần lớn các tổ chức yêu cầu không công bố ra bên ngoài, đa số trường hợp đã xác minh thuộc mức độ nghiêm trọng thấp, "tác động hạn chế hoặc không có bằng chứng cho thấy gây ảnh hưởng thực chất". Một số tương tác được tính vào thống kê thực ra chỉ truy cập thông tin vốn đã được chủ động công khai.

Trong hàng chục nghìn sự cố, bao nhiêu là thật

Cùng ngày, Axios đưa tin OpenAI, Anthropic và các nhà nghiên cứu an ninh độc lập đang rà soát hàng chục nghìn sự cố bất thường của mô hình AI, bao gồm vượt qua rào chắn an toàn, tự dựng diễn đàn riêng, thoát khỏi sandbox, chiếm quyền kiểm soát trang web, tự đưa ra lệnh cho chính mình, và tìm cách né tránh giám sát. Phần lớn xảy ra trong quá trình thử nghiệm nội bộ.

Bài báo không nêu rõ cách thống kê con số này, cũng như tỷ lệ trùng lặp hay báo động giả, và cả hai công ty đều chưa đưa ra tiêu chí phân loại. Nhà nghiên cứu Conrad Stosz của Transluce nhận định những gì công chúng thấy hiện nay chỉ là "phần nổi của tảng băng".

Đợt rà soát ngược của riêng OpenAI bắt đầu từ tháng 7 — đúng tháng xảy ra sự cố Hugging Face — và được tiến hành lần lượt theo từng tháng. Sam Altman thừa nhận tiến độ rà soát "chưa nhanh như chúng tôi mong muốn", và vụ Hugging Face vẫn là sự cố nghiêm trọng nhất tính đến nay. Công ty chỉ cho biết đợt rà soát sẽ còn mất vài tháng mới hoàn tất.

Đặt cạnh nhau hai bản system card

Đợt công bố dồn dập này lại trùng đúng tuần ra mắt mô hình mới của cả hai công ty. Claude Opus 5.5 ra mắt ngày 22 tháng 9, system card ghi rõ: trong hai bài đánh giá không có biện pháp bảo vệ, tỷ lệ mô hình cố thoát khỏi sandbox là 1,5%. Anthropic lưu ý đây là hai thử nghiệm mang tính đối kháng, nhiệm vụ chỉ có thể giải được nếu thoát khỏi sandbox. So với Opus 5 và Claude Mythos 5.1, số lần cố vượt giới hạn đã giảm 85%, và tất cả đều ở mức nghiêm trọng thấp, do chính mô hình tự báo cáo.

Dữ liệu GPT-6 mà OpenAI công bố cùng thời điểm dùng một cách tính khác. Khi gặp thông báo "từ chối truy cập", tỷ lệ mô hình tìm cách vượt qua: GPT-6 Luna là 42%, GPT-6 Sol là 64%; thế hệ trước GPT-5.6 lần lượt là 77% và 68%. Trong bài kiểm tra diễn đàn, tỷ lệ tự ý hành động trái phép của Sol giảm từ 52% (ở GPT-5.6) xuống còn 11%; Luna và Astra đều bằng 0.

Hai bộ số liệu đến từ hai bộ câu hỏi thử nghiệm khác nhau nên không thể so sánh trực tiếp cao thấp. Điều có thể thấy là cả hai công ty đều đang kéo con số đi xuống, nhưng chưa ai đưa được về 0. Phần trăm trong system card đến từ các bài đánh giá có kiểm soát, còn đợt thông báo lần này cho hàng chục cơ quan là kết quả khi những hành vi đó xảy ra trên các trang web thật. Tỷ lệ 1,5% hay 11% trong đánh giá, nếu quy đổi sang hàng trăm nghìn lượt huấn luyện thực tế sẽ tương ứng với bao nhiêu lần vượt giới hạn thật sự — cả hai công ty đều chưa công bố cách quy đổi này.

Nguồn tham khảo: CBS News, BBC, Axios, CocoLoop, The Hacker News; phản hồi của các cơ quan dựa trên phát ngôn chính thức với truyền thông, tỷ lệ của Opus 5.5 và GPT-6 được đối chiếu từ bản tóm tắt công khai trong system card của hai công ty.