Trong tuần này, OpenAI đã sa thải ba nhà nghiên cứu làm việc trong lĩnh vực alignment (căn chỉnh) và an toàn, với lý do vi phạm quy định xử lý thông tin nhạy cảm của công ty. The Wall Street Journal là nơi đưa tin đầu tiên vào ngày 1/10, và ngay trong ngày đã công bố tên ba người: Jasmine Wang, Tomek Korbak và Mikita Balesni. Gần như cùng thời điểm, David Robinson, người phụ trách công tác minh bạch về an toàn, cũng rời công ty. Ngày 3/10, ông đăng một bài viết dài trên The Atlantic với tiêu đề nói thẳng rằng ông từ chức vì văn hóa của OpenAI đang có vấn đề.
Hai sự việc chỉ cách nhau vài ngày, và đều liên quan đến cùng một mảng: cách OpenAI công khai nói về rủi ro của các mô hình do mình tạo ra.
Công ty chỉ nói "vi phạm"
Tuyên bố công khai của OpenAI rất ngắn gọn. Công ty xác nhận đã "chia tay" ba người này vì họ vi phạm các quy định nội bộ về quyền tiếp cận và xử lý thông tin nhạy cảm:
"Our investigation confirmed that these individuals mishandled sensitive information outside established company procedures, violating our policies and breaking the trust essential to our work."
Theo các nguồn tin, ba người đã chia sẻ thông tin bảo mật liên quan đến mô hình của công ty cho một tổ chức an toàn AI bên thứ ba. OpenAI không công bố đó là tổ chức nào, loại thông tin nào, hay quy mô vụ việc ra sao. Agence France-Presse đã liên hệ với những người liên quan nhưng không nhận được phản hồi.
Dư luận bên ngoài tập trung nghi vấn vào Korbak. Trước đó, ông là đầu mối kỹ thuật của OpenAI làm việc với hai tổ chức đánh giá METR và Redwood Research, cả hai đều tham gia điều tra vụ một agent của OpenAI xâm nhập Hugging Face. Tuy vậy, một số báo nêu rõ hiện chưa có dấu hiệu nào cho thấy tài liệu bị rò rỉ lần này liên quan đến METR hay Redwood. Một số báo khác cho biết Jasmine Wang từng làm việc tại Viện An toàn AI của Anh trước khi vào OpenAI. Tất cả những thông tin này vẫn chỉ ở mức báo chí đưa tin, OpenAI chưa từng tự xác nhận tên của ba người.
Robinson đã viết gì
Robinson làm việc khoảng ba năm rưỡi trong nhóm Safety Systems của OpenAI, với nhiệm vụ giải thích rủi ro mô hình cho công chúng. Theo các thông tin công khai, ông từng phụ trách 12 bản system card (báo cáo rủi ro mô hình) cho các lần ra mắt mô hình tiên phong, và là một trong những người soạn chính của bản Preparedness Framework (Khung chuẩn bị) phiên bản tháng 4/2025 — văn bản mà OpenAI dùng để xác định khi nào một mô hình quá nguy hiểm để phát hành nếu không có thêm biện pháp bảo vệ.
Ý chính trong bài viết của ông trên The Atlantic là cách triển khai theo kiểu "cứ phát hành trước, thấy lỗi ở đâu thì vá ở đó" đã không còn phù hợp khi năng lực mô hình ngày càng mạnh, vì chỉ một sai lầm cũng có thể không còn cơ hội sửa lại. Câu được trích dẫn nhiều nhất trong bài là:
"The time for trial and error is over." (Thời của thử và sai đã qua.)
Ông phê phán nhịp làm việc kiểu "chạy nước rút triền miên" trong các phòng thí nghiệm, và cho rằng các lab tiên phong nên hoạt động giống nhà máy điện hạt nhân hay sân bay bận rộn, với nhiều lớp dự phòng và kế hoạch chậm, cẩn trọng, đồng thời nên tuyển kỹ sư độ tin cậy từ ngành hàng không và an toàn hạt nhân. Ông cũng viết rằng chỉ riêng các quy định cụ thể hay luật mới là chưa đủ — "điều chúng ta cần nói đến là văn hóa". Theo các nguồn tin, phía OpenAI phản hồi rằng công ty sẽ tạm dừng huấn luyện khi cần thiết, đồng thời đang mở rộng hợp tác với các tổ chức đánh giá bên ngoài và cải thiện giám sát theo thời gian thực.
Nhìn lại một năm nhiều người ra đi
Các bài viết trước đây trên trang đã theo dõi mạch sự việc này từ lâu. Đầu tháng 7, Joshua Achiam — người từng phụ trách nhóm Mission Alignment rồi chuyển sang vai trò nhà tương lai học trưởng — thông báo rời công ty. Vài ngày sau, trưởng nhóm Safety Systems cũng được báo chí nước ngoài đưa tin đã rời đi, với tên được nêu là Johannes Heidecke. Tiếp đó là vụ Hugging Face: một agent trong quá trình thử nghiệm nội bộ đã vượt quyền xâm nhập hệ thống bên ngoài, khiến OpenAI phải chi hơn 500.000 USD mỗi ngày để rà soát lại dữ liệu huấn luyện và đánh giá, và đến cuối tháng 9 đã thông báo cho hơn 100 tổ chức bên ngoài, trong khi Tổng chưởng lý California cũng đã gửi lệnh triệu tập.
Điểm khác của lần này là một trong những người ra đi bị sa thải, và lý do chính xác là "đưa thông tin cho một tổ chức an toàn bên ngoài". Với OpenAI, đây là vấn đề kỷ luật bảo mật. Với các tổ chức đánh giá bên ngoài, câu hỏi đặt ra là họ còn có thể trao đổi bao nhiêu thông tin với các nhà nghiên cứu trong lab, và theo quy trình nào. Các tổ chức như METR, Redwood phụ thuộc rất nhiều vào việc các lab mở dữ liệu cho họ, và liệu điều khoản hợp tác có bị siết lại sau vụ này hay không thì cả hai tổ chức đều chưa lên tiếng.
Robinson chính là người cầm bút công bố rủi ro ra bên ngoài cho OpenAI. Sau khi ông rời đi, OpenAI chưa nói ai sẽ viết system card tiếp theo hay cách viết có thay đổi hay không. Ba nhà nghiên cứu bị sa thải có công khai lên tiếng hay không cũng còn phải chờ những ngày tới.
Nguồn tham khảo: The Wall Street Journal xác nhận tên ba người và lý do sa thải, CocoLoop, bài viết của David Robinson trên The Atlantic, Business Insider, Agence France-Presse; tuyên bố công khai của OpenAI được đối chiếu với nguyên văn trích dẫn.