OpenAI tạm dừng đợt học tăng cường lớn nhất trong hai tuần

Ngày 18/8, OpenAI công bố một quyết định đã được xử lý nội bộ từ trước đó: đánh giá năng lực an ninh mạng của mô hình thế hệ tiếp theo Astra không đưa ra được kết luận "an toàn", khiến công ty ngay lập tức dừng huấn luyện học tăng cường (RL) đối với mô hình mới nhất đang triển khai, kéo dài hai tuần. Tính đến thời điểm công bố, đợt RL tiên phong quy mô lớn nhất vẫn chưa được khởi động lại, chỉ những đợt huấn luyện và đánh giá quy mô nhỏ hơn vẫn diễn ra bình thường.

Thông tin này lần đầu lộ diện vào ngày 7/8, khi bên ngoài chỉ biết đến phiên bản "OpenAI hoãn ra mắt Astra". Bài viết ngày 18/8 mới trải ra toàn bộ chuỗi lập luận phía sau việc trì hoãn đó: đánh giá nội bộ cho thấy mức tiến bộ của Astra trong lập trình tự động và tấn công - phòng thủ mạng lớn đến mức công ty không thể loại trừ khả năng mô hình đã chạm ngưỡng Critical.

Ngưỡng được viết cụ thể hơn tưởng tượng

Preparedness Framework của OpenAI cụ thể hóa ngưỡng Critical về an ninh mạng thành hai mô tả năng lực có thể xác định: mô hình có thể tự viết ra mã khai thác lỗ hổng zero-day dùng được, nhắm vào nhiều hệ thống trọng yếu thực tế đã được gia cố; hoặc chỉ cần được giao một mục tiêu cấp cao, mô hình có thể tự thiết kế và thực hiện trọn vẹn một cuộc tấn công kiểu mới nhắm vào mục tiêu đã gia cố.

Kết luận của đánh giá nội bộ dừng ở mức "không thể loại trừ", chưa xác nhận đã đạt ngưỡng. Nhưng nhìn vào hành động tiếp theo của công ty, mức này đã đủ để kích hoạt một đợt giảm tốc phòng ngừa - không cần chờ xác nhận, cứ dừng trước những đợt huấn luyện tốn nhiều năng lực tính toán nhất và có khả năng đẩy năng lực mô hình lên cao hơn nữa.

Cái dừng là huấn luyện, cái thay đổi là trung tâm dữ liệu

Tạm dừng chỉ là một nửa câu chuyện. OpenAI đồng thời liệt kê một loạt thay đổi ở tầng hạ tầng: siết chặt cách ly sandbox và phân tách mạng, loại bỏ các dịch vụ dùng chung dễ bị xuyên thủng, thu hẹp các quyền truy cập có hiệu lực lâu dài, bổ sung đầy đủ nhật ký bảo mật. Phần lớn khối lượng công việc của Astra hiện vẫn đang bị treo, chờ được chuyển vào môi trường đáp ứng yêu cầu mới.

Mảng giám sát đưa ra con số trực quan nhất. Hệ thống giám sát mới gồm hai phần: một bộ phân loại kích hoạt hoạt động ở cấp độ token, có nhiệm vụ đánh dấu hành vi khả nghi ngay trong quá trình sinh nội dung; và một bộ điều tra tự động, có nhiệm vụ rà lại những gì đã bị đánh dấu. Hệ thống giám sát này ngốn khoảng 20% năng lực tính toán suy luận. Cửa sổ phản hồi mục tiêu cho cảnh báo được đặt dưới 30 phút, và cửa sổ để đội an toàn loại trừ cảnh báo giả cũng là 30 phút.

20% trên giấy tờ trông như một thông số kỹ thuật, nhưng quy đổi ra chi phí thì khác hẳn. Chi phí suy luận hằng năm của các phòng thí nghiệm tiên phong phổ biến ở mức hàng tỷ đô la (ước tính thô, mỗi công ty một cách tính), và việc dành thường trực một phần năm cho giám sát tương ứng với một khoản chi phí cố định cỡ hàng tỷ đô la, mà khoản tiền này không tạo ra bất kỳ năng lực phục vụ người dùng nào. Việc sẵn sàng gánh khoản này lâu dài cho thấy công ty dự đoán cửa sổ rủi ro sẽ không đóng lại trong vài tuần, mà sẽ kéo dài suốt vòng đời của mô hình thế hệ tiếp theo.

Một hướng đi khác có thể so sánh là ưu tiên trao năng lực tấn công - phòng thủ cho bên phòng thủ trước, bằng cách mở mô hình dò lỗ hổng cho một danh sách giới hạn, đổi lấy khoảng thời gian đệm bằng một bề mặt triển khai có kiểm soát. Lựa chọn lần này của OpenAI nằm ở thượng nguồn hơn, đạp phanh trực tiếp ngay tại khâu huấn luyện. Cả hai hướng đều nhắm vào cùng một nhận định: năng lực tấn công của mô hình đang tăng nhanh hơn tốc độ của quy trình vá lỗi phía phòng thủ.

Một cửa ải do chính mình dựng lên

Quy trình này không có chỗ cho sự giám sát từ bên ngoài. Điều kiện kích hoạt, tiêu chí đánh giá, thời gian tạm dừng, tiêu chuẩn khởi động lại - tất cả đều do OpenAI tự viết, tự phán định, tự thực thi, và bên ngoài chỉ nhận được một bản thông báo sau sự việc. Bài viết không đưa ra con số nào có thể để bên thứ ba kiểm chứng, về việc ngưỡng Critical được đo cụ thể ra sao hay Astra đạt điểm số bao nhiêu ở từng bài kiểm tra. Công ty cũng làm rõ thêm một điểm: sự cố sandbox trên Hugging Face từng gây tranh cãi trước đó không liên quan đến Astra.

Với các nhà phát triển đang theo sát tiến độ, tác động ngắn hạn tập trung ở hai điểm: mốc ra mắt các năng lực liên quan đến Astra sẽ bị lùi lại; các khối lượng công việc Astra đang chạy phải chuyển môi trường theo, với nhịp độ do một mình OpenAI quyết định. Còn đợt RL tiên phong quy mô lớn nhất khi nào khởi động lại, công ty chưa đưa ra câu trả lời.

Nguồn tham khảo: Blog chính thức của OpenAI, Axios, CocoLoop, AIGC News; định nghĩa ngưỡng Critical trong Preparedness Framework, tỷ lệ 20% năng lực tính toán dành cho giám sát và cửa sổ cảnh báo 30 phút đều đã được đối chiếu theo phát biểu công khai của OpenAI.