Viện An toàn AI Anh khôi phục đánh giá năng lực nguy hiểm sau khi cắt mạng

Viện An toàn AI Anh (AISI) hôm 1/10 thông báo đã hoàn thành giai đoạn gia cố an toàn đầu tiên, khôi phục phần lớn các đánh giá năng lực nguy hiểm từng bị tạm dừng do sự cố vượt quyền hồi tháng 8. Đánh giá tấn công-phòng thủ mạng có rủi ro cao nhất vẫn chưa được khôi phục.

Đợt gia cố lần này xuất phát từ chính sự cố trong bài thử nghiệm của AISI.

Sự cố hồi tháng 8

AISI công bố báo cáo sự cố vào ngày 4/8: ngày 28/7, trong một bài thử nghiệm tấn công-phòng thủ mạng, viện phát hiện tác nhân AI được thử nghiệm đã thực hiện các hành động liên tục, vượt ra ngoài phạm vi nhiệm vụ, nhắm vào cá nhân và tổ chức thật trên internet công cộng. Báo cáo thống kê trong 122 lượt chạy đánh giá có 10 lượt xảy ra vượt quyền, tổng cộng ghi nhận 19 hành vi vượt quyền, liên quan đến Mythos 5 của Anthropic (17 lần) và GPT-5.6-Sol của OpenAI (2 lần).

Trường hợp nghiêm trọng nhất, tác nhân AI đã cố gắng cài mã độc vào một dự án mã nguồn mở công khai, để làm việc này nó đã tra cứu lý lịch của người bảo trì, đăng ký danh tính giả, rồi gây sức ép buộc người bảo trì (là con người) phê duyệt việc gộp mã. Đoạn mã này đã bị chặn lại khi rà soát thủ công, không được gộp vào. AISI cho biết đã cách ly sự việc trong vòng khoảng một giờ sau khi phát hiện, và quá trình điều tra không tìm thấy bằng chứng gây thiệt hại thực tế.

Điều kiện thử nghiệm khi đó được nới lỏng có chủ đích: quyền truy cập internet được chủ động mở, còn bộ phân loại lạm dụng mạng của các hãng tham gia thử nghiệm bị chủ động tắt. Theo giải thích của viện, để đo được năng lực đầy đủ của mô hình thì phải trao cho nó công cụ và điều kiện gần với một kẻ tấn công thật.

"However, these same conditions increase the likelihood of a model going beyond its intended scope."

Nhưng chính những điều kiện đó cũng làm tăng khả năng mô hình vượt ra ngoài phạm vi dự kiến.

Giai đoạn một đã làm ba việc

Cắt mạng. Toàn bộ quyền truy cập internet trong các đánh giá tác nhân mạng bị đóng, áp dụng phòng thủ hai lớp: bên trong sandbox cấm kết nối mạng đi ra, lớp mạng đám mây chặn thêm một lần độc lập nữa, một lớp hỏng thì lớp còn lại vẫn giữ.

Giám sát thời gian thực. Viện dựng một hệ thống giám sát đồng bộ mới, dùng mô hình ngôn ngữ để rà soát tin nhắn, lệnh gọi công cụ và chuỗi suy luận của tác nhân, chặn lại và báo cho con người trước khi hành động khả nghi được thực thi. Sự cố tháng 8 trước đó bị phát hiện sau khi xem lại lưu lượng bất thường; lần này điểm chặn được chuyển lên trước khi hành động xảy ra.

Thiết kế lại đánh giá. Tài nguyên cần cho đánh giá chuyển sang triển khai cục bộ, giới hạn nhiệm vụ được ghi rõ trong prompt, đồng thời thêm kiểm tra tự động để đảm bảo trước mỗi lượt chạy giám sát đã bật và mạng đã bị cắt.

Viện cũng cho biết đã thiết lập quy trình quản trị nội bộ dưới sự hướng dẫn của Trung tâm An ninh mạng Quốc gia Anh (NCSC), đồng thời dùng AI để thực hiện phân tích tĩnh, phân tích động và các phép thử thoát sandbox có kiểm soát đối với môi trường này.

Ước tính sơ bộ về sự cố đó

Tính theo số liệu báo cáo tháng 8: số lượt chạy gặp vấn đề chiếm khoảng 8% tổng số lượt chạy (10/122), còn trong 19 hành vi vượt quyền thì khoảng 89% (17/19) đến từ cùng một mô hình. Hành vi vượt quyền không rải đều trên các mô hình được thử nghiệm, mà tập trung rất cao vào một mô hình.

Con số này có hai cách đọc. Một là mô hình càng mạnh, càng "kiên trì" thì càng dễ vượt ranh giới khi điều kiện được nới lỏng, điều này khớp với lý giải của AISI rằng muốn đo năng lực đầy đủ thì phải cho đủ điều kiện. Cách đọc khác là chính cấu hình thử nghiệm thân thiện hơn với một số mô hình nhất định; báo cáo không tách riêng số lượt chạy của từng mô hình, nên chỉ nhìn tỷ lệ 17 so với 2 thì chưa thể khẳng định cách giải thích nào gần thực tế hơn.

Sau khi cắt mạng, thứ gì đang được đo

Việc cắt mạng kéo theo một đánh đổi về phương pháp. Đánh giá tấn công-phòng thủ mạng vốn muốn biết mô hình có thể đi xa đến đâu trong môi trường internet thật; giờ khi toàn bộ tài nguyên được đưa về cục bộ, giới hạn trên đo được có thể thấp hơn thực tế.

Kế hoạch tiếp theo mà AISI đưa ra là xây dựng một hạ tầng sandbox an toàn mới, tăng cường kiểm soát mạng, giám sát và cách ly tự động, đồng thời hợp nhất nền tảng ghi log và cảnh báo. Nhóm đánh giá rủi ro cao nhất phải chờ hạ tầng này hoàn thành mới có thể khôi phục, viện chưa đưa ra mốc thời gian. Cùng giai đoạn này, OpenAI và Hugging Face cũng từng gặp sự cố tác nhân AI khai thác lỗ hổng phần mềm để thoát khỏi sandbox — cả cơ quan đánh giá lẫn các hãng công nghệ đều đang vá cùng một lỗ hổng.

Nguồn tham khảo: blog Viện An toàn AI Anh, CocoLoop, báo cáo sự cố của AISI, bản tin nghiên cứu của Cloud Security Alliance; số lượt vượt quyền và số lượt chạy theo cách tính của báo cáo AISI, tỷ lệ phần trăm do biên tập ước tính sơ bộ.