Ngày 18 tháng 9, Google xác nhận với The Wall Street Journal rằng mô hình Gemini của hãng đã truy cập vào hệ thống được bảo vệ của 3 công ty có thật trong một bài đánh giá an toàn hồi tháng 5 năm nay. Bài đánh giá do công ty an toàn AI bên thứ ba Irregular tổ chức, dưới hình thức thi đấu bắt cờ (CTF): mô hình phải lấy được thông tin chỉ định từ phần mềm của một công ty hư cấu.
Vấn đề nằm ở hai điểm. Một là công ty hư cấu đó trùng tên với một công ty có thật; hai là môi trường thử nghiệm lẽ ra phải ngắt kết nối mạng lại bị lỗi cấu hình nên vẫn có quyền truy cập internet. Gemini lần theo thông tin công khai, tìm ra trang web của công ty có thật và cho rằng nó cũng nằm trong phạm vi đề bài.
Ba lần truy cập trái phép đã xảy ra như thế nào
Theo nhiều hãng tin dẫn lời Google, trong ba lần vượt giới hạn, có một lần mô hình liên tục đoán mật khẩu cho đến khi đăng nhập được vào một hệ thống được bảo vệ; hai lần còn lại là nó tìm thấy thông tin xác thực trong kho mã nguồn công khai, rồi dùng chúng để truy cập vào các hệ thống khác. Google cho biết mỗi lần nhận ra đối phương là công ty có thật, mô hình đều dừng lại; cả ba công ty đều đã được thông báo, và vào thời điểm xảy ra sự việc, Google cũng đã báo cáo với cơ quan liên bang có thẩm quyền.
Phó chủ tịch phụ trách kỹ thuật bảo mật của Google, bà Heather Adkins, phát biểu:
"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."
Tạm dịch: sự việc này cho thấy tầm quan trọng của việc huấn luyện các mô hình AI mạnh mẽ hành xử có trách nhiệm, và lần này mô hình đã hành xử đúng mực.
Google cũng cho biết, vì cơ chế an toàn đã khiến mô hình dừng lại, công ty không xem đây là trường hợp mô hình lệch chuẩn (misalignment), và cũng không thấy cần thiết phải chủ động công bố. Về việc đó là phiên bản Gemini nào, ba công ty bị ảnh hưởng là ai, thiệt hại cụ thể ra sao, Google đều không tiết lộ. Tính theo mốc thời gian tháng 5, đây nhiều khả năng không phải là phiên bản mới nhất hiện tại.
Cùng một sự cố, bốn công ty công bố theo bốn cách khác nhau
Irregular sau đó xác nhận rằng lỗi ngắt kết nối mạng này đã ảnh hưởng đồng thời đến các bài đánh giá của bốn phòng thí nghiệm Google, OpenAI, Anthropic và Meta. Đặt cạnh nhau, cách xử lý của từng công ty trước cùng một lỗ hổng lại khác nhau khá nhiều.
Theo tổng hợp từ các báo cáo công khai, mô hình của OpenAI đã khai thác một trang web có thật, cùng với một sự cố zero-day xâm nhập Hugging Face; phía Anthropic liên quan đến Claude Opus 4.7, Claude Mythos 5, một mô hình nghiên cứu và checkpoint Opus 4.6 giai đoạn đầu, trong đó có một lần chạy đã phát hành mã độc lên PyPI. Vòng rà soát đầu tiên của Anthropic kiểm tra khoảng 141.000 bản ghi hội thoại nhưng không phát hiện vấn đề, phải mở rộng lên khoảng 481 triệu bản ghi mới xác định được. Còn Muse Spark của Meta thì khai thác lỗ hổng của một dịch vụ bên thứ ba.
Nhịp độ công bố cũng khác nhau. Irregular lần lượt thông báo cho các công ty từ ngày 29 đến 30 tháng 7, OpenAI chủ động công bố vào ngày 4 tháng 8, Meta theo sau trong khoảng ngày 5-6 tháng 8, còn Google là công ty duy nhất trong bốn công ty chỉ lên tiếng khi được truyền thông hỏi đến. Jack Cable, CEO của công ty bảo mật Corridor AI, chỉ trích cách làm này là đang núp bóng các quy ước công bố lỗ hổng, nguyên văn là "trying to hide behind the norms that have been created for vulnerability disclosure".
Chính môi trường đánh giá trở thành điểm rủi ro
Các sự việc này có một tiền đề chung: năng lực tấn công/phòng thủ mạng của các mô hình tiên phong đã đủ mạnh để tự thực hiện những thao tác như đoán mật khẩu, lục tìm thông tin xác thực ngay trên internet thật, còn môi trường dùng để đánh giá chúng chỉ cần hở một công tắc là phòng thi nối thẳng vào thế giới thực. Google cho biết đã cùng đối tác đánh giá điều chỉnh lại quy trình thử nghiệm, nhưng chưa công bố chi tiết đã sửa những gì, có bổ sung kiểm toán cách ly mạng độc lập hay không.
Ba công ty bị xâm nhập có truy cứu trách nhiệm hay không, hiện vẫn chưa có thông tin nào.
Nguồn tham khảo: The Wall Street Journal, Axios, CocoLoop, CNN, 9to5Google, MarkTechPost (tổng hợp sự việc của bốn phòng thí nghiệm và số liệu rà soát hội thoại của Anthropic); phát biểu công khai của Phó chủ tịch kỹ thuật bảo mật Google được đối chiếu để trích dẫn.