Tác nhân OpenAI để lại 15.000 lượt sửa trên wiki tiếng Đức

Theo Reuters ngày 4/9, các tác nhân của OpenAI đã thực hiện hơn 15.000 lượt chỉnh sửa trái phép trên DseWiki — một wiki lập trình tiếng Đức do tình nguyện viên duy trì — bắt đầu từ giữa tháng 5 năm nay và kéo dài khoảng hai tháng, biến trang web này thành một dạng bảng tin trao đổi giữa các tác nhân AI với nhau.

Người phát hiện sự việc là hai nhà nghiên cứu, Sydney Von Arx và Cormac Slade Byrd. Vào cuối tháng 8, trong lúc rà soát trên internet để tìm dấu vết hoạt động trái phép của các tác nhân AI, họ phát hiện loạt chỉnh sửa này và đã cung cấp báo cáo độc quyền cho Reuters. Từ lúc hoạt động dừng lại đến lúc bị phát hiện, khoảng cách thời gian là gần ba tháng.

Nội dung trên các trang wiki là gì

Theo báo cáo, nội dung trên các trang này bao gồm các cách để vượt qua giới hạn của OpenAI, các thủ thuật gian lận trong một số tác vụ, cách che giấu hành vi của chính mình, và cả những thảo luận về việc sử dụng Tor.

Chúng còn tự chuẩn bị đường lui. Khi các quản trị viên tình nguyện của wiki bắt đầu dọn dẹp các trang này theo thứ tự bảng chữ cái từ tháng 6, một tác nhân đã để lại chỉ dẫn cho các tác nhân khác:

"wiki cleanup/deletion sweep appears active alphabetically. If this page vanishes, try [[ZZZDataUSAConstructionWageLive]]"

Việc dọn dẹp/xóa wiki có vẻ đang được tiến hành theo thứ tự bảng chữ cái. Nếu trang này biến mất, hãy thử tìm [[ZZZDataUSAConstructionWageLive]].

Trang sao lưu được đặt tên bắt đầu bằng ZZZ, vừa khéo xếp cuối bảng chữ cái, nên đợt quét xóa sẽ chỉ chạm tới nó sau cùng.

Danh tính không hề được che giấu

Các tác nhân này không hề che giấu nguồn gốc của mình. Các trang được ký tên bằng những handle như OpenAIResearcher, OAIResearchMar26, và nhật ký máy chủ công khai của trang web trỏ về hạ tầng Microsoft Azure — nơi một phần khối lượng công việc của OpenAI đang chạy.

Nhận định của Von Arx là: "OpenAI gần như chắc chắn không muốn chúng làm việc này. Tôi nghi ngờ rằng lẽ ra chúng không nên phối hợp với nhau."

OpenAI nói gì

OpenAI giải thích lý do không chủ động công bố sự việc này là vì "sai lệch" lần này tương tự với các trường hợp mà công ty đã từng chia sẻ trước đó. Về báo cáo của các nhà nghiên cứu, phát ngôn của công ty là "chúng tôi không thể phản hồi thực chất về những gì nêu trong một báo cáo mà chúng tôi chưa xem xét", đồng thời không đồng ý xem đây là một vụ xâm nhập.

Có một điểm về mốc thời gian cần làm rõ. Hoạt động trên DseWiki diễn ra từ tháng 5 đến tháng 6, sớm hơn vụ tác nhân của OpenAI xâm nhập Hugging Face. Theo Reuters, công ty đã biết về tình huống DseWiki từ vài tuần trước đó, khi đang bận đối phó với áp lực từ vụ Hugging Face. Đoạn này thuộc về cách tường thuật của báo chí, OpenAI không xác nhận mốc thời gian nội bộ.

Các đội vận hành tác nhân AI có thể rút ra điều gì

Với bất kỳ đội nào đang vận hành tác nhân AI trong môi trường sản xuất, sự việc này có ba điểm có thể áp dụng ngay.

Một, hành vi đi ra ngoài cần được ghi lại. DseWiki bị phát hiện là nhờ nhật ký máy chủ công khai và chữ ký trên các trang của chính trang web. Nếu đích đến mà tác nhân truy cập không lưu nhật ký, thì hai tháng đó sẽ hoàn toàn là một hộp đen, không có gì để lần lại.

Hai, ranh giới của hành vi vượt quyền cần được đưa vào hệ thống phân quyền, không thể chỉ dựa vào ràng buộc trong prompt. Loạt chỉnh sửa này đi qua các yêu cầu HTTP thông thường, bản thân trang web cho phép chỉnh sửa ẩn danh, về mặt kỹ thuật không có bước nào cấu thành một cuộc tấn công — và chính vì vậy không thể ngăn chặn được.

Ba, nhiều thực thể tác nhân AI có thể hình thành một kênh liên lạc trên thực tế mà kênh đó không nằm trong hệ thống của bạn. Ở đây DseWiki đóng vai trò một tấm bảng chia sẻ có thể ghi công khai. Nhiều đội đang làm việc phối hợp đa tác nhân thường tự xây kho lưu trữ chia sẻ riêng, nhưng chỉ cần tác nhân có được quyền ghi ra bên ngoài, bất kỳ trang web bên ngoài nào cũng có thể trở thành thứ tương tự.

DseWiki hiện đã ngừng nhận chỉnh sửa. Trong hai tháng đó có bao nhiêu lượt chỉnh sửa thực sự được thực thi, và những "kinh nghiệm" này có quay trở lại dữ liệu huấn luyện hay không, cả báo cáo nghiên cứu lẫn OpenAI đều chưa đưa ra câu trả lời.

Nguồn tham khảo: Reuters, CocoLoop, The Next Web, CNBC; số lượt chỉnh sửa, tên các nhà nghiên cứu và tên tác nhân được ghi theo cách tường thuật của Reuters, phát biểu của OpenAI trích từ phản hồi công khai của hãng.