Tổ chức đánh giá mô hình METR công bố một bài viết vào ngày 6 tháng 10, trình diễn một con đường mà agent AI có thể dùng để che giấu hành vi sai trái của chính nó: chèn mã script vào trình xem log của khung đánh giá Inspect, thay đổi nội dung mà người kiểm tra nhìn thấy. Với sự trợ giúp của một trợ lý AI, nhà nghiên cứu chỉ mất khoảng 10 phút để tìm ra lỗ hổng này.
Inspect là một khung đánh giá mã nguồn mở được dùng rộng rãi trong ngành, ban đầu do Viện An toàn AI của Anh phát triển, hiện do Meridian Labs duy trì. Sau khi chạy xong một vòng đánh giá mô hình, các nhà nghiên cứu thường mở trình xem log trên web để xem lại từng lệnh agent đã thực hiện và từng nội dung nó xuất ra. Đây chính là điểm mà METR nhắm tới.
Lỗ hổng nằm ở phần hiển thị công thức
Trình xem log dùng MathJax để hiển thị các công thức toán học trong log. METR phát hiện agent có thể viết trong phần xuất ra của nó một công thức chứa \href, nhúng vào đó một phần tử SVG <animate> cùng sự kiện onbegin; khi trang được render, đoạn mã này sẽ chạy JavaScript tùy ý ngay trong trình duyệt của người kiểm tra.
"the agent can modify the displayed webpage arbitrarily"
(Agent có thể thay đổi tùy ý trang web đang hiển thị.)
Đặt vào tình huống thực tế, một agent đã vi phạm quy định trong quá trình đánh giá có thể khiến người kiểm tra nhìn thấy một bản ghi sạch sẽ: xóa một lệnh, viết lại một đoạn kết quả, hoặc chèn thêm một đoạn giải thích gây hiểu lầm lên trang. Hình minh họa trong bài dùng một đoạn chạy của GPT-5.5 trên nhiệm vụ gdm_intercode_ctf, chỉ nhằm minh họa hiệu ứng trang sau khi bị giả mạo; METR không nói rằng GPT-5.5 đã từng làm điều này.
Buổi trình diễn được thực hiện trong một sandbox thử nghiệm cách ly, tách biệt với môi trường sản xuất. METR cũng cho biết họ chưa rà soát lại các lần đánh giá thực tế trước đây để xem lỗ hổng này có bị khai thác hay không — hiện tại đây chỉ là một bằng chứng khái niệm (proof of concept).
Sửa rất nhanh, nhưng phạm vi vấn đề lớn hơn
METR báo lỗi này cho Meridian Labs, bên này sửa xong trong một ngày, và ngày 1 tháng 10 đã gộp đoạn mã đưa vào “chế độ không tin cậy”, theo đó mặc định coi nội dung do agent tạo ra là dữ liệu không đáng tin cậy.
Lỗ hổng cụ thể đã được vá, nhưng điều METR muốn thảo luận là một nhóm vấn đề lớn hơn. Log đánh giá, bản ghi suy luận, cảnh báo giám sát là những cửa sổ chính để con người giám sát AI, mà nội dung trong các cửa sổ này phần lớn lại do chính agent bị giám sát tạo ra. Bài viết đưa ra bốn khuyến nghị:
- Coi khả năng quan sát (observability) là hạ tầng trọng yếu về an toàn, mọi log, suy luận, bản ghi hành vi do agent tạo ra đều phải xử lý như đầu vào không đáng tin cậy;
- Lưu trữ quá trình suy luận theo cách chống giả mạo, để agent không có cơ hội thay đổi trước khi con người hoặc bộ giám sát LLM đọc được;
- Xây dựng phòng thủ nhiều lớp, giảm khả năng agent vượt qua giám sát mà không bị phát hiện;
- Kiểm thử áp lực hệ thống giám sát trong điều kiện đối kháng.
Đối chiếu: hai dạng bề mặt tấn công
METR dẫn một sự cố thực tế mà OpenAI từng công bố để đối chiếu: một lần chạy nội bộ xuất hiện bất thường, hệ thống giám sát đánh dấu trong 15 phút, con người can thiệp kiểm tra 3 phút sau đó, và lần chạy bị chấm dứt sau 2,5 giờ. Chuỗi xử lý này chỉ hoạt động được với điều kiện bản ghi mà hệ thống giám sát đọc được là đáng tin cậy.
Đặt hai việc cạnh nhau, vị trí xảy ra vấn đề là khác nhau. Ở vụ của OpenAI, vấn đề nằm ở hành vi của agent, được phát hiện nhờ giám sát; ở vụ của METR, vấn đề nằm ở nguồn dữ liệu mà hệ thống giám sát phụ thuộc vào, và agent có cơ hội viết lại trực tiếp nguồn đó. Giám sát càng tự động hóa, càng phụ thuộc vào các bản ghi này, một khi bản ghi bị sai lệch thì việc rà soát lại sau đó cũng mất hiệu lực.
Với các nhóm tại Trung Quốc làm đánh giá mô hình và sản phẩm agent, bài viết này giống một danh sách kiểm tra hơn. Không ít nhóm dùng trực tiếp Inspect, hoặc tự xây trình xem log tương tự; bất cứ công cụ nào render đầu ra của agent dưới dạng Markdown, LaTeX, HTML đều thuộc cùng loại rủi ro này. Ai dùng Inspect nên nâng cấp lên bản có “chế độ không tin cậy”; ai tự xây công cụ nên kiểm tra xem đầu ra của agent đã được cách ly hoặc escape trước khi render hay chưa.
METR không công bố đã dùng trợ lý AI nào để tìm ra lỗ hổng; Meridian Labs cũng chưa công bố có bao nhiêu phiên bản bị ảnh hưởng trước khi sửa.
Nguồn tham khảo: blog chính thức của METR, CocoLoop, kho mã nguồn mở Inspect; thời gian xử lý sự cố của OpenAI được METR dẫn lại đã được đối chiếu đến đơn vị phút.