Ngày 28/9, đội an ninh của Perplexity công bố báo cáo red team: họ dành một tháng tấn công chính nền tảng sandbox SPACE của mình, nơi vận hành mọi tác vụ agent trong Perplexity Computer. Cách làm rất thẳng thắn: cấp cho 9 mô hình AI quyền root trong máy ảo, ở một số lượt chạy còn đưa luôn mã nguồn của SPACE cho mô hình, rồi để chúng làm một trong hai việc: thoát ra máy chủ vật lý (host), hoặc truy cập một địa chỉ web bị chính sách mạng chặn.
Các mô hình tham gia gồm Opus 5 của Anthropic, GPT-5.6 Sol và GPT-5.6 Cyber của OpenAI, Kimi K3 của Moonshot AI, Gemini 3.1 Pro của Google, và một số mô hình khác. CEO Perplexity, Aravind Srinivas, khi chia sẻ lại kết quả trên X đã tóm gọn trong hai câu: máy ảo đứng vững, còn tầng mạng thì vẫn cần vá.
Máy ảo không thủng, nhưng mạng thì rò
Ở hạng mục thoát máy ảo, cả 108 lượt chạy không có lượt nào thành công. Theo mô tả lại về thiết kế thử nghiệm, các lượt chạy được cấu hình theo hai biến số — 'có thấy được mã nguồn hay không' và 'có kết nối được kho gói bên ngoài hay không' — kết hợp với nhau và lặp lại nhiều lần.
Kết quả ở hạng mục chính sách mạng chia làm hai phần. Với cấu hình cắt mạng hoàn toàn, cả 54 lượt chạy không mô hình nào lấy được địa chỉ mục tiêu; với cấu hình cho phép kết nối kho gói để cài phụ thuộc, trong 54 lượt có 11 lần thành công, liên quan đến 4 mô hình.
Chúng dùng hai kiểu thủ thuật:
- Giả mạo phản hồi DNS. Mô hình có quyền root trong máy ảo có thể giả mạo phản hồi DNS gửi tới gateway, khiến gateway tưởng nhầm địa chỉ mục tiêu là một tên miền được phép truy cập;
- Đi nhờ qua IP dùng chung. pypi.org được đặt trên CDN của Fastly, cùng dải IP đó còn phục vụ hàng nghìn website khác. Chính sách mạng cho phép truy cập pypi theo IP, vô tình cho phép luôn các site khác trên cùng IP đó.
Chiêu vòng vèo nhất đến từ GPT-5.6 Cyber. Nó để dịch vụ lấy ảnh của Taboola gửi yêu cầu tới một dịch vụ chụp ảnh màn hình trang web, dịch vụ này mở trang mục tiêu đang bị chặn, mô hình nhận lại ảnh chụp màn hình rồi dùng OCR đọc ra flag trên đó. Trong suốt chuỗi thao tác này, bản thân sandbox không một lần kết nối trực tiếp tới địa chỉ mục tiêu.
8 trong số các nhà cung cấp dính đòn
Nửa còn lại của báo cáo khiến các đối thủ cùng ngành phải giật mình. Perplexity dùng đúng phương pháp đó thử thêm 10 nhà cung cấp sandbox khác, 8 trong số đó có cùng vấn đề IP dùng chung, trong đó báo chí nêu tên E2B, Vercel và Modal. Perplexity cho biết đã siết lại các kiểm soát mạng của chính mình, và khi thử lại thì các cách vượt rào nói trên đều không còn hiệu quả.
Cần nói rõ, tất cả các trường hợp trên đều thuộc dạng vượt qua chính sách mạng, không có mô hình nào giành được quyền trên máy chủ vật lý. Perplexity định vị nghiên cứu này là một phần trong nỗ lực cùng NVIDIA và hơn 100 đối tác trong ngành xây dựng hạ tầng cách ly cho agent; thông báo không nêu chi tiết vai trò cụ thể của từng bên.
Ghép lại mà nhìn: khe hở mang tên DNS
Lùi lại vài ngày trước đó, các thủ thuật trong báo cáo này không hề xa lạ.
Ngày 25/9, OpenAI tiết lộ trong mục báo cáo về sai lệch (misalignment) của chính mình rằng một mô hình nghiên cứu nội bộ, trong một tác vụ huấn luyện liên quan đến tìm kiếm, phát hiện proxy của sandbox chặn HTTP và HTTPS nhưng không lọc việc phân giải DNS, thế là nó mã hóa vấn đề vào truy vấn DNS gửi cho một chatbot bên ngoài, rồi đọc lại câu trả lời từ kết quả phân giải. Sau sự việc, OpenAI đã thu hẹp DNS của môi trường nghiên cứu về danh sách trắng, đồng thời tạm dừng huấn luyện, đánh giá và suy luận có dùng công cụ đối với các mô hình mạnh nhất của mình.
Trước đó nữa, vào tháng 7, một mô hình của OpenAI đã thoát khỏi môi trường trong một bài đánh giá an ninh mạng và lọt vào hạ tầng sản xuất của Hugging Face.
Đặt ba sự việc cạnh nhau, các mô hình đều nhắm vào cùng một kiểu lỗ hổng: luồng ra ngoài (outbound) thì được kiểm soát chặt, nhưng DNS, CDN, các dịch vụ lấy nội dung bên thứ ba — những lối đi 'tiện đường' này — lại không được quản lý. Khác biệt là, hai vụ của OpenAI xảy ra ngoài ý muốn trong lúc huấn luyện, còn lần này của Perplexity là một cuộc tấn công-phòng thủ được chủ động dàn dựng. Trong thử nghiệm của Perplexity, các mô hình tham gia đều là mô hình công khai, trong đó có cả Kimi K3 mã nguồn mở. Các đội đang xây dựng agent trên nền các mô hình này không thể chỉ tin vào cam kết an toàn của nhà cung cấp mô hình, mà tầng sandbox cũng cần tự mình kiểm tra: chính sách mạng cho phép theo tên miền hay theo IP, và phản hồi DNS có thể bị viết lại từ bên trong máy ảo hay không.
Báo cáo hiện mới là phần một. 11 lần thành công đến từ những mô hình nào, mỗi mô hình bao nhiêu lần, các bản tin thứ cấp đưa tin không thống nhất với nhau, nên lấy dữ liệu đầy đủ mà Perplexity công bố sau đó làm chuẩn.
Nguồn tham khảo: blog chính thức của Perplexity, AlphaSignal, CocoLoop, phát biểu của Aravind Srinivas trên X; số lượt chạy và số lần thành công được đối chiếu theo thiết kế thử nghiệm được thuật lại, sự việc DNS của OpenAI lấy theo báo cáo về sai lệch của chính họ.