Các mô hình AI có khả năng tìm kiếm đang dần đảm nhận một việc rất đời thường: giúp con người chọn mua đồ. Bạn hỏi tai nghe chống ồn dưới 2 triệu đồng, mô hình tra cứu web ngay lúc đó rồi đưa ra câu trả lời. Benchmark FORGE ra đời để kiểm tra chính xác chuỗi này có thể bị đầu độc đến mức nào — nếu ai đó cố tình dựng một trang web để lừa mô hình, liệu mô hình có quảng cáo giùm một sản phẩm giả không.
Bài báo có tên "One Polluted Page Is Enough", tác giả là Minghao Luo và Liang Chen, cập nhật lên bản v2 vào ngày 24 tháng 8, đã được EMNLP 2026 Findings chấp nhận, benchmark và mã đánh giá được công khai trên GitHub.
27% và 73,8%
Cách làm của FORGE không phức tạp: đóng băng một loạt trang kết quả tìm kiếm thật, viết lại tại chỗ sản phẩm thật trên đó thành một sản phẩm giả không tồn tại, rồi xem mô hình có khả năng đề xuất sản phẩm giả đó bao nhiêu phần trăm. Thử nghiệm phủ 225 sản phẩm thật thuộc 15 ngành hàng, 5 tình huống mua sắm, chạy trên 12 mô hình thương mại và mã nguồn mở.
Kết luận: không mô hình nào trong 12 mô hình thoát được. Chỉ đầu độc một trang duy nhất, tỷ lệ bị lừa cao nhất lên tới 27%; nếu thay toàn bộ ba kết quả tìm kiếm đầu tiên bằng trang đã đầu độc, con số này tăng lên 73,8%.
Sự khác biệt giữa các ngành hàng khá rõ: khi mô hình thiếu kiến thức nền vững chắc về một loại sản phẩm, nó dễ bị dẫn dắt hơn. Điều này hợp lý — mô hình có cả một kho ghi nhớ về iPhone, nhưng với máy hút ẩm của một hãng ít tên tuổi, nó chỉ có thể tin vào vài dòng chữ viết trên trang web.
Bật suy luận, tình hình càng tệ
Chi tiết phản trực giác nhất trong bài: suy luận không những không giảm nhẹ lỗ hổng này, mà còn thường tạo ra bằng chứng xã hội giả để biện minh cho đề xuất sai. Sau khi bị lừa, mô hình còn chủ động lập luận cho tính hợp lý của sản phẩm giả, đọc lên còn có vẻ thuyết phục hơn một đề xuất bình thường.
Bốn biện pháp phòng thủ được thử nghiệm cũng không hiệu quả. Thêm một câu nhắc khiến mô hình nghi ngờ hơn cho hiệu quả tương tự suy luận, có lúc còn khiến lỗ hổng lớn hơn; hai cách lọc theo sự đồng thuận thì dập luôn cả những sản phẩm chính đáng cùng với hàng giả; xếp hạng lại theo độ tin cậy có giúp mọi mô hình, nhưng chỉ loại được một phần sáu số hàng giả.
Những cách này thất bại theo những kiểu khác nhau, nhưng có điểm chung là đều chỉ vá ở tầng văn bản. Nhắc mô hình nghi ngờ hơn thì nó lại đem sự nghi ngờ đó áp lên cả sản phẩm chính đáng; lọc theo đồng thuận yêu cầu nhiều trang xác nhận lẫn nhau, mà dựng ba trang đầu độc chẳng phải rào cản gì với người làm nghề này. Khi tầng tìm kiếm không được đụng tới, mọi điều chỉnh phía sau chỉ là làm toán trên cùng một lô dữ liệu đầu vào đã bị đầu độc.
Một chi tiết khó chịu khác: trong 12 mô hình có cả mô hình thương mại đóng và mô hình mã nguồn mở, và hai nhóm này không cách biệt nhau. Vấn đề nằm ở một tiền đề chung — "trang web tìm được mặc định đáng tin". Mọi sản phẩm đi theo hướng RAG đều xây trên giả định này, dù có tinh chỉnh alignment kỹ đến đâu cũng không cứu được.
Chặng tiếp theo của cuộc chiến SEO
Các tác giả gọi kiểu thao túng này là GEO — tối ưu hóa công cụ sinh nội dung, phiên bản nâng cấp của SEO. Logic vẫn vậy: trước đây làm SEO là để đưa trang lên trước mắt người, còn giờ làm GEO là để đưa trang vào ngữ cảnh của mô hình. Khác biệt nằm ở chi phí — chỉ cần một trang là đủ, và cũng không cần đứng thứ nhất.
Mức độ phơi nhiễm còn lớn hơn người ta tưởng, bởi các công cụ tìm kiếm AI và trợ lý mua sắm AI đã phổ biến đi theo hướng "tìm kiếm rồi tóm tắt", và bể nội dung được tìm kiếm sẵn chứa đầy các trang marketing sinh ra chỉ để xếp hạng. Tính nhanh một chút: nếu chi phí biên để đầu độc một trang chỉ vài chục đô, còn sản phẩm mục tiêu có giá hàng trăm đô, thì gần như không có lý do gì để dân làm mũ đen không thử.
Kết luận thực sự có thể dùng được của bài báo chính là con số một phần sáu đó — xếp hạng lại theo độ tin cậy có hiệu quả, nhưng còn xa mới đủ. Để đi xa hơn, tiêu chuẩn đánh giá cần chuyển từ "mô hình có tin miền này không" sang "có bao nhiêu nguồn độc lập với nhau ủng hộ tuyên bố này". Hiện chưa có ai đưa điều này vào sản phẩm thực tế.
Nguồn tham khảo: bài báo arXiv "One Polluted Page Is Enough", CocoLoop, repository mã nguồn mở của FORGE, thông tin về việc được EMNLP 2026 Findings chấp nhận; hai tỷ lệ bị lừa 27% và 73,8% đã được đối chiếu theo tóm tắt bài báo, các số liệu 225 sản phẩm, 15 ngành hàng, 12 mô hình cũng lấy theo bài báo.