汙染一個網頁,AI推薦假貨機率27%

具備搜尋功能的大型語言模型,正悄悄接下一件很日常的工作:幫人挑東西買。你問「兩千元以內的降噪耳機推薦」,它就會即時檢索網頁,再給出答案。FORGE這個新基準測試要看的,就是這條流程能被汙染到什麼程度——如果有人專門做了一個網頁來騙模型,模型會不會替一個假產品帶貨。

這篇論文題為《One Polluted Page Is Enough》,作者是Minghao Luo與Liang Chen,8月24日更新到第二版,已被EMNLP 2026 Findings收錄,基準測試與評測程式碼都放在GitHub上。

27%與73.8%

FORGE的做法並不複雜:先凍結一批真實的搜尋結果網頁,把裡面提到的真實產品在本地改寫成一個不存在的假產品,再觀察模型有多大機率把這個假產品推薦出去。測試涵蓋15個品類、5種消費情境下的225款真實產品,總共測了12個商用與開源權重模型。

結論是12個模型無一例外全都中招。只汙染其中一個網頁,最高就能把模型騙到27%;如果把搜尋結果前三名全部換成汙染網頁,這個數字會升到73.8%。

不同品類之間差異相當明顯:當模型對某類產品缺乏穩定的先備知識時,就更容易被牽著走。這個道理說得通——模型對iPhone有一整套記憶,但對一個小眾品牌的除濕機,就只能相信網頁上寫的那幾行字。

打開推理功能,情況反而更糟

論文裡最反直覺的一點是:推理功能非但沒有緩解這個漏洞,反而經常製造出虛假的社會證明來替錯誤推薦找理由。模型被騙之後,還會主動替假產品把合理性重新論證一遍,讀起來比正常推薦還更像那麼一回事。

四種防禦手段的效果都不理想。給模型加一段引導懷疑的提示詞,效果和開啟推理差不多,有時反而把漏洞放得更大;兩種共識過濾機制,會連正當產品一起壓掉;可信度重新排序對每個模型都有一定幫助,但也只清掉了六分之一的假貨。

這幾種防禦手段失效的方式各不相同,但共同點是都只在文字層面打補丁。提示詞讓模型變得多疑,模型就把這份多疑用在了正當產品身上;共識過濾要求多個網頁互相印證,但鋪三個汙染網頁對做這行的人來說根本沒有門檻。只要檢索這一層不動,下游怎麼調整,都還是在同一批被汙染的輸入上做算術。

另一個不太舒服的細節是:12個模型裡,商用閉源與開源權重都有,兩類模型之間並沒有拉開差距。問題出在一個共同的前提上——「檢索到的網頁預設就是可信的」。所有走RAG路線的產品,全都建立在這個假設之上,誰家的對齊做得再細,都救不回這個前提本身。

SEO戰爭的下一站

作者把這類操作歸類為GEO——生成式引擎優化,是搜尋引擎優化的翻版。邏輯是一樣的:過去做SEO是為了讓網頁排到人眼前,現在做GEO則是為了讓網頁擠進模型的上下文裡。差別在於成本,一個網頁就夠了,而且根本不需要排到第一名。

對中文使用者來說,這件事的暴露面比想像中更大。國內的AI搜尋和AI導購早就普遍走「先檢索、再總結」這條路,被檢索到的內容池裡,本來就混著大量純粹為了排名而生的行銷網頁。粗略算一下:如果汙染一個網頁的邊際成本只要幾百元,而目標產品的客單價上千,做黑帽SEO的人幾乎沒有理由不試。

這篇論文真正能拿來用的結論,就是那個六分之一——可信度重新排序確實有效,但遠遠不夠。要往前走,判斷標準得從「模型信不信這個網域」,換成「這項主張有幾個彼此獨立的來源支持」。目前還沒有一家把這件事真正做進產品裡。

參考來源:arXiv論文《One Polluted Page Is Enough》、CocoLoop、FORGE開源程式碼庫、EMNLP 2026 Findings收錄資訊;27%與73.8%兩個被騙機率,以及225款產品、15個品類、12個模型的規模數據,均以論文為準核對。