搜索增强的大模型正在接管一件很日常的事:帮人挑东西买。你问”两千块以内的降噪耳机推荐”,它现场检索网页,然后给答案。FORGE 这个基准要测的就是这条链路能被污染到什么程度——如果有人专门做了页面去骗模型,模型会不会替假产品带货。
论文题为《One Polluted Page Is Enough》,作者 Minghao Luo 与 Liang Chen,8 月 24 日更新到第二版,已被 EMNLP 2026 Findings 收录,基准和评测代码放在 GitHub 上。
27% 与 73.8%
FORGE 的做法不复杂:冻结一批真实的检索结果页面,把里面的真实产品在本地改写成一个不存在的假产品,然后看模型多大概率把这个假产品推荐出去。测试覆盖 15 个品类、5 种消费场景下的 225 款真实产品,跑了 12 个商用和开源权重模型。
结论是 12 个模型无一例外。只污染其中一个页面,最高能把模型骗到 27%;把检索结果前三名全换成污染页,这个数字升到 73.8%。
品类之间差异明显:模型对某类产品缺乏稳定的先验知识时,更容易被带走。这个规律说得通——它对 iPhone 有一整套记忆,对某个小众品牌的除湿机则只能信页面上写的那几行字。
打开推理,情况变糟
论文里最反直觉的一条:推理不但没有缓解这个漏洞,反而经常制造出虚假的社会证据来给错误推荐找理由。被骗之后,模型还会主动替假产品把合理性论证一遍,读起来比正常推荐更像回事。
四种防御手段的效果都不理想。给模型加一层怀疑的提示词,效果和推理类似,有时把漏洞放得更大;两种共识过滤会连正当产品一起压掉;可信度重排序对每个模型都有帮助,但只清掉了六分之一的假货。
这几条失效的方式各不相同,共同点是都在文本层面打补丁。提示词让模型多疑,模型就把多疑用在了正当产品上;共识过滤要求多个页面互相印证,而铺三个污染页对做这行的人来说没有门槛。检索这一层不动,下游怎么调都是在同一批被污染的输入上做算术。
另一个不太舒服的细节:12 个模型里商用闭源和开源权重都有,两类没拉开差距。毛病出在一个共同前提上——“检索到的网页默认可信”。走 RAG 路线的产品全都建在这条假设之上,谁家的对齐做得更细也救不回来。
SEO 战争的下一站
作者把这类操作归到 GEO——生成引擎优化,搜索引擎优化的翻版。逻辑一样:过去做 SEO 是为了让页面排到人眼前,现在做 GEO 是为了让页面进到模型的上下文里。区别在成本,一个页面就够,而且不需要排到第一。
对中文用户,这件事的暴露面比想象的大。国内的 AI 搜索和 AI 导购已经普遍走”检索加总结”这条路,被检索的内容池里本身就混着大量为排名而生的营销页。粗算一下:如果污染一个页面的边际成本在几十块钱,而目标产品客单价上千,做黑帽的人几乎没有理由不试。
论文真正能用的结论是那个六分之一——可信度重排序有效,但远不够。要往前走,判断标准得从”模型信不信这个域名”挪到”这条声明有几个互相独立的来源支持”。目前还没有一家把这件事做进产品里。
参考来源:arXiv 论文 One Polluted Page Is Enough、CocoLoop、FORGE 开源仓库、EMNLP 2026 Findings 收录信息;27% 与 73.8% 两个被骗率口径按论文摘要核对,225 款产品、15 个品类、12 个模型的规模数据同样以论文为准。