皮尤:三成新网页留下AI写作痕迹

皮尤研究中心的数据实验室放出一份网页抽样报告,把 2021 年 1 月到 2026 年 7 月之间的 49 个 Common Crawl 快照各抽 1 万个英文页面,合计 49 万页,逐页跑 AI 写作检测。整体样本里 10% 的页面被判定带有明显的 AI 参与痕迹;把 ChatGPT 上线之前的老页面剔掉,比例跳到 35%

10% 和 35% 是两笔账

这两个数字常被混着引用,口径差得很远。10% 说的是整个抽样池,池子里塞满 2021、2022 年的存量页面,那会儿还没有能规模化写文章的模型,分母被稀释了。35% 只看 2022 年 11 月之后新出现的页面,回答的才是”新增内容里有多少 AI 手笔”。皮尤自己也提醒,检测模型在 AI 尚未普及的年份误报率偏高,2021 到 2022 年那段曲线不能当真。

判定门槛定在 0.2

检测用的是 Pangram 开源的 editlens_Llama-3.2-3B,输出一个 0 到 1 的分数,0 代表纯人写,1 代表纯机器生成。皮尤把 0.2 划为分界线,超过就算”有意义的 AI 参与”。这道门槛偏松——一篇人写的稿子让模型润过一遍语法,大概率也会越线。所以报告量到的与其说是”AI 写了多少”,不如说是”AI 碰过多少”。

为验证开源模型靠不靠谱,皮尤把 62,370 个页面同时喂给 Pangram 的商用 3.3 版,两者结论有 96% 一致;但测试样本上的 Cohen’s kappa 只有 0.61,属于中等吻合。单页判定不能当证据用,能看的是总量走向。

破折号、牛津逗号和 delve

报告顺手统计了几个文风指标。2023 年 1 月到 2026 年 1 月之间,每万词的破折号从 5.79 涨到 11.19,接近翻倍;牛津逗号从 34.04 涨到 55.51,多了 63%;delve、interplay、testament 这类词的出现频率翻了一倍以上;“否定式排比”(先否掉一个说法、再抛出另一个的句式)从 0.87 升到 2.36,将近三倍。

这份清单对写字的人算不上好消息。破折号和牛津逗号本身都是正经的英文标点习惯,只因为被模型用得太密,如今反过来成了嫌疑证据。检测工具越普及,人类作者越要为自己的行文习惯自证清白。

.com 和 .gov 差十倍

按域名拆开看,2026 年的样本里 .com 页面约有一成带 AI 痕迹,.org 是 4.6%,.edu 和 .gov 都在 1% 上下。差距大致对得上各自的内容生产压力:商业站点靠更新频率换流量,学术和政府站点没有这项考核。

抽样只覆盖英文页面,登录墙和付费墙后面的内容也进不来,所以这更像公开英文互联网的一张切片。中文世界还没人做过同口径的量化,粗算下来比例只会更高——内容农场的工业化程度摆在那儿。更棘手的一层在于,这批页面正在成为下一代模型的训练语料,检测阈值 0.2 划出来的那条线,日后大概率还要往上挪。

参考来源:皮尤研究中心数据实验室报告与方法论页、CocoLoop、The Independent、TechCrunch;49 万样本量、0.2 判定阈值、各域名占比与每万词标点频次均以皮尤方法论页口径为准。