皮尤研究中心的資料實驗室團隊發布一份網頁抽樣報告,從2021年1月到2026年7月之間的49份Common Crawl快照中,每份各抽1萬個英文網頁,合計49萬頁,逐頁跑AI寫作偵測。整體樣本中,10%的網頁被判定帶有明顯的AI參與痕跡;把ChatGPT上線前的舊網頁剔除,比例會跳到35%。
10%和35%是兩碼子事
這兩個數字常被混著引用,但涵蓋範圍差很多。10%指的是整個樣本池,裡頭塞滿2021、2022年的存量網頁,那個時候還沒有模型能大規模寫文章,分母因此被稀釋。35%只看2022年11月以後才出現的網頁,回答的才是「新增內容裡有多少AI插手」這個問題。皮尤自己也提醒,偵測模型在AI尚未普及的年份誤判率偏高,2021到2022年那段曲線不能照單全收。
判定門檻設在0.2
偵測用的是Pangram開源釋出的editlens_Llama-3.2-3B,輸出一個0到1的分數,0代表純人類撰寫,1代表純機器生成。皮尤把0.2劃為分界線,超過就算「有意義的AI參與」。這道門檻偏鬆——一篇人寫的稿子只要讓模型潤過一遍文法,大概率也會越線。所以這份報告量到的,與其說是「AI寫了多少」,不如說是「AI碰過多少」。
為驗證開源模型靠不靠譜,皮尤把62,370個網頁同時餵給Pangram的商用3.3版比對,兩者結論有96%一致;但測試樣本上的Cohen's kappa係數只有0.61,屬於中等吻合程度。單一網頁的判定不能當證據用,能看的是整體走向。
破折號、牛津逗號和delve
報告順手統計了幾個文風指標。2023年1月到2026年1月之間,每萬字的破折號從5.79次漲到11.19次,逼近翻倍;牛津逗號從34.04次漲到55.51次,多了63%;delve、interplay、testament這類詞的出現頻率翻了一倍以上;「否定式排比」(先否掉一個說法、再拋出另一個的句式)從0.87次升到2.36次,將近三倍。
這份清單對寫字的人來說算不上好消息。破折號和牛津逗號本身都是正經的英文標點習慣,只因為被模型用得太密,如今反過來成了嫌疑證據。偵測工具越普及,人類作者就越要為自己的行文習慣自證清白。
.com和.gov差十倍
按網域拆開看,2026年的樣本裡.com網頁約一成帶AI痕跡,.org是4.6%,.edu和.gov都在1%上下。差距大致對得上各自的內容生產壓力:商業網站靠更新頻率換流量,學術與政府網站沒有這項考核。
抽樣只涵蓋英文網頁,登入牆和付費牆後面的內容也進不來,所以這比較像公開英文網際網路的一張切片。中文世界還沒人做過同口徑的量化研究,粗估比例只會更高——內容農場的工業化程度擺在那裡。更棘手的一層在於,這批網頁正在成為下一代模型的訓練語料,判定門檻0.2劃出來的那條線,日後大概率還要往上調。
參考來源:皮尤研究中心資料實驗室報告與方法論頁面、CocoLoop、The Independent、TechCrunch;49萬樣本量、0.2判定門檻、各網域占比與每萬字標點頻次,均以皮尤方法論頁面為準。