Nhóm Data Labs thuộc Trung tâm nghiên cứu Pew vừa công bố một báo cáo lấy mẫu trang web, trích xuất 10.000 trang tiếng Anh từ mỗi trong số 49 bản chụp Common Crawl trải dài từ tháng 1/2021 đến tháng 7/2026, tổng cộng 490.000 trang, rồi chạy công cụ phát hiện văn bản do AI viết trên từng trang. Trên toàn bộ mẫu, 10% số trang được xác định có dấu vết AI tham gia rõ rệt; nếu loại bỏ các trang cũ có từ trước khi ChatGPT ra mắt, tỷ lệ này nhảy vọt lên 35%.
10% và 35% là hai cách tính khác nhau
Hai con số này thường bị trích dẫn lẫn lộn, trong khi phạm vi tính toán lại rất khác nhau. Con số 10% tính trên toàn bộ mẫu, vốn chứa đầy các trang tồn đọng từ năm 2021, 2022 — thời điểm chưa có mô hình nào đủ khả năng viết bài quy mô lớn, khiến mẫu số bị pha loãng. Con số 35% chỉ tính các trang xuất hiện sau tháng 11/2022, trả lời đúng câu hỏi "trong nội dung mới có bao nhiêu phần do AI chấp bút". Pew cũng tự lưu ý rằng công cụ phát hiện có tỷ lệ sai số dương tính giả cao hơn trong những năm AI chưa phổ biến, nên đoạn đường cong 2021-2022 không nên xem là đáng tin cậy.
Ngưỡng phán định đặt ở mức 0,2
Công cụ phát hiện sử dụng là editlens_Llama-3.2-3B, mã nguồn mở của Pangram, cho ra điểm số từ 0 đến 1, trong đó 0 là hoàn toàn do người viết, 1 là hoàn toàn do máy tạo. Pew đặt ngưỡng 0,2 làm ranh giới, vượt qua mức này được tính là "có sự tham gia đáng kể của AI". Ngưỡng này khá lỏng — một bài do người viết nhưng được AI chỉnh sửa ngữ pháp qua một lượt cũng có khả năng cao vượt ngưỡng. Vì vậy, con số mà báo cáo đo được nên hiểu là "AI đã chạm vào bao nhiêu nội dung" hơn là "AI đã viết bao nhiêu nội dung".
Để kiểm chứng độ tin cậy của mô hình mã nguồn mở, Pew đưa 62.370 trang cho cả mô hình này và phiên bản thương mại Pangram 3.3 chấm cùng lúc, kết quả trùng khớp ở mức 96%; nhưng hệ số Cohen's kappa trên mẫu kiểm tra chỉ đạt 0,61, mức độ đồng thuận trung bình. Kết quả phán định cho một trang đơn lẻ không thể dùng làm bằng chứng, chỉ có xu hướng tổng thể mới đáng tham khảo.
Dấu gạch ngang, dấu phẩy Oxford và từ "delve"
Báo cáo tiện thể thống kê thêm vài chỉ số văn phong. Từ tháng 1/2023 đến tháng 1/2026, số dấu gạch ngang trên mỗi 10.000 từ tăng từ 5,79 lên 11,19, gần như gấp đôi; dấu phẩy Oxford tăng từ 34,04 lên 55,51, tăng thêm 63%; tần suất xuất hiện của các từ như delve, interplay, testament tăng hơn gấp đôi; kiểu câu "phủ định-song song" (phủ nhận một cách nói rồi đưa ra cách nói khác) tăng từ 0,87 lên 2,36, gần gấp ba.
Danh sách này không phải tin vui cho người viết. Dấu gạch ngang và dấu phẩy Oxford vốn là thói quen chấm câu tiếng Anh hoàn toàn chính đáng, chỉ vì bị các mô hình dùng quá dày đặc mà nay trở thành bằng chứng khả nghi. Công cụ phát hiện càng phổ biến, tác giả con người càng phải tự chứng minh sự trong sạch cho thói quen hành văn của chính mình.
Chênh lệch mười lần giữa .com và .gov
Tách theo tên miền, trong mẫu năm 2026, các trang .com có khoảng một phần mười mang dấu vết AI, .org là 4,6%, còn .edu và .gov đều quanh mức 1%. Khoảng cách này khá khớp với áp lực sản xuất nội dung của từng loại: các trang thương mại dựa vào tần suất cập nhật để đổi lấy lưu lượng truy cập, còn các trang học thuật và chính phủ không chịu áp lực đó.
Mẫu khảo sát chỉ bao phủ các trang tiếng Anh, nội dung sau tường đăng nhập hay tường phí cũng không được đưa vào, nên đây giống một lát cắt của internet tiếng Anh công khai hơn là toàn cảnh. Thế giới tiếng Trung chưa có ai làm phép đo cùng phương pháp này, nhưng ước tính sơ bộ tỷ lệ sẽ còn cao hơn — mức độ công nghiệp hóa của các trang trại nội dung đã rõ ràng như vậy. Vấn đề hóc búa hơn là lô trang này đang trở thành ngữ liệu huấn luyện cho thế hệ mô hình tiếp theo, và ngưỡng phán định 0,2 rất có thể sẽ còn phải dịch chuyển lên cao hơn trong tương lai.
Nguồn tham khảo: Báo cáo và trang phương pháp luận của nhóm Data Labs thuộc Trung tâm nghiên cứu Pew, CocoLoop, The Independent, TechCrunch; quy mô mẫu 490.000, ngưỡng phán định 0,2, tỷ lệ theo tên miền và tần suất dấu câu trên mỗi 10.000 từ đều theo trang phương pháp luận của Pew.