展开目录
#AI 内容#Pew Research#内容质量#AI 写作#数据研究

AI 内容泛滥警报:ChatGPT 之后,超三分之一网页已由 AI 撰写

皮尤研究中心最新研究显示,ChatGPT 发布后发布的网页中超过三分之一带有 AI 撰写痕迹,.com 域名是 .edu/.gov 的 10 倍。本文拆解研究方法、关键数据、AI 写作的「痕迹」信号,以及这场内容洪水对读者、出版商和内容创作者的冲击与应对。

预计阅读 6 分钟

一句话总结

皮尤研究中心(Pew Research)8 月 20 日发布的一项研究给出了一组令人不安的数字:ChatGPT 发布之后发布的网页中,超过三分之一(35%)带有 AI 撰写的痕迹;而在包含 ChatGPT 之前旧页面的全样本里,这一比例约为 10%。更刺眼的是,.com 域名的 AI 撰写率大约是 .edu / .gov 的 10 倍。我们正在进入一个「机器人读机器人写的网页」的时代。


这组数字意味着什么

皮尤的这份报告来得并不孤立。就在它发布前不久,互联网基础设施服务商 Cloudflare 刚刚宣布:bot(机器人)流量已经超过人类流量——而且这个里程碑比该公司预估的来得更早。

但两者关注的对象恰恰相反:

  • Cloudflare 关心的是「谁在浏览网页」——答案:越来越多是机器人;
  • Pew 关心的是「谁在写网页」——答案:越来越多也是机器人。

合在一起,一句话概括这个正在成型的现实:机器人在大量阅读其他机器人写的网页。

Pew Research:网页中「AI 撰写」占比对比


研究是怎么做的

要理解这份数据的可信度,先看方法。Pew 的流程并不复杂,但足够严谨:

  1. Common Crawl 网络档案库收集近 50 万个英文网页,时间跨度约五年(从 ChatGPT 2022 年 11 月发布前两三年开始);
  2. Open Pangram 的技术识别哪些页面「很可能由 AI 撰写或重度编辑」;
  3. 先看随机抽样的 1 万页(2026 年 7 月采集),再筛选掉 ChatGPT 发布前的旧页面,看「新网页」里的比例。

研究方法:从 Common Crawl 抓取到 Pangram 检测

关键结论分两层:

  • 随机样本(含旧页面):约 10% 显示「显著 AI 撰写迹象」;
  • 只看 ChatGPT 后发布的新网页:这一比例飙升到 35%

为什么差距这么大?Pew 的解释很直白:随机样本里混进了大量「AI 写作工具诞生之前」就存在的旧页面,它们天然不可能是 AI 写的,于是稀释了整体数字。把目光聚焦到「ChatGPT 之后的世界」,35% 才是更接近真实的现状。


一个更扎心的细节:域名分化

如果把视线从「页面」下沉到「域名」,结论更耐人寻味:

域名类型AI 撰写率
.com约 35%(约 .edu/.gov 的 10 倍)
.org4.6%
.edu约 1%
.gov约 1%

商业 .com 域名的 AI 撰写率是教育和政府域名的 10 倍左右。 这背后是清晰的动机结构:.com 大多以流量、变现、SEO 为驱动,AI 生成内容的「性价比」极高;而 .edu / .gov 受制于学术规范与机构审核,AI 滥用的空间小得多。

对普通读者来说,这组数据传递的信号很明确:当你在网上搜索时,最容易被你看到的那些商业站点,恰恰是最可能由 AI 生产的内容。


AI 写作的「痕迹」信号

Pew 还观察到一个有意思的细节:一些被认为能「暴露 AI 写作」的语言特征,这些年也在逐年增多——比如:

AI 写作的「痕迹」信号

  • 破折号(em dash) 的使用频率;
  • 牛津逗号(Oxford comma) 的出现;
  • 「不是 X,而是 Y」 这类模板化句式。

这些特征当然不能单独作为「AI 写作」的铁证——皮尤也坦承,Pangram 这类检测工具会把一些人类写的页面误判为 AI 生成。但在大规模数据上,方向性结论是可靠的:这些「语言指纹」的整体上升,与 AI 写作工具的普及在时间线上高度吻合。


从「内容泛滥」到「信任危机」

如果把这组数据放到更大的图景里,它指向的是一场正在发生的内容信任危机:

从「内容泛滥」到「信任危机」的传导链条

  1. 内容泛滥:35% 的新网页由 AI 撰写,内容的边际成本趋近于零;
  2. 质量稀释:低质、重复、模板化的内容挤占了高质量原创的空间;
  3. 读者信任流失:真假难辨,读者对「网页上看到的东西」整体信任度下降;
  4. 检测与溯源兴起:AI 检测工具、隐形水印、内容溯源标记(如 Claude 的 SynthID 文本水印)开始成为对抗手段。

对我们这个 AI 工具导航站来说,这组数据既是警示也是镜子:在一个人人都能一键生成内容的时代,「可信」本身成了稀缺资源。 读者最终会用脚投票,流向那些能提供真实、准确、可溯源内容的地方。


内容创作者该怎么办

面对这场洪水,与其焦虑「AI 抢了我的活」,不如想清楚一件事:AI 让「生产内容」变便宜,但「让人相信你」变贵了。

  • 真实经验是护城河:AI 写不出你没经历过的踩坑、没验证过的结论。把「我实测过」「我遇到过这个问题」写进内容,就是最好的 AI 检测;
  • 署名与溯源:清楚地署名、标注数据来源、给出可验证的事实,这些「人味」正是 AI 内容最难模仿的部分;
  • 别和 AI 拼产量:AI 能在 10 秒内产出 10 篇平庸文章,但你花 10 小时写的 1 篇有洞见的文章,才是 AI 取代不了的东西;
  • 拥抱检测与溯源工具:如果平台开始推行隐形水印和溯源标记,主动接入反而能成为你的信用加分项。

总结

  • 35% vs 10%:只看 ChatGPT 后发布的新网页,超三分之一带有 AI 撰写痕迹;全样本(含旧页面)约 10%。
  • 方法可靠:Pew 用 Common Crawl 采集近 50 万英文网页 + Open Pangram 检测,方向性结论可信。
  • 域名分化显著.com 的 AI 撰写率约为 .edu / .gov 的 10 倍,商业流量站是重灾区。
  • 大背景:Cloudflare 报告 bot 流量已超人类流量——「机器人读机器人写的内容」正在成为现实。
  • 应对之道:AI 让生产变便宜、让信任变贵,真实经验、署名溯源、独特洞见才是内容创作者的护城河。

数据与内容来源:Pew Research《A third of web pages published since ChatGPT’s launch show signs of AI authorship》(2026-08-20),转引自 TechCrunch 报道。

Related

相关文章

延伸阅读

查看全部 →