一句话总结
皮尤研究中心(Pew Research)8 月 20 日发布的一项研究给出了一组令人不安的数字:ChatGPT 发布之后发布的网页中,超过三分之一(35%)带有 AI 撰写的痕迹;而在包含 ChatGPT 之前旧页面的全样本里,这一比例约为 10%。更刺眼的是,
.com域名的 AI 撰写率大约是.edu/.gov的 10 倍。我们正在进入一个「机器人读机器人写的网页」的时代。
这组数字意味着什么
皮尤的这份报告来得并不孤立。就在它发布前不久,互联网基础设施服务商 Cloudflare 刚刚宣布:bot(机器人)流量已经超过人类流量——而且这个里程碑比该公司预估的来得更早。
但两者关注的对象恰恰相反:
- Cloudflare 关心的是「谁在浏览网页」——答案:越来越多是机器人;
- Pew 关心的是「谁在写网页」——答案:越来越多也是机器人。
合在一起,一句话概括这个正在成型的现实:机器人在大量阅读其他机器人写的网页。

研究是怎么做的
要理解这份数据的可信度,先看方法。Pew 的流程并不复杂,但足够严谨:
- 用 Common Crawl 网络档案库收集近 50 万个英文网页,时间跨度约五年(从 ChatGPT 2022 年 11 月发布前两三年开始);
- 用 Open Pangram 的技术识别哪些页面「很可能由 AI 撰写或重度编辑」;
- 先看随机抽样的 1 万页(2026 年 7 月采集),再筛选掉 ChatGPT 发布前的旧页面,看「新网页」里的比例。

关键结论分两层:
- 随机样本(含旧页面):约 10% 显示「显著 AI 撰写迹象」;
- 只看 ChatGPT 后发布的新网页:这一比例飙升到 35%。
为什么差距这么大?Pew 的解释很直白:随机样本里混进了大量「AI 写作工具诞生之前」就存在的旧页面,它们天然不可能是 AI 写的,于是稀释了整体数字。把目光聚焦到「ChatGPT 之后的世界」,35% 才是更接近真实的现状。
一个更扎心的细节:域名分化
如果把视线从「页面」下沉到「域名」,结论更耐人寻味:
| 域名类型 | AI 撰写率 |
|---|---|
.com | 约 35%(约 .edu/.gov 的 10 倍) |
.org | 4.6% |
.edu | 约 1% |
.gov | 约 1% |
商业 .com 域名的 AI 撰写率是教育和政府域名的 10 倍左右。 这背后是清晰的动机结构:.com 大多以流量、变现、SEO 为驱动,AI 生成内容的「性价比」极高;而 .edu / .gov 受制于学术规范与机构审核,AI 滥用的空间小得多。
对普通读者来说,这组数据传递的信号很明确:当你在网上搜索时,最容易被你看到的那些商业站点,恰恰是最可能由 AI 生产的内容。
AI 写作的「痕迹」信号
Pew 还观察到一个有意思的细节:一些被认为能「暴露 AI 写作」的语言特征,这些年也在逐年增多——比如:

- 破折号(em dash) 的使用频率;
- 牛津逗号(Oxford comma) 的出现;
- 「不是 X,而是 Y」 这类模板化句式。
这些特征当然不能单独作为「AI 写作」的铁证——皮尤也坦承,Pangram 这类检测工具会把一些人类写的页面误判为 AI 生成。但在大规模数据上,方向性结论是可靠的:这些「语言指纹」的整体上升,与 AI 写作工具的普及在时间线上高度吻合。
从「内容泛滥」到「信任危机」
如果把这组数据放到更大的图景里,它指向的是一场正在发生的内容信任危机:

- 内容泛滥:35% 的新网页由 AI 撰写,内容的边际成本趋近于零;
- 质量稀释:低质、重复、模板化的内容挤占了高质量原创的空间;
- 读者信任流失:真假难辨,读者对「网页上看到的东西」整体信任度下降;
- 检测与溯源兴起:AI 检测工具、隐形水印、内容溯源标记(如 Claude 的 SynthID 文本水印)开始成为对抗手段。
对我们这个 AI 工具导航站来说,这组数据既是警示也是镜子:在一个人人都能一键生成内容的时代,「可信」本身成了稀缺资源。 读者最终会用脚投票,流向那些能提供真实、准确、可溯源内容的地方。
内容创作者该怎么办
面对这场洪水,与其焦虑「AI 抢了我的活」,不如想清楚一件事:AI 让「生产内容」变便宜,但「让人相信你」变贵了。
- 真实经验是护城河:AI 写不出你没经历过的踩坑、没验证过的结论。把「我实测过」「我遇到过这个问题」写进内容,就是最好的 AI 检测;
- 署名与溯源:清楚地署名、标注数据来源、给出可验证的事实,这些「人味」正是 AI 内容最难模仿的部分;
- 别和 AI 拼产量:AI 能在 10 秒内产出 10 篇平庸文章,但你花 10 小时写的 1 篇有洞见的文章,才是 AI 取代不了的东西;
- 拥抱检测与溯源工具:如果平台开始推行隐形水印和溯源标记,主动接入反而能成为你的信用加分项。
总结
- 35% vs 10%:只看 ChatGPT 后发布的新网页,超三分之一带有 AI 撰写痕迹;全样本(含旧页面)约 10%。
- 方法可靠:Pew 用 Common Crawl 采集近 50 万英文网页 + Open Pangram 检测,方向性结论可信。
- 域名分化显著:
.com的 AI 撰写率约为.edu/.gov的 10 倍,商业流量站是重灾区。 - 大背景:Cloudflare 报告 bot 流量已超人类流量——「机器人读机器人写的内容」正在成为现实。
- 应对之道:AI 让生产变便宜、让信任变贵,真实经验、署名溯源、独特洞见才是内容创作者的护城河。
数据与内容来源:Pew Research《A third of web pages published since ChatGPT’s launch show signs of AI authorship》(2026-08-20),转引自 TechCrunch 报道。