每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

ChatGPT发布后网页中35%含AI写作痕迹

皮尤研究中心分析Common Crawl 50万个网页样本…….com域名比.edu、.gov高出10倍

노트북 화면에 오픈AI 로고와 이름이 클로즈업되어 있다

이미지: TechCrunch AI

摘要

  • 皮尤研究中心分析了Common Crawl档案库中约50万个英文网页,发现在ChatGPT发布之后发布的网页中,有35%出现了AI写作痕迹。
  • 在2026年7月采集的1万个随机样本中,全部网页中有10%被判定为疑似AI写作,其中混入了ChatGPT出现之前的旧网页,导致比例偏低。
  • 按域名来看,.com的AI写作比例比.edu、.gov(各约1%)高出约10倍,.org为4.6%。
발행 주체
퓨리서치 연구소(Pew Research), 2026년 8월 20일 목요일 공개
분석 대상
커먼크롤(Common Crawl) 아카이브의 영어 웹페이지 약 50만 건, 최근 5년치
탐지 도구
오픈 팽그램(Open Pangram)
무작위 표본 결과
2026년 7월 수집 1만 건 중 10%가 AI 저작 의심
챗GPT 출시 이후 필터링 결과
35%가 AI 저작 흔적 (2022년 11월 이후 발행분 한정)
도메인별 격차
.com은 .edu·.gov(각 약 1%) 대비 약 10배, .org는 4.6%
함께 언급된 지표
클라우드플레어, 봇 웹트래픽이 인간 트래픽을 추월했다고 보고

每三个网页中就有一个是AI写的

皮尤研究中心周四公布的一项调查显示,在ChatGPT问世的2022年11月之后发布的英文网页中,有35%出现了AI写作痕迹。这意味着由AI撰写或经AI大幅修改的文章,正变得比人类从头到尾独立撰写的文章更为常见。皮尤研究报告指出,这一结果也与近期其他研究的结论相吻合。

이미지: TechCrunch AI

调查方法

皮尤研究中心从互联网档案项目Common Crawl中采集了近5年间约50万个英文网页。采集范围从早于ChatGPT发布数年的时间点开始,因此也包含了AI写作工具尚不存在时期的网页。判定是否为AI写作时,使用了Open Pangram的检测技术。

对2026年7月采集的1万个网页进行随机抽样后发现,其中10%被判定为疑似AI写作。但这一样本中混入了AI写作工具出现之前撰写的旧网页,导致比例偏低。皮尤研究中心随后重新筛选出仅在ChatGPT发布之后发布的网页,结果比例为35%。

이미지: TechCrunch AI

不同域名呈现不同温差

即便同属互联网,使用何种域名后缀,AI写作比例也存在巨大差异。商业性质的.com域名的AI写作比例,比大学、政府域名.edu、.gov高出约10倍,而.edu和.gov各自仅停留在约1%的水平。非营利性质的.org域名为4.6%,介于两者之间。

域名疑似AI写作比例
.com约10% ██████████░ 72
.org4.6% ████░░░░░░░ 33
.edu / .gov约1% █░░░░░░░░░░ 7

分析认为,这一差距的产生,是因为大学和政府网站相对而言拥有更严密的作者身份核实和编辑审核流程。相反,以广告收入或搜索曝光为目的的商业网站,似乎更积极地采用有利于大规模生产的AI写作工具。

聊天机器人阅读聊天机器人的互联网

这项调查将焦点放在"网络上写了什么"而非"谁在阅读网络"上,这与近期发布的另一份报告形成了呼应。互联网基础设施企业Cloudflare此前报告称,机器人产生的网络流量已经超过了人类产生的流量,而且这一时点比Cloudflare自身预期的还要早。将这两项调查并列来看,可以拼出一幅重叠的图景:AI撰写网页,而AI爬虫和机器人又转过来读取这些网页,这样的循环已在相当程度上成型。

皮尤研究中心还指出,其他一些暗示AI写作的信号也在同步增加。例如句中使用长破折号(em dash)的频率、牛津逗号的使用率,以及"这不是X,而是Y"这类特定句式,随着时间推移出现频率都在上升。

解读数字时需要注意的地方

以Pangram为代表的AI检测工具,有时会将人类撰写的文章误判为AI所写。皮尤研究中心也承认这一点,但认为在如此规模的数据下,整体方向性本身仍然是可信的。也就是说,比起某个精确的百分比数字,"AI写作比例正在快速上升"这一趋势本身,才更接近这项调查所要传达的核心信息。

编辑视角

这一数字之所以令人不安,关键不在于绝对值,而在于方向。2022年11月之前的互联网是人类写作的储藏库,搜索引擎和AI模型都一直把这个储藏库当作学习素材。而如今,如果不断累积进这个储藏库的新内容中有三分之一以上出自AI之手,那么下一代AI模型学习的将不再是人类的文字,而是上一代AI的文字。模型不断反刍模型产出的结构,必然会逐渐削弱信息的多样性。

从直观感受来看,这一趋势已经体现在搜索结果页面上。几年前,搜索特定问题时,个人博客或专业论坛的回答往往会排在前列。如今,用大同小异的句式和语气整理出的摘要型页面,越来越多地占据了这些位置。.com域名的AI写作比例比.edu、.gov高出10倍这一数字,恰好印证了这种直观感受——越是以搜索引流和广告收入为目的的商业网站,大规模生产的压力就越大。

对国内内容与媒体团队而言,实务上的教训很明确。第一,以搜索曝光为目的的大规模内容生产,如今应当以"大多数竞争对手都在用AI做"为前提来制定策略。第二,若想守住相当于.edu、.gov级别的可信度,编辑审核环节不应被削弱,反而应该强化,这将成为差异化的关键。第三,比起对自家内容跑一遍AI检测工具本身,能否为读者提供更为扎实的依据、来源和引用,才会成为更重要的衡量指标。

预计未来几个月内,类似的调查还会陆续出现。像Pangram这样的检测工具本身也在不断改进,随着误判率的降低,下一次调查得出的数字预计会呈现出更明显的分化。而每当新的数字出炉,围绕搜索引擎和AI模型公司应如何筛选训练数据来源的讨论,也势必会进一步升温。

评论