ChatGPT发布后,超三分之一新网页出现AI写作痕迹
导语
生成式AI正在改变的不只是搜索和内容消费方式,也包括互联网内容本身的生产过程。Pew Research发布的一项新研究显示,在ChatGPT于2022年11月推出之后发布的网页中,超过三分之一呈现出由AI撰写或经过大量AI编辑的迹象。这意味着,用户今天看到的许多新页面,可能已经不再完全由人类独立完成。
研究看到了什么
- 整体样本中的比例较低,但受到旧页面影响。 Pew从Common Crawl网页档案中收集了近五年、接近50万篇英文网页。对2026年7月随机抽取的1万篇页面进行分析时,约10%显示出显著的AI作者特征。不过,这个样本包含了ChatGPT发布前的旧页面,因此会拉低整体比例。
- 聚焦ChatGPT发布后的页面后,比例升至35%。 在排除较早发布的页面后,研究发现,约35%的新网页存在明显的AI创作或深度编辑迹象。这里的“AI作者痕迹”并不等同于每个页面都完全由模型生成,也可能包括人类先写、AI大幅改写的内容。
- 不同域名的差异明显。 .com页面出现AI作者痕迹的比例约为.edu或.gov页面的10倍;后两类域名的比例都在约1%。.org页面的比例为4.6%。这可能反映出商业网站、公共机构和组织类网站在内容生产流程上的不同,但研究材料并未进一步解释原因。
- 常见文风线索正在增多。 研究还观察到一些被视为AI写作信号的表达方式增加,例如破折号、牛津逗号,以及“不是X,而是Y”这类句式。不过,单独依靠这些语言特征并不能证明一篇文章一定由AI生成。
如何理解这项研究
这项研究的价值在于,它尝试从网页存量而不是模型使用量来衡量AI对互联网的影响。Cloudflare此前报告称,机器人网页流量已经超过人类流量;Pew的分析则提出了另一层问题:当机器人正在阅读网页时,网页本身也可能越来越多地由机器人参与生产。互联网因此可能出现一种“机器生产、机器抓取”的循环。
但研究结果不应被视为精确普查。Pew使用的Open Pangram技术与其他AI检测工具一样,可能把人类写作误判为AI生成,也可能漏掉经过人工润色的模型内容。研究者因此将结果定位为具有方向性的估计,而非逐页判定。
对媒体、搜索平台和内容创作者而言,核心影响并不是“AI网页是否存在”,而是如何确认内容来源、事实依据和编辑责任。随着AI生成页面增加,搜索质量评估、内容标注和出版流程透明度的重要性都会上升。未来,互联网内容的竞争标准可能不再只是发布速度和数量,还包括能否证明内容经过可靠的人类审核。
评论
正在确认登录状态……
正在加载评论……