OpenAI与微软早已看到生成式AI对网络生态的反噬
导语
纽约时报起诉OpenAI与微软的案件,随着一批法院文件解封,再次把生成式AI与互联网内容生态之间的矛盾推到台前。文件并不只是讨论版权条文,也暴露出两家公司内部对商业模式、数据来源和出版业未来的担忧:训练模型所依赖的网页内容,可能正被聊天机器人产品削弱;而内容生产者一旦失去收入,模型赖以学习的“供应链”也会受到影响。
文件揭示了什么
- 内部曾预见“末日循环”:一份微软内部文件称,AI内容策略可能同时损害模型表现和整个网络。聊天机器人越能直接提供答案,用户就越没有必要访问原始网页,网站流量和收入因而下降,新的高质量内容也可能减少。
- 对数据抓取的评价十分尖锐:微软应用科学负责人布伦特·赫克特将大规模抓取用于训练的数据行为形容为对劳动成果的巨大攫取,并认为以“合理使用”辩护会削弱这一概念的严肃性。微软随后表示,这些是个人、学术性和前瞻性的观点,不代表公司立场。
- 付费墙和版权控制并不清晰:文件显示,尽管微软首席执行官萨蒂亚·纳德拉曾表达“付费内容应获得授权”的原则,但一名OpenAI代表承认,并不清楚公司是否有系统识别和排除付费墙内容的机制。
- 模型复述能力带来风险:内部材料承认GPT-4记忆了大量数据,在某些提示下可能直接复现文章片段。诉讼文件还列举了聊天机器人输出多家媒体长段落内容的案例,说明“防止记忆”与版权风险之间仍存在明显缺口。
- 推荐流量可能被答案式产品削弱:OpenAI内部的媒体和经济分析认为,AI摘要及类似功能可能导致新闻网站来自搜索的访问下降,甚至让用户在获得答案后没有充分理由点击来源链接。
争议的核心
这场争议并非只有“训练数据是否属于合理使用”这一法律问题。更深层的矛盾在于,AI公司需要持续吸收开放网络中的内容来改进模型,却又在产品端把这些内容压缩成无需点击的答案。如果新闻机构、论坛和专业网站因此失去广告、订阅或推荐收入,未来能够被模型学习的新内容可能减少,数据质量也会受到影响。
这正是所谓“自我摧毁供应链”的悖论:模型产品越成功,越可能替代信息生产者与分发平台的部分功能;而这些生产者和平台恰恰是模型长期运行所需要的内容来源。
影响与待解问题
微软试图将相关言论限定为员工个人看法,并强调公司对诉讼中的版权问题有独立法律立场。这样的回应并不能自动消除文件反映出的经营矛盾。接下来,法院可能需要分别判断训练数据的使用、模型输出的复现,以及产品对出版商流量的影响;行业也必须回答,哪些内容需要授权、如何识别付费材料,以及如何让原始创作者从AI带来的价值中获得回报。
如果答案式搜索成为主流,互联网或许不会立刻消失,但内容生产的经济基础可能被逐步改写。生成式AI真正需要解决的,不只是模型能力问题,也包括如何避免在扩大规模的同时削弱自己的内容来源。
来源:The Verge AI
评论
正在确认登录状态……
正在加载评论……