AI训练版权争议:真正的焦点不只是“能不能读书”
阅读约 3 分钟
生成式AI公司使用书籍、新闻、论文和互联网内容训练模型,已经成为版权诉讼的核心争议。对作者而言,自己的作品可能在未经许可的情况下参与了训练;对模型开发者而言,训练更像是阅读和学习,而不是把原文直接复制给用户。美国现有版权框架并没有为这种规模和技术形态专门立法,因此法院只能依靠数十年前形成的原则逐案判断。
核心要点
- 训练行为与获取材料的方式要分开看。 在Anthropic相关案件中,法官William Alsup认为,模型通过阅读大量作品学习语言和写作模式,本身可以被视为具有转换性质的使用,因而训练行为是合法的。但Anthropic从非法网络影子图书馆获取书籍,成为需要承担责任的关键原因。案件达成了15亿美元和解,但这并不等于法院认定所有AI训练都侵害版权。
- 合理使用仍是主要法律战场。 判断是否属于合理使用,通常要考察使用目的和性质、使用数量以及对原作品市场的影响。法律专家指出,法院尤其关注AI产品是否为了直接竞争而使用他人内容。
- 竞争关系会改变判断。 Thomson Reuters起诉Ross Intelligence的案件中,Ross复制法律内容以打造竞争性的AI平台,法官认为其用途没有形成足够不同的目的或性质,因此不能简单适用合理使用。相比之下,聊天机器人生成新文本是否已经直接取代作者作品,目前尚未形成同样明确的司法结论。
- 训练版权与AI生成内容版权是两回事。 美国案件Thaler v. Perlmutter确认,完全由AI生成的作品通常不能获得版权保护。这又引出新的问题:作品由人和AI共同完成时,哪些部分体现了人类创作,以及如何证明AI参与程度。
意义与影响
这些案件暂时没有给行业提供一条清晰的“许可或禁止”路线,却正在塑造AI公司的合规策略。未来争议可能集中在训练数据来源是否合法、模型用途是否与原权利人构成竞争、输出是否复现具体作品,以及开发者能否证明其训练过程具有转换性等方面。
对作者和出版商来说,诉讼不仅关乎一次赔偿,也关乎内容市场是否会被低成本合成内容削弱。对AI公司来说,合法获得数据、建立来源记录、降低输出复现风险,可能比单纯争论“模型是否像人一样阅读”更重要。由于不同法院仍可能得出相反结论,行业短期内仍将处在判例逐步累积、规则尚未定型的阶段。
评论
正在确认登录状态……
正在加载评论……