美国政府日前依据《美国法典》第28编第517条,向纽约南区联邦地区法院提交《美利坚合众国利益陈述意见书》,就OpenAI利用受版权保护作品训练大语言模型的多区合并诉讼表明立场。这是联邦政府首次直接介入相关人工智能训练版权案件。政府建议法院将基于受版权保护文本的模型训练与人工智能生成输出内容相区分,并认为基于受版权保护文本开展大语言模型训练具有高度转化性,可适用合理使用原则。
此前,美国版权局于2025年5月发布的《版权与人工智能(第三部分):生成式人工智能训练报告》预出版版本认为,生成式人工智能训练能否适用合理使用,应结合个案事实予以判断,裁判结果取决于所用作品、训练素材来源、模型用途、模型输出内容以及相关许可市场等考量要素。
训练与输出应当分开判断
政府方的论点基于众所周知的“合理使用”原则,但意见书对该原则的适用方式将实质性地缩小训练阶段版权主张的范围。随着“OpenAI诉《纽约时报》”诉讼案件迈向简易判决阶段,以下四点可能最为关键。
第一,训练行为与输出成果。政府主张,合理使用必须针对每种具体使用情况分别评估,因此,为训练模型开展的内部或中间复制行为,不应与可能复刻受保护表达的面向公众的输出结果同等对待。该意见书敦促法院,通过针对输出结果的补救措施来解决任何输出问题。
第二,大语言模型训练属于高度转化性的使用。意见书将训练描述为利用文本识别语言模式、关联性及预测信号的过程,而非取代底层作品的表达目的。从这一角度看,模型训练的使用在性质上不同于阅读、展示、销售或再出版受版权保护的作品本身。
第三,商业用途不具备决定性。政府承认许多大语言模型产品具备商业属性,但同时提出,当被诉使用行为具备转化性,且未向公众披露受保护表达时,商业属性所占权重应当降低。
第四,损害需体现替代效果,而非一般性竞争关系。意见书认为,同题材人工智能生成作品或一般性市场竞争本身不足以构成版权法意义上的市场损害。相反,政府认为,构成版权层面的市场损害,必须满足存在实质相似性、替代受保护表达,或是破坏与涉案作品直接相关、可被认可的衍生市场的要求。
多个关键问题存在分歧
美国版权局于2025年5月发布的预出版第三部分报告认为,生成式人工智能训练的合理使用判断高度依赖个案事实,而不能作一刀切结论。
第三部分报告认可合理使用可能保护某些训练用途,特别是那些不会导致受保护表达被复制的非商业性研究或分析。但报告同时警示,从盗版渠道复制表达类作品,并在存在合理许可渠道的情况下生成可参与市场竞争的无限制输出内容,较难成立合理使用。
与之相对,政府提交的意见书要求审理OpenAI案件的法院,将训练定性为内部的转化性使用,把输出成果、素材获取、许可问题割裂为独立事项。
这一转向在许可问题上尤为突出。美国版权局认为自愿许可市场尚在发展,提出若持续存在市场缺口,可考虑集体许可方案。但政府意见书警示,法院设定许可义务会削弱美国人工智能竞争力,并巩固大型既得利益者的地位,从而使许可主要成为立法或商业问题,而非司法层面的合理使用要求。
二者在市场损害认定上同样存在显著分歧。第三部分报告将潜在许可市场、参与市场竞争的输出成果纳入合理使用的考量范围;而政府意见书否定宽泛的“市场稀释”理论,提出人工智能带来的竞争不会构成第四项要素下可被认定的市场损害,除非输出内容与受保护表达实质相似或形成替代。
合理使用边界仍待厘清
该政府文件对法院并无法律约束力,也并未终结多起人工智能版权诉讼中悬而未决的合理使用争议。但它仍可能影响OpenAI诉《纽约时报》案及关联纠纷的后续审理:一方面为被告提供可援引的联邦官方政策立场,另一方面也让版权方提前知悉己方需要回应的抗辩逻辑。
对于人工智能开发企业与企业级使用者,该文件强化了如下抗辩主张——当模型不会泄露受保护表达时,训练阶段的复制行为可构成合理使用。但这并不等同于绝对免责:基于素材取自盗版、模型记忆复刻内容、输出实质相似、不当使用版权内容等事实提起的索赔请求,仍有可能根据具体事实成立。同时法院也有可能驳回意见书的相关主张,完全不认可人工智能训练适用合理使用抗辩。
短期来看,各利益相关方应当留存训练数据来源、模型防护机制、许可历史、输出管控措施,以及所有已核实的复刻、替代类案例证据。相较于抽象讨论人工智能的利弊,上述事实更将主导下一阶段合理使用诉讼走向。
