美国司法部支持OpenAI:AI训练使用版权材料属合理使用

美国司法部9月1日向曼哈顿联邦法院提交利益声明,正式支持OpenAI在纽约时报版权案中主张AI训练使用版权材料属于合理使用。这份由副司法部长斯坦利·伍德沃德签署的文件明确指出,若版权规则显著增加美国开发大语言模型的难度,将损害美国AI产业竞争力。

司法部首次以利益声明形式介入AI版权诉讼

美国司法部(DOJ)当地时间9月1日向曼哈顿联邦法院提交了一份“利益声明”,这是其首次在AI版权侵权诉讼中公开表态。该文件由美国副司法部长斯坦利·伍德沃德(Stanley Woodward Jr.)等人签署,正式介入《纽约时报》诉OpenAI一案。

这份声明的核心主张非常直接:AI公司使用受版权保护的材料来训练大语言模型(LLM)属于美国版权法中的“合理使用”范畴,不构成侵权。司法部选择以利益声明而非直接诉讼的方式介入,表明其对这一案件的重视程度,同时也避免了直接成为当事人。

这一举动标志着美国政府层面开始系统性地介入AI与版权的冲突。过去类似争议多停留在企业与媒体之间的民事诉讼,司法部的参与将可能影响后续判例的走向。目前纽约时报指控OpenAI未经授权使用其大量文章训练模型,而OpenAI则辩称这种使用符合合理使用原则。司法部的表态为OpenAI提供了重要背书,也让整个行业看到了政策风向。

这份文件长度有限,但立场清晰。它没有详细展开具体案例分析,而是把重点放在宏观影响上。这次介入的时间点也很关键,正值多家媒体与AI公司版权纠纷集中爆发之际。司法部的行动显示,美国政府不愿让版权诉讼成为阻碍本土AI发展的绊脚石。

国家安全理由成为支持OpenAI训练方式的关键依据

美国司法部支持OpenAI:AI训练使用版权材料属合理使用:国家安全理由成为支持OpenAI训练方式的关键依据

司法部在声明中首先从国家安全角度展开论证。他们明确表示,如果版权规则显著增加在美国开发大语言模型的难度,将直接损害美国AI产业的国际竞争力。这一论点把技术开发与国家战略安全绑定在一起,抬高了讨论层级。

声明指出,领先的大语言模型能力对美国维持全球科技优势至关重要。过度严格的版权限制可能迫使美国公司在数据获取上投入巨额成本,或干脆转向海外,这会削弱本土创新速度。司法部认为,当前训练方式是保持竞争力的必要条件,而非可有可无的便利。

这一国家安全叙事并非首次出现,但在正式司法文件中公开采用还是第一次。它暗示司法部把AI发展视为与国防、情报能力密切相关的战略议题。相比单纯的商业利益,国家安全理由更难被法院忽视,也为未来类似案件提供了模板。

文件没有给出具体数据支撑,但逻辑链条清楚:严格版权→数据获取成本激增→模型开发放缓→美国在AI领域的领先地位受损。这一论证直接服务于支持OpenAI的核心结论,即现行训练方式应被认定为合理使用。

合理使用立场将实质降低美国大模型的数据获取门槛

美国司法部支持OpenAI:AI训练使用版权材料属合理使用:合理使用立场将实质降低美国大模型的数据获取门槛

司法部的表态如果最终被法院采纳,将实质性降低美国AI公司获取训练数据的门槛。过去许多公司因担心侵权风险而花费大量资源进行数据清洗、授权谈判或使用合成数据,现在这一顾虑有望大幅减轻。

合理使用一旦确立,意味着公开可得的互联网内容、新闻文章、书籍等都可以更自由地用于模型预训练,而无需逐一获得授权。这将直接减少合规法律成本,让更多初创团队能够参与大模型竞赛。信号显示,司法部正是担心“显著增加开发难度”才选择站队,因此其立场的核心效果就是降低门槛。

实际影响还将体现在数据规模上。目前顶尖模型的训练数据量已达数万亿token,如果每份内容都需要授权,成本将呈指数级上升。司法部的支持为行业提供了确定性预期,企业可以更放心地扩充数据集,而不必过度依赖有限的公共领域或授权内容。

当然,这一立场并非无限制。声明没有涉及输出阶段的侵权问题,也没有讨论如何平衡创作者权益。但就训练阶段而言,它清晰地向市场传递了宽松信号。美国AI公司在数据获取上的合规负担有望显著下降,这可能加速下一代模型的迭代速度。

中国生成式AI暂行办法对训练数据提出更高合规要求

与美国司法部的立场形成鲜明对比的是,中国《生成式人工智能服务管理暂行办法》对训练数据提出了更高的合规要求。该办法要求生成式AI服务提供者确保训练数据不侵犯他人合法权益,并强调尊重知识产权。

中国监管明确规定,用于训练的数据应当合法获取,且不得含有侵害他人肖像权、名誉权、隐私权等的内容。这意味着中国AI公司在使用新闻媒体内容、文学作品等受版权保护材料时,需要更严格的授权流程或数据过滤机制。

相比美国“合理使用”的一揽子认定,中国办法更侧重过程合规和结果可控。它要求服务提供者在训练前进行必要审查,并在模型输出可能侵权时及时干预。这种监管路径把重点放在预防而非事后救济上。

两者的差异根植于不同的制度环境。美国更强调创新自由与产业竞争力,中国则更注重秩序与权益平衡。因此,中国AI公司在数据准备阶段往往需要投入更多人力进行合规审核,这直接抬高了前期成本。

中外AI公司数据策略将出现明显分化

司法部的表态与中国的监管框架将推动中外AI公司在数据策略上走向分化。美国公司有望更大胆地使用公开互联网数据进行训练,重点放在规模和多样性上。他们可能会减少对授权数据集的依赖,转而投入更多算力优化模型。

中国公司则需要构建更精细的合规数据管道。它们可能更多依赖经过明确授权的中文语料库、公共数据集,或通过与内容方合作建立专有训练集。数据清洗和脱敏环节将成为必备流程,合规团队在公司中的权重也会上升。

这种分化还将体现在成本结构上。美国公司的法律风险成本可能降低,而中国公司的合规运营成本会保持较高水平。但中国公司在本土市场能获得更清晰的监管预期,避免突然出现的巨额赔偿风险。

长远来看,美国公司可能在通用大模型上保持速度优势,中国公司则可能在垂直领域或合规友好的应用场景中找到差异化路径。数据策略的分化最终会反映到模型能力、商业模式和国际竞争力上。

中文开发者面临跨境数据合规与模型出口的双重压力

对中文开发者而言,这一事件带来了双重压力。一方面,如果他们希望使用国际主流大模型或训练数据,需要仔细评估美国“合理使用”立场是否适用于跨境场景。另一方面,当模型面向中国市场或出口时,又必须满足《生成式AI服务管理暂行办法》的合规要求。

跨境数据流动本身就存在法律灰色地带。开发者可能需要同时跟踪中美两套规则:在训练阶段参考美国宽松立场,在部署和输出阶段严格遵守中国审查标准。这增加了技术架构的复杂性,也提高了法律咨询成本。

模型出口时面临的压力更大。一款在美国以合理使用方式训练的模型,如果在中国提供服务,可能需要额外证明其训练数据符合中国法规。反之亦然。这对中小开发者尤其不利,他们往往缺乏足够的合规资源。

中文开发者因此需要在数据来源上更加谨慎。优先选择已完成合规审查的中文数据集,或采用混合策略:用公开数据预训练,再用高质量授权数据进行对齐。整个过程需要平衡创新速度与法律风险,难度不小。

案件最终判决仍留有多个未决变量

尽管司法部立场鲜明,但纽约时报诉OpenAI案的最终判决仍存在多个未决变量。法院是否完全采纳司法部的合理使用主张,目前还不清楚。合理使用的认定通常需要进行四因素测试,具体到海量训练数据的场景,判例仍不充足。

此外,案件可能继续上诉,最终或将到达最高法院。这意味着司法部的利益声明虽然重要,但并非终局意见。后续监管走向也存在不确定性,美国国会是否会就AI版权问题推出专门立法,目前尚无明确时间表。

对中国开发者来说,更需要关注的是中美规则差异如何长期演化。如果美国最终确立宽松标准,而中国维持严格合规路径,两地AI生态的割裂可能会加剧。开发者需要在技术选型和业务布局上提前做好准备。

目前可确定的是,美国司法部已公开站在支持AI创新的一边。这一表态本身就为行业提供了重要风向标,但距离彻底解决版权争议还有很长的路要走。

参考来源