资本政策全球市场观点评论分析· 3744· 约7分钟阅读

司法部下场,AI训练要洗白了?

A
AI编辑团队AI 原创内容
2026-09-07 18:28 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

纽约时报诉OpenAI案胶着之际,美国司法部提交利益陈述书,用三段论为AI训练辩护,釜底抽薪式瓦解版权方的核心诉由。本文拆解这份文件的产业含义:训练端合理使用若成定局,全球内容产业的版权定价逻辑将被重写,内容方正加速寻找B计划。

司法部介入AI版权诉讼:训练阶段合理使用之争的走向

版权诉讼持续近两年,一份政府文件可能改变案件走向。

纽约时报OpenAI案审理中,OpenAI因对法院的陈述问题、隐匿输出日志证据而处于不利地位。此时,美国司法部被报道将向纽约南区联邦地区法院提交《美国利益陈述书》(Statement of Interest),主张大语言模型训练阶段使用作品可能构成合理使用。这份文书的分量在于:它触及的正是案件的核心争点——训练要不要付钱、付给谁、付多少。

被告席上的OpenAI

先看OpenAI的诉讼处境。

版权人起诉大模型公司有一套常见打法:把未经许可抓取作品的行为,和模型能生成近似内容进行绑定。纽约时报于2023年12月27日在纽约南区联邦地区法院起诉(N.Y. Times Co. v. Microsoft Corp., No. 1:23-cv-11195 (S.D.N.Y.)),2024年2月29日追加OpenAI为被告(案号No. 1:24-cv-00754,后合并审理)。诉状展示了ChatGPT能复述、甚至逐字吐出其文章——训练用的是未经许可的作品,产出的是近似内容,训练本身构成实质性替代。

更麻烦的是程序问题。OpenAI曾在2025年1月删除部分ChatGPT对话日志,与此前达成的证据保全安排相冲突,纽约时报为此提出制裁动议。2025年4月30日,治安法官Ona T. Wang认定OpenAI的相关陈述与其保全义务不符,命令其保存并检索输出日志。2025年11月7日,主审法官Sidney H. Stein进一步下令OpenAI向纽约时报提供约2000万条对话日志,限期于11月14日前完成。次日(11月6日),Stein法官驳回了OpenAI的驳回动议,允许核心的直接侵权指控继续推进。

在诉讼里,诚信问题往往比实体败诉更致命——法官一旦对一方产生不信任,自由裁量就会系统性偏向对手。输出日志如今已成为AI公司最大的证据风险敞口:你很难事先知道模型在过去几年里生成过什么。

就在案件走向对OpenAI日渐不利时,司法部介入的消息出现。据2025年6月以来多家美国媒体报道,司法部正在准备一份《美国利益陈述书》,拟在训练阶段的合理使用问题上支持被告一方的主张。作为美国版权执法体系中的重要行政机构,其态度本身就是天平上的砝码。当然,在法院正式收录文件之前,其最终措辞和提交时间仍以法院记录为准——这一点与后文的司法推理同样重要。

三段论:训练、转换性、输出切割

司法部(以及AI企业一方)的法律框架,是把AI运作拆成三个环节,逐一归责:

第一环节,训练数据的获取。一方主张这一阶段的数据使用是技术行为——模型不是在阅读文章,而是在学习语言的统计规律,通过统计学习提取抽象模式。这与复制粘贴式侵权不同,更接近人类博览群书后形成自己的知识体系。

第二环节,模型训练。其被主张具有高度转换性:将原始数据转化为具有独立价值的模型能力。按照美国版权法(17 U.S.C. § 107),转换性使用正是判断合理使用的关键——对原作品赋予了新的表达、新的意义或新的信息传递。可援引的判例是明确的:Google扫描图书案(Authors Guild v. Google, Inc., 804 F.3d 202 (2d Cir. 2015))认定全文数字化扫描用于搜索片段展示构成合理使用;GoogleOracle案(Google LLC v. Oracle Am., Inc., 593 U.S. 1 (2021))则确认在特定条件下重新实现软件接口属于转换性使用。版权作品被用于全新技术目的时,即使存在完整复制,也可能构成合理使用。

第三环节,模型输出。这是最关键的一刀:即使输出内容偶尔与原作品高度相似、甚至构成侵权,也不影响训练阶段的合法性评估。输出端风险与训练端认定,是两个独立的法律问题。

这套框架的价值在于:训练阶段的合法性,不受输出阶段争议的连带影响。版权方的绑定式打法,被正面拆解。对OpenAI而言,这等于把战场从自己最不利的证据泥潭,部分拉回到法理争点上来。

市场稀释理论:版权方必须补上的证据

合理使用不是无限的。它的前提,是不能对原作品的潜在市场造成不合理损害。

于是战场转移到市场影响。2025年6月25日,KadreyMeta案(Kadrey v. Meta Platforms, Inc., No. 23-cv-03417-VC (N.D. Cal.))中,Vince Chhabria法官就即决判决作出裁定,大体支持Meta的合理使用抗辩——但理由值得版权方仔细研读。他写道:

"the plaintiffs presented no evidence that Meta's copying will cause market dilution"(原告未提交任何证据证明Meta的复制行为将导致市场稀释)

同时他明确划出了边界:

"This is not to say that using copyrighted materials to train large language models will always be fair use."(这并不意味着使用版权作品训练大语言模型总是构成合理使用)

换言之,Chhabria法官并非认可“训练天然免责”,而是因为原告方没有拿出市场稀释的实证证据,才在本案中支持了Meta。他在裁定中反复强调,版权方完全可以补充这类证据后再次主张。这就是所谓市场稀释理论——版权方手里真正有分量的一张牌,只是本案中没有打出来。

三个关键节点的脉络如下:

案件案号核心争点关键进展
纽约时报诉OpenAI/微软No. 1:23-cv-11195 (S.D.N.Y.)训练侵权与输出替代绑定2025年11月6日驳回动议被驳回;11月7日_ordered_提供2000万条日志;司法部陈述书介入(以法院记录为准)
Kadrey诉MetaNo. 23-cv-03417-VC (N.D. Cal.)市场稀释理论是否成立2025年6月25日裁定:因原告未举证稀释而支持Meta,但明确拒绝“训练总是合理使用”
Google图书与代码案804 F.3d 202 (2d Cir. 2015); 593 U.S. 1 (2021)完整复制的转换性使用被援引支持全新技术目的下的合理使用

为什么版权方如此在意稀释理论?算一笔账就明白了。

出版、新闻、音乐、影视行业的版权收入模型建立在两条腿上:单次授权费,以及订阅/付费墙收入。前者好谈,后者才是命门。如果用户能从ChatGPT直接获得新闻摘要、剧情梗概、歌词片段,订阅是否会被替代?稀释理论真正想主张的,是这种看不见的收入流失。

而一旦“训练端不欠这笔账”的立场进入判决,版权方在模型训练许可谈判中的要价空间将被压缩——很难再拿诉讼风险当筹码,要求模型厂商为训练数据支付高价。

这不意味着版权方全盘皆输。Kadrey案的裁定恰恰留下了缺口:只要拿出稀释证据,市场影响主张依然可能成立。输出端的逐字侵权也依然可以另案追责,转授权交易仍有谈判余地。“训练免费、输出个案追责”只是当前可见的一种格局,而非定局。

小结

司法部(拟提交的)陈述书的真正意义,不在于OpenAI一案的胜负,而在于它把一个此前处于灰色地带的问题推向了明确的法律检验:训练端是否合理使用、输出端如何切割追责、市场稀释需要何种证据。目前的判例图景是——Kadrey案留下了“举证即可能翻盘”的缺口,纽约时报案则显示输出端和证据程序仍是版权方的现实抓手。

这些裁定一旦累积成体系,会外溢为全球参照系,包括中国的模型训练成本结构和内容授权谈判。对模型厂商,这意味着合规预期趋于稳定;对版权方,出路的重点可能从诉讼转向两条更确定的路径——谈输出端许可,以及经营AI替代不了的内容价值。至于最终边界画在哪里,仍有待上诉法院乃至最高法院的检验。