9月1日,美国司法部在纽约南区法院递交了一份20页文件,就《纽约时报》诉OpenAI版权案表态:AI公司用版权作品训练大模型,应受“合理使用”保护。这是联邦行政部门第一次在这类核心诉讼里正式站队,而且站在了OpenAI这一边。但把文件全文读下来会发现,DOJ支持的范围比新闻标题暗示的要窄得多——它只护住了训练这一环,数据怎么来的、模型吐出什么,DOJ自己都没敢说没事。
罕见介入,但只护住训练这一段
这份文件的性质值得说清楚:它不是普通的法庭之友意见书,而是依据《美国法典》第28卷第517条提交的“利益声明”(Statement of Interest),司法部不需要法院批准就能递交,案号25-md-3143。文件核心论点是,LLM训练时“复制”文本,目的是学习统计规律和语言模式,不是把原文重新发布出去,因此具有“极强的转换性”,符合合理使用的立法初衷。
但DOJ随后做了一件很多报道没提的事:它把整件事拆成三层——训练过程本身、训练数据怎么获取、模型最终输出什么。文件只主张第一层受合理使用保护,对后两层留了口子:数据若靠盗版渠道拿到,仍可能单独违法;输出若直接复制受保护的原文表达,同样可能侵权。
DOJ护的是训练这一段,不是AI用版权材料的全部合法性
这个三层框架不是新发明。去年Anthropic那起官司里,法官William Alsup判赔15亿美元,但罚的不是训练本身——是Anthropic用非法影子图书馆盗版书籍的行为。Alsup当时把LLM训练比作“人类读书学写作”,训练合法,来源违法照样要赔钱。DOJ这次的框架和Alsup的逻辑几乎是一套东西,只是换了个更正式的联邦背书。
白宫的算盘:竞争力叙事 vs 创作者叙事
DOJ的说理落点很直接:如果几乎所有训练材料都要授权许可,大公司和大媒体集团能买得起版权,小AI创业公司买不起,最后市场会被少数巨头垄断,还会拖累美国在全球AI竞争里的位置。这条逻辑援引的是特朗普去年签署的AI领导力行政令,副总检察长Stanley Woodward把这件事定位成经济与国家安全议题,商务部长Howard Lutnick也表态支持在合理使用框架内允许训练,同时探索其他方式补偿艺术家。
《纽约时报》的回应很尖锐:行政部门是在牺牲美国创作者的利益,去偏袒少数极具价值的AI公司;报社坚持认为AI公司和新闻业本可以走内容付费这条路共存。作家协会(Authors Guild)的立场更直接对撞DOJ——未经许可大规模复制版权书籍用于商业AI训练,本身就不该算合理使用。两边争的不是训练技术细节,是钱该怎么分。
真正的战场:“市场稀释”算不算损害
文件里最容易被后续官司攻破的一点,是DOJ拒绝把“AI输出与原作品抢市场”算作合理使用第四要素下的实质性损害——除非输出直接复制受保护表达并构成实质替代。这个立场比训练是否转换性更容易被挑战,因为版权法第四要素本来就专门用来衡量市场损害,DOJ这里等于把门缝收得很小。
- 风险.一旦有原告能证明某个具体输出确实替代了原作销量,这份文件的辩护逻辑就会出现裂口,官司焦点会迅速从“训练合不合法”转向“输出有没有抄”。
这份文件对SDNY的法官没有约束力,DOJ在本案里也没有管辖权或诉讼资格,法律效力更像是一种政治信号而不是判决依据。但信号本身有分量:它告诉后续所有AI版权案的被告,联邦行政部门至少在“训练”这一层是站在你这边的。真正决定胜负的,还是法官会不会认这套三层区分,以及“市场稀释”这道题最后怎么判。OpenAI截至发文暂未就文件公开回应,态度一贯——训练具转换性,具体侵权输出应单独处理,这次DOJ给它加了一层联邦背书,但没给它免单。
