2026年9月17日,纽约南区联邦法院部分解封了《纽约时报》等机构起诉OpenAI与微软版权侵权案(In re OpenAI, Inc. Copyright Infringement Litigation)的原告即决判决申请书。这份尘封多时的核心诉讼文件,用巨头自己的通信记录和实测数据,撕下了硅谷最体面的伪装。

这不仅是一场版权归属的技术争执,更是一场科技巨头心知肚明的掠夺。解封文件曝光的物证彻底推翻了行业此前“技术善意探索”的抗辩:微软应用科学总监Brent Hecht在内部直接将AI抓取定性为人类历史上最大的劳动力盗窃,而微软自测数据更冷酷地证实,旗下Copilot产品直接导致新闻媒体遭遇了83%至93%的点击悬崖

铁证破防:从付费墙黑客到“史上最大劳动力盗窃”

大模型阵营面对版权诉讼时,历来依仗美国版权法中的“合理使用”(Fair Use)原则抗辩,试图将一切未授权抓取解释为具有转换性的非消耗性分析。然而,这份于2026年9月4日带遮掩提交、9月17日由法院解封的文件,以第一手记录击穿了其合理性根基。

巨头内部项目组秘密转运并储存了数以百万计的媒体版权内容
巨头内部项目组秘密转运并储存了数以百万计的媒体版权内容

原告提交的记录清晰显示,两家公司获取训练语料的手段充斥着主观恶意。当OpenAI研究员Nick Ryder向联合创始人Greg Brockman汇报找到了绕过《纽约时报》付费墙的技术黑客手段时,Brockman仅轻描淡写地回复了一句“ah nice”。

解封文件披露的版权内容抓取与交付规模 91,692 作品副本 OpenAI中期训练集所涉原告作品 160,903 独特出版商作品 微软通过Project Mango交付语料 2,000,000+ 文档规模 Common Crawl数据集内纽时内容

为了让模型顺利吞下这些内容并不留痕迹,工程师动用了Dragnet和Newspaper等工具,刻意剥离原始报道中的作者署名与版权管理信息(CMI)。尽管主审法院曾在2025年4月4日裁决驳回了《纽约时报》针对DMCA §1202(b)(1)的剥离指控,但准许了共同原告《每日新闻》与调查报道中心(CIR)继续推进该项诉求。

抓取规模同样触目惊心。OpenAI的中期训练集(mid-training datasets)中直接包含来自《纽约时报》《每日新闻》和CIR的至少91,692份作品副本,源自Common Crawl的数据集则包含了超过200万份nytimes.com文档。微软自身也并非旁观者,其通过代号为Project Taxi和Project Mango的项目与OpenAI深度互通,仅Project Mango就组装了至少160,903份独特出版商作品。

面对自家团队的技术操作,微软应用科学总监Brent Hecht在2023年1月的内部备忘录中写下了那句耸人听闻的断语。虽然微软官方随后灭火称这只是单名员工的个人观点,但一年后Hecht在2024年1月的内部演示中进一步警告:AI正在破坏作为其根基的内容供应链,终将引发吞噬全网与模型自身的死亡螺旋

83%到93%的断崖:内部数据亲手击穿“合理使用”

在法理上,合理使用抗辩能否成立,终极考验始终在于行为是否实质性替代或摧毁原作品的潜在市场。科技公司长期公开宣称AI回答能够给原文网站反哺流量,然而解封的内部测试彻底揭穿了谎言。

AI生成答案截流,导致新闻网站遭遇高达93%的点击断崖(示意图)
AI生成答案截流,导致新闻网站遭遇高达93%的点击断崖(示意图)

微软内部追踪数据显示,与其传统必应(Bing)搜索引擎相比,Copilot这种直接生成答案的产品导致《纽约时报》与《每日新闻》域名的点击率暴跌83%至93%。流量水龙头被瞬间拧死。

皮尤研究中心对68,879次谷歌搜索的独立统计佐证了这一宿命:一旦页面出现AI摘要,传统网页链接的点击率会从15%腰斩至8%;至于AI摘要内部标注的引用链接,点击率仅剩1%,且有26%的用户在看完AI摘要后直接关闭了搜索。

从搜索引流到回答截流:流量生态断裂 传统搜索引擎模式 分发逻辑:抓取网页索引 → 展示摘要与链接 商业契约:用内容索引换取用户点击跳转 传统点击率:约 15% 稳定分发 AI 回答引擎模式 (Copilot / 摘要) 分发逻辑:全网数据吸收 → 端到端合成最终答案 现实后果:用户在搜索界面即时终结查询 点击暴跌:83% - 93% 流量流失

更为致命的是巨头管理层在私下交流中对这种毁灭性替代的清醒认知。OpenAI的ChatGPT负责人Nick Turley在内部沟通中承认,聊天机器人对出版商而言是生存威胁,因为产品具有高度替代性,且随着模型进化,这种替代只会愈发彻底。与此同时,OpenAI总裁Greg Brockman也曾赞许自家的模型极其擅长做新闻

终端产品摧毁核心供应商的经济基础,这是罕见的技术异化。

当被告内部高管都在定性产品构成实质替代,并在测算中验证了流量的断崖式萎缩,合理使用抗辩中所谓不损害原作品市场的辩词,在法理上已经不攻自破。


盟友割席与“死亡螺旋”:零点击时代的法律清算

危机不仅来自外部的原告席,昔日无缝捆绑的科技盟友内部,也开始出现逃生的裂痕。

面对侵权责任追索,科技盟友内部亮出强制重训底线以切割防火墙
面对侵权责任追索,科技盟友内部亮出强制重训底线以切割防火墙

解封的宣誓证词中,微软首席执行官萨蒂亚·纳德拉(Satya Nadella)做出了意味深长的表态。纳德拉宣誓作证称,任何付费墙内的内容都必须经过授权才能用于检索增强或模型训练;他随后亮出底线:如果他此前获知OpenAI抓取并使用了付费墙内的内容,他会动用微软的权力要求OpenAI重新训练其模型

纳德拉的表态显然是在法律责任层面试图同OpenAI强行划开防火墙。要求一个千亿参数的大模型剥离特定语料并重新训练,在商业与算力上无异于核打击。然而,微软一面在法庭上通过强调授权原则自保,一面又在工程底层通过Project Mango接收整理内容,这种自相矛盾的姿态,恰恰反映了科技巨头在诉讼逼近裁决时的巨大焦虑。

行业的大气候同样在急剧分化。2026年9月初,特朗普政府与美国司法部提交法庭意见书,力挺OpenAI的训练行为构成合理使用,意图维持美国在底层AI技术上的不设限扩张;然而美国版权局在此前的分析报告中保持了审慎态度,明确认定商业化AI若以非法途径获取海量作品并生成替代性竞争表达,将越出合理使用的红线。

司法战壕外的产业冲突早已全面蔓延。2026年6月,全美近400家地方报纸联合起诉微软与OpenAI;Penske Media和Hachette等出版业巨头也在2025至2026年间,就模型训练侵权与搜索流量替代对谷歌发起了连环诉讼。

  • 风险.若法院最终依据这批主观侵权物证裁定侵权成立,AI开发商将面临丧失DMCA法定赔偿上限豁免的毁灭性法律打击,基础大模型可能被迫面临昂贵的重训与巨额授权追索。

这批解封文件所展现的残酷现实在于:过去二十年科技巨头与内容创作者达成的流量契约已彻底瓦解。内容生产者不仅失去了流量与广告变现的生路,还要面对自身文字被清洗、被重组为绞杀自己产品的AI答案。当科技巨头将内容供应商逼入绝境,其引以为傲的大模型,最终也将失去高质量信息的供给之源。