OpenAI 于 2026 年 9 月 30 日公布了一份安全威胁报告,确认阻断了一起针对其大模型内部推理过程(protected reasoning)的协同对抗性蒸馏行动。这项异常调用最早于 7 月 1 日低调出现,在 7 月 24 日至 25 日激增至 16,000 次集中请求,涉及超过 4,000 个违规账户与 15,000 个关联集群,直至 7 月 28 日被 OpenAI 切断修复。OpenAI 在报告中将核心活动集群直接归咎于月之暗面(Moonshot AI,Kimi 开发商)关联人员。这不仅是一起商业违规抓取事件,更是前沿大模型竞争进入推理链阶段后,关于核心思维资产控制权与国家安全定性的首场标志性冲突。
必须明确的是,这次攻防并没有发生服务器被黑或数据库泄露,而是大模型基础 API 架构的工程妥协被钻了空子。尽管美方前沿实验室不断强化指控力度,但遥测日志里的规模化尝试,在学术与司法层面尚无法直接等同于竞争对手的模型性能全部来自抄袭。
架构缺陷:弱模型沦为解密预言机
传统模型蒸馏通常发生在模型外部,即调用更聪明的大模型,记录其公开的问答输入输出,再用这些现成答案去训练较小的模型。这种降本增效手段在业内通行多年。但在具备链式思考(CoT)能力的推理大模型普及后,各大实验室选择把推导中间步骤、纠错轨迹以及安全启发式规则严密隐藏,只给用户展示最终结果。想要让学生模型真正学会解题思路,就必须剥离这层受保护的黑盒。
根据 arXiv 论文 2608.09867《Stealing Reasoning Traces from Proprietary LLM APIs》披露的细节,攻击者利用了无状态 API 的核心漏洞。OpenAI 等平台的 API 允许跨对话传递包含思考上下文的不透明推理块(opaque reasoning block),但工程实现上并未将这块加密数据与特定用户、具体会话甚至特定模型强制绑定。攻击者并不需要暴力破解 AES 加密,他们只需把高阶模型生成的加密推理块,重放喂给同生态内的弱模型(如 Luna、Robotics/Flash 等),提示其对内容进行复述或转录。防线最薄弱的小模型由此沦为解密预言机(decryption oracle),完整吐出了原本不可见的思维链。
学术研究团队通过这一路径解码了 315,320 个公开推理块,在里面不仅识别出了 367 个个人身份信息实体,还筛出了 182 个包含 API 密钥和密码的明文凭据。更危险的是,这类不透明推理块还能被用来执行隐形提示词注入,绕过安全过滤机制直接触发恶意文件上传与数据外发。
决定防御厚度的从来不是加密算法本身,而是系统对调用上下文的绑定义务。
攻防升级:从商业违规滑向国家安全
大模型厂商之所以对思维链的流失表现出极高敏感度,是因为内部推理过程承载了极高的试错成本。一个经过强化学习训练的推理模型,其价值恰恰在于处理高难度任务时拆分阶段、自我反思以及剪除错误分支的思考轨迹。一旦这些核心蓝图被对手直接用于训练,不仅研发壁垒会瞬间被低成本复制,连带花费巨大代价筑起的安全对齐也会全盘失效。
这并不是月之暗面第一次面对海外同行的集中指控。回顾 2026 年以来的几轮交锋,美方实验室的施压呈现出高度连贯的态势。
| 时间节点 | 指控方与披露机构 | 涉及对象与具体指控 |
|---|---|---|
| 2026 年 2 月 | Anthropic | 指控 DeepSeek、Moonshot 与 MiniMax 使用约 24,000 个虚假账户及逾 1,600 万次交互进行模型蒸馏 |
| 2026 年 7 月 | OpenAI 威胁监控 | 记录到针对推理块的提取峰值达 16,000 次,并于 7 月 28 日全面实施接口断流 |
| 2026 年 9 月 | Anthropic 威胁情报 | 称 Moonshot 在 5-7 月通过 5,380 个账户产生超 2,300 万次交互,并指其曾将 30 万次 Kimi 请求静默路由至 Claude |
| 2026 年 9 月 | 美国 FBI / NSA / CISA | 发布联合网络安全公告,指控包括阿里、DeepSeek、Moonshot 等在内的团队实施工业级规模提取 |
| 2026 年 9 月 30 日 | OpenAI 官方公告 | 首次正式归咎 Moonshot 关联人员,协同前沿模型论坛将对抗性蒸馏定性为国家安全风险 |
从违约调用到跨国情报机构发声,原本属于服务条款(ToS)民事争议的数据搬运,已经被前沿模型论坛推进至国家安全叙事。
证据链断点:探测尝试与真实能力的鸿沟
在这场各方角力的技术指控中,最容易被读者忽略的是尝试提取并不等于成功蒸馏出模型。
OpenAI 官方文本的用词其实相当克制,通篇指出的均是尝试提取(attempted extractions),且仅将核心活动归咎于月之暗面相关人员,没有直接定性为受公司最高层意志驱使的系统性工程。前述学术论文在 120 道 Codeforces 题目上验证了思维链的可提取性,但在附录里明确强调:单纯的输出相似度与文风重合,无法在因果上证明某款开源或商用模型必然是由被盗推理链训练出来的。换言之,无论抓取日志有多庞大,在缺乏白盒训练数据与模型权重比对的前提下,尚无直接技术证据证明 Kimi 的核心得分完全归功于外流数据。
不同阵营对这类行为的定性也呈现撕裂。中国官方就美方联合公告反驳称其毫无根据,重申蒸馏是全球人工智能研发的标准手段,批评美方借国家安全之名行技术垄断之实。而在产业利益端,英伟达 CEO 黄仁勋在 2026 年 7 月曾公开发声,认为向更强系统学习是机器智能演进的必经之路,业界应聚焦于隐私与合同责任,而不是封杀开源追赶者,因为更繁荣的开源生态才能撑起长期的算力需求。即便同在 OpenAI 内部,其总裁 Greg Brockman 在 2026 年 7 月评价 Kimi K3 时也坦言其表现相当不错,并明确表示尚无法断定其是否违规蒸馏了自家的模型。
月之暗面官方截至 2026 年 9 月 30 日并未在平台或官方博客发布任何正面辩驳。但无论最终调查指向个别工程师的外部探测还是系统化行为,出海与追赶型 AI 厂商面临的封锁网络正在实质性收紧。
- 风险.海外云厂商与模型提供方对中国开发者的账户审计、跨地域访问合规要求将进一步苛刻,依赖单一闭源 API 进行能力摸底或对齐训练的窗口期已基本关闭。
