欧洲主权大模型代表企业 Aleph Alpha 在2026年9月28日发布了一份基准测试报告,通过自研的 GPT-OSS 120B 评估系统,对阿里 Qwen、DeepSeek 和月之暗面 Kimi 在967个涉华敏感议题上的表现展开全面审查。测试显示,中国开源模型仅有 17%至41% 的回应被判定为中立平衡,其余大多直接复述官方口径或选择沉默拒答。
这份报告的核心杀伤力,落在它指控英伟达开源模型 Nemotron Cascade 2 身上:在一个看似微不足道的训练细节中,该模型表现出了 17% 的亲华官方立场。审查与对齐早已脱离了单纯的应用层关键词拦截,正借助知识蒸馏生态链,以极低的语料占比向全球开源基础设施渗透。
0.038%的语料污染:开源蒸馏的特洛伊木马
当测试人员要求英伟达的 Nemotron Cascade 2 起草一份支持承认台湾的演讲稿时,该模型拒绝生成,转而输出了阐述一个中国原则的官方口径。这一反应引起了欧美安全团队的警觉,因为英伟达正将其开源模型全面推向政府与大型企业市场。

技术溯源揭示了原因:Nemotron Cascade 2 的全部训练集包含930万条样本,其中仅有约 3500条 来自 DeepSeek 和 Qwen 生成的合成蒸馏数据。这意味着,在整体语料库中占比仅为 0.038% 的外来样本,却在下游引发了超线性的立场偏移。
知识蒸馏本是开源界降低训练成本的利器,开发者习惯用表现顶尖的外部模型生成高质量问答作为教师数据。当教师模型自身携带严格的特定政治哲学时,哪怕注入比例万分之四,特定议题的触发路径也会在下游模型的神经元中沉淀下来。
从机械说教到防御拒答:对齐工程的隐性转向
这种行为特征源于本土法规的刚性约束。国家网信办等七部门发布的《生成式人工智能服务管理暂行办法》自2023年8月15日起施行,明确要求生成内容不得含有颠覆国家政权、危害国家安全等内容。面对严格合规责任,国内厂商从预训练语料清洗、强化学习到推理层安全过滤,构建起多重护栏。

演进策略在不同模型上出现了分化。在 Aleph Alpha 的56个人工选定话题测试中,阿里 Qwen 3.6 的平衡率仅有 17%,官方叙事占比高达 80%。DeepSeek V4 Pro 0813 则大幅转向防御性拒答,拒答率达到 66%。对比之下,西方基准模型 Claude Sonnet 5 平衡率为 70%(拒答率27%),Mistral Small 2603 平衡率则达到 92%。
许多人以为审查仅是部署在 API 端点的系统提示词与外挂拦截,但美国国家标准与技术研究院(NIST)下属机构 CAISI 在2025年的实测证实,这种倾向已沉淀在开源权重之中。直接下载 Hugging Face 权重离线运行时,DeepSeek V3.1 在英文和中文环境下分别有 5% 与 12% 概率复述官方口径,R1-0528 的这一比例更上升至 16% 与 26%。
更隐蔽的变化是政治置换。中欧亚洲研究所(CEIAS)此前的审计指出,在涉及他国对台政策问题时,Qwen 有 86% 未予正面回答;Kimi K2.5 在被问及政治反对派议题时,有 69% 的回答被置换为官方话术。当测试转向240个未提及中国的泛化敏感测试时,Kimi K3 被 AI 裁判判定出现 93% 的叙事偏向,而 Qwen 3.8 与 DeepSeek R1 的平衡率则维持在 90% 与 87%。在中文环境下,这种话语嵌入现象远高于英文。
权重并非冰冷的代码容器,它诚实记录了每一行数据背后的监管意志。
审查评测背后的商业局与主权护城河
审视这份评测本身,评测者的身份同样值得考量。Aleph Alpha 长期标榜自身为政府与关键基础设施的主权 AI 供应商,正与 Cohere、英伟达在欧美政企订单市场正面交锋。

评测方法论存在合成闭环的局限:提示词生成与打分判定全部由 Aleph Alpha 的 GPT-OSS 120B 单一模型系统完成,既未公开具体的生成温度系数与置信区间,也缺乏充分的人工复查一致性检验。将自身塑造为安全防线,是争夺政企预算最有效的商业杠杆。
- 风险.跨国企业若直接引入未作语料溯源的廉价开源模型进行二次微调,可能在政府审计或跨境数据合规中面临意想不到的政治立场风险与供应链穿透审查。
中国出海团队正在经受双向考验。如果遵从国内监管要求对齐,模型在海外开源社区就会被贴上政治烙印;如果为了迎合海外审计剥离安全机制,又会触碰本土运营的合规红线。英伟达 Nemotron 的案例证明,完全中立的代码正在成为过去式,数据供应链的溯源与净化将演变为企业采购中不可绕过的一环。
