一份递交到美国国会两院议员与幕僚案头的专题简报,把华盛顿科技圈一直不愿公开面对的现实挑明了:全球开源大模型的力量天平,已经在过去一年半里彻底倾斜。

数据摆在桌面上相当扎眼。在开发者集聚的 Hugging Face 平台上,中国开放权重模型的累计下载量已经达到 32亿次,是美国开源模型总量(16亿次)的两倍。而在主流的人工分析智能指数(AAII)榜单上,智谱的 GLM-5.3 拿到 45 分,GLM-5.3-Flash 与月之暗面的 Kimi K3 分别拿下 42 分和 44 分;反观美国阵营排位最高的 Thinking Machines Inkling 只有 26 分,英伟达的 Nemotron 3 Ultra 仅得 23 分。美国性能最顶尖的开源模型,在总榜上甚至被挤到了第 15 款中国模型的身后。

这不仅是一场基准测试的跑分倒挂,更是整个 AI 产业底层生态的静悄悄换轨。

中美开源权重模型核心生态指标对比 Hugging Face 累计下载量 32亿次 中国阵营(美国的 2 倍) 美国总量:16亿次 新增社区衍生模型份额 63% 基于中系基座微调 Qwen衍生量超美系四巨头总和 距闭源最前沿能力时差 2-5个月 中国开源紧咬前沿 美系开源落后 6-9 个月

32亿次下载背后,全球开发者正在用脚投票

单纯看下载总量,有人可能会辩称这包含自动化镜像与量化转换的水分。但来自 ATOM 项目的历史追踪曲线揭示了更残酷的真相:2025 年 7 到 8 月间,中美两国模型在 Hugging Face 上的累计下载量其实都还在 3 亿次上下;真正的分水岭正是从那一刻开始形成,中系模型的下载曲线随后近乎垂直拉升。

全球开源模型下载量出现两倍差距,力量天平彻底倾斜(示意图)
全球开源模型下载量出现两倍差距,力量天平彻底倾斜(示意图)

比下载量更具决定性的指标,是全球开发者的依附度。斯坦福大学 DigiChina 的一份研究披露,截至 2025 年 9 月,开源社区新增的衍生微调模型里,有 63% 是建立在中国开源基础模型之上。单是阿里 Qwen 家族催生的衍生模型总数,就已经超过了谷歌、Meta、微软与 OpenAI 衍生模型的总和。这意味着在全球 AI 应用层,开发者已经形成了事实上的工程锁定。

学术界与企业 API 调用的转向同样迅猛。在 arXiv 计算机与机器学习的核心分类中,提及开源大模型的论文占比从 2023 年初的 2% 飙升至现在的五成,其中 Qwen 的单项提及率达到了 30%,反超了长期占据第一的 Llama。而在美国国家标准与技术研究院(NIST)的跟踪监测里,仅 2025 年前九个月,DeepSeek API 的全球请求量就激增了超过 5900%。

从旧金山的法律 Agent 独角兽 Harvey,到代码生成工具 Cursor,再到 DoorDash 与 Airbnb,大量硅谷创业团队与头部科技公司为了压低推理成本、掌控数据私密性,都在底层静默接入中系权重。美国大模型曾经凭借 Llama 构筑的开发者主场,正在肉眼可见地被瓦解。


独木难支:美国开源为何出现断层

美国开源生态之所以在基准测试前 15 位出现大面积塌陷,本质上源于产业结构的非对称性失衡。

单家巨头独撑开源局面,难敌密集迭代的集团军阵营
单家巨头独撑开源局面,难敌密集迭代的集团军阵营

在过去两年里,美国开源权重全靠 Meta 一家商业巨头在孤军奋战。至于艾伦人工智能研究所(AI2)主导的 OLMo 或是 OpenAthena 的 Marin,虽带有完全开放训练代码与数据的真开源理想色彩,但在千亿参数集群的残酷算力消耗战面前,非营利机构的商业造血能力根本无法支撑高频次迭代。

相比之下,中国几乎组成了集团军梯队。阿里、智谱、月之暗面、MiniMax 与深度求索等团队在同一个竞技场内高频互搏。它们把产品打磨周期压缩到极致,模型发布快上两到三个月,体现在排行榜上的能力切片就直接高出一个代际。

更核心的变量在于任务聚焦。中系开源实验室在 2026 年全面改变了数据策略,不再一味闭门造车,而是大规模采购针对复杂交互的强化学习环境,把火力极度聚焦在 Agent 编程和代码执行这类刚需场景上。

目前中国开源模型整体仅落后美国顶尖闭源前沿 2 到 5 个月,且在编程这类工业痛点上的代差最为微弱;而美国本土的开源模型,距离 OpenAI 和 Anthropic 已经出现了半把年以上的断层。

智力基准的差距可以靠算力与算法抹平,但工程交付的厚度往往藏在软件暗处。
大模型竞争的战略分层:底座分发 vs 控制面溢价 中系开源:占领底层分母 • 策略:开放高分权重,做全球技术底座 • 表现:GLM-4.7 SWE-bench 达 73.8% • 代价:千亿 MoE 本地运维门槛与变现难题 美系闭源:退守高利润分子 • 策略:沙箱隔离、安全合规与权限调度 • 表现:Claude Code 达到 10亿美元 ARR • 护城河:终端执行控制面与权限自动化

智力属于开源,暴利退守控制面

然而,跑分与下载量的反超并不等于产业全盘通吃。在喧闹的基准超越背后,中美 AI 竞争悄然切入了一个更深邃的维度:模型智力与产品控制面的脱节

核心模型智力走向免费,高额利润却被安全控制面截留(示意图)
核心模型智力走向免费,高额利润却被安全控制面截留(示意图)

从纯粹的模型推理能力来看,开源正在快速把闭源逼入墙角。智谱此前公布的 GLM-4.7 评测中,SWE-bench 得分达到 73.8%,多语言测试达 66.7%,并在系统命令环境 Terminal-Bench 2.0 上拿到 41%,其底层针对终端 Agent 执行做出了深度适配。为了降低企业进入门槛,月之暗面更是在 2025 年末大幅下调了 Kimi 的长文本输入费率,试图在推理入口打一场消耗战。

但硬币的另一面是,最丰厚的商业果实依然被闭源牢牢锁住。Anthropic 旗下的企业级编程产品 Claude Code,在开启公测仅 6 个月后,年化经常性收入(ARR)就达到了 10亿美元

Claude Code 凭什么能赚走这笔真金白银?秘密不在于那点微弱的参数优势,而在于它的执行控制面。企业技术主管之所以愿意向 Anthropic 支付昂贵的订阅费,是因为其客户端拥有经过严密验证的沙箱隔离环境,能够在自动化调度多级 Agent 时,将开发者授权中断提示直接减少 84%。对跨国机构而言,防止代码外泄、确保断点安全回滚与符合合规审查,其价值远高于免费权重本身。

  • 结论.开源模型拿下了全球分发的分母,但高利润的分子依然留在掌控产品控制面的巨头手里。
  • 风险.千亿参数 MoE 权重的免费并不等于使用免费,企业私有化部署所面临的推理算力成本与治理门槛,往往会吞噬掉自建系统的初始预算。

这构成了当下最大的认知落差:开源权重是免费的,但在企业级场景下,把权重跑起来并包裹上权限控制、子任务编排与容灾系统的工程代价极其昂贵。

更耐人寻味的是,这种工程生态的交织已经让地缘割裂变得极难执行。此前 Hugging Face 遭遇网络安全入侵时,由于美系闭源 API 设置了严格的安全风控拒绝响应溯源提问,平台工程师最终不得不借助一款中系开源权重才完成了针对攻击行为的溯源分析。兵无常势,水无常形,试图从政策上隔绝开源权重的流动,最终挫伤的往往是本国企业的应急与防御能力。

华盛顿面对 32 亿次下载与不断收窄的技术代差,很难再用封锁关税的老眼光来衡量代码资产。当年 Linux 依靠开源生态完成了对底层服务器市场的包围,今天的开放大模型正在重演这幕戏码。但这一次,分水岭不再仅仅是开源代码写得多快,而是谁能在免费的智力汪洋之上,用最严密的控制面收割走真正的商业剩余。