AI 领域学者 Nathan Lambert 于 2026 年 9 月 11 日在 Interconnects 发布了一份开放模型必读书单,系统复盘了过去数年开放权重模型在商业、架构演进与地缘博弈维度的核心转折。这份文献清单释放出一个清晰信号:开放模型不再是闭源前沿的拙劣仿制品,而是沿着完全不同的技术曲线快速推进。

但在技术突围的光环背后,大模型选型的底层逻辑已经发生巨变。以往行业普遍默认选择开源就是为了省钱、跑分榜首就能代表真实生产力,如今这套经验正在集体失效。

代码与Agent战场的代差抹平

在综合理论评测与通用测试集日趋饱和的当下,软件工程实测成了检验模型工程能力的硬指标。2025 年 8 月发布的 GPT-5 取得了 74.9% 的 SWE-bench Verified 分数,并录得 88% 的 Aider Polyglot 解决率与 94.6% 的 AIME 2025 成绩;同期 Anthropic 的 Claude Opus 4.1 在 SWE-bench Verified 上也跑出了 74.5%。长期以来,这类复杂的代码修复任务几乎被顶尖闭源模型垄断。

AI 模型评测实验室的终端工作台
AI 模型评测实验室的终端工作台

然而,中国开放模型阵营通过混合专家架构(MoE)与运行时工程设计,迅速缩小了这层代差。Qwen3-Coder-Next 仅仅凭借 3B 激活参数,在 SWE-Agent 脚手架辅助下就实现了超过 70% 的 SWE-bench Verified 解决率;月之暗面于 2025 年 7 月开源的总参 1T、激活 32B 模型 Kimi K2,在工具调用辅助下得分达到 65.8%,启用并行测试时计算后进一步冲上 71.6%。随后在 2026 年推出的 Kimi K2.6,更在 SWE-Bench Pro 录得 58.6%、Toolathlon 录得 50.0%,将研发重点彻底转向大规模并行智能体集群。

代码工程场景评测:开放轻量激活 vs 闭源旗舰 GPT-5 闭源全量计算 74.9% Claude Opus 4.1 闭源旗舰基座 74.5% Qwen3-Coder-Next 仅 3B 激活 / SWE-Agent > 70.0% Kimi K2 (测试时计算) 32B 激活 / 1T 总参 71.6%

这种突破印证了 Meta 在 2025 年 4 月发布 Llama 4 Scout(109B 总参/17B 激活,标称上下文达 10M)与 Maverick(400B 总参/17B 激活)时开辟的路线。虽然 Meta 报告其系列下载量破 10 亿次且衍生模型超过 8.5 万个,但真正改写应用格局的,是这类将极低单步激活参数与外部脚手架深度绑定的实战型组合。


显存墙撞破了自建省钱的神话

当开放模型的技术能力足以对齐闭源时,企业的决策天平并未如预期般倒向私有化部署。原因在于硬件运行的真实开销。

在 DeepSeek 于 2024 年底推出 671B 总参、37B 激活的 DeepSeek-V3,并于 2025 年初开源 MIT 许可的 DeepSeek-R1 之后,千亿至万亿总参数的 MoE 结构已成主流标配。尽管每个 Token 处理时的激活参数只有几十亿,但在企业私有机房内,全部数百吉字节甚至上太字节的冷权重必须常驻显存。如果调用请求不饱和,昂贵的高带宽显存大部分时间都在空转。

与此同时,公有云 API 正在发起猛烈的价格战。阿里在 2026 年 8 月发布的 Qwen3.8-Flash-Next 采用 125B 主模型与 51B n-gram 嵌入设计,单 Token 仅需 6B 激活,官方称其训练成本约为此前 Qwen3.7-Plus 的九分之一,托管 API 标价低至每百万输入 0.15 美元、输出 0.47 美元。智谱在 2025 年推出的 355B 总参、32B 激活模型 GLM-4.5,也将输出 API 压缩至每百万 Token 1.10 美元。

显存闲置开销正在让自建开源变成中小团队的成本陷阱。

甚至闭源头部也在迅速下探。OpenAI 紧随趋势推出的轻量模型 GPT-5.6 Luna,输入与输出标价分别只有 0.20 美元与 1.20 美元。虽然前沿旗舰如 Claude Opus 4.7 与 4.8 仍维持每百万输出 25.00 美元的高位,Gemini 3.1 Pro 预览版在 200K 上下文内也需 12.00 美元,但走量推理的门槛已被彻底拉平。

模型名称架构类型激活参数量 / 上下文API 定价(输入 / 输出 每百万 Token)
Qwen3.8-Flash-Next开放 MoE (125B+51B)6B 激活$0.15 / $0.47
GPT-5.6 Luna闭源轻量化非公开$0.20 / $1.20
GLM-4.5开放 MoE (355B)32B 激活$0.20 / $1.10
Gemini 3.1 Pro (预览版)闭源通用标称 200K 内$2.00 / $12.00
Claude Opus 4.7 / 4.8闭源旗舰非公开$5.00 / $25.00

为了突破物理显存瓶颈,底层架构改造正在成为技术重心。DeepSeek 在 2026 年 9 月 10 日发布的 552B 规格 V4.1-Flash 模型中引入非对称设计,输入激活维持在约 8B,输出为 16B。官方数据显示,其 KV 缓存所需 HBM 降至前代的四分之一,固态存储占用也压缩至八分之一。硬件博弈的核心战场,已从纯粹的算力吞吐转向显存与吞吐效率的极限精简。

企业部署的真实 TCO 鸿沟 自建私有 MoE 节点 • 需硬抗 500B-1T 权重的显存底座 • 业务低谷期 HBM 显存大比例闲置 • KV 缓存吞吐与并发运维成本极高 结果:低并发业务单次推理极昂贵 非对称托管 API 矩阵 • Qwen / Flash 架构将激活缩至 6B • 价格杀至每百万 Token 数毛钱 • 服务商分摊多租户闲置硬件资源 结果:纯按需付费,无空置折旧
  • 风险.若业务日均调用无法跑满集群吞吐,盲目采购大显存节点本地跑万亿 MoE,总体拥有成本可能数倍于调用托管接口。

许可协议与算力精算的终局分流

除了硬件经济账,开放生态还面临隐性的制度制约。长期以来行业习以为常的开放权重,并不等同于真正开源。Shayne Longpre 等人关于数据公地危机的研究指出,公开可用的高质量清洗语料正以惊人速度缩水,各大前沿实验室对核心训练集与管线讳莫如深。

与此同时,模型协议的法律边界日渐收紧。无论是 Llama 设立的庞大商业用户月活门槛,还是部分模型附带的不可用于训练竞争对手衍生模型的修改版协议,都给跨国企业应用蒙上了合规阴影。加之美国监管层对前沿开放权重模型的政策风向收紧,单纯依赖单一模型搭建业务底座的风险越来越高。

这种现实倒逼技术架构师走向务实的混合路由方案。未来的落地路径正在被清晰切分:企业最敏感的私有资产交由轻量化私有模型清洗,常规高频业务接入每百万 Token 仅需两三毛钱的低成本 Flash 托管接口,极少数容错率极低的长尾难题才分流给 Claude Opus 或 GPT-5 这类高单价旗舰。

  • 建议.停止纠结开源与闭源的阵营归属,依据数据涉密等级与单任务成功成本重构调用流水线,才是更具现实防御力的算力策略。