这个月,Thinking Machines、Poolside、腾讯、月之暗面、美团旗下LongCat先后放出了自己的开放权重模型。五个尺寸段位,从118B到1.6万亿参数都占了。训练一个大模型的算力成本还在往上涨,但愿意下场的公司没见少。

两年前如果有人说2026年会是大模型公司加速整合出清的一年,大概率有人点头。这个月的发布密度,和这个预测明显对不上——不是整合没有发生,而是时间表被推后了。推后的理由很现实:把开放权重变成token收入,门槛比想象中低,回报比想象中快。

五个模型,五张答卷

这一轮发布,各家交出的答案很不一样。参数规模、定位、许可证都不在一条线上。

模型公司参数规模核心看点
InklingThinking Machines975B-A41B(另有276B-A12B小版本)首个模型,多模态输入、纯文本输出;定位是配合商业服务Tinker的微调底座,不是同尺寸最强模型
Laguna S2.1Poolside118B-A8B能塞进一台DGX Spark跑起来;训练过程和评测轨迹全公开
Hy3腾讯295B-A21B许可证从限制版换成Apache 2.0;单科数学题成绩亮眼,但不能直接当通用能力证明
Kimi K3月之暗面月之暗面近期最大的开放权重发布权重开放,但非商业许可;推理和微调商用要单独签约
LongCat-2.0美团1.6万亿参数MoE全程用华为昇腾910训练完成;是目前已知首个非华为、非玩具级别的国产芯片训练大模型

参数规模从118B跳到1.6万亿,一个数量级还不止,但没有一家因为训练太贵掉队。真正的分化不在能不能训,而在训完之后怎么变现、怎么留住开发者。

参数规模跨度:桌面级到万亿级 118B Laguna S2.1 塞进一台DGX Spark 975B Inkling 多模态微调底座 1.6T LongCat-2.0 全程国产昇腾训练

但决定这些模型能不能被真正用起来的,不是参数表,是许可证。

许可证,才是真正的成本项

三种许可,代表三种商业逻辑。

许可谱系:开放不等于开源 Apache 2.0 · Hy3(腾讯) 完全开放,商用无限制 OpenMDW · Laguna S2.1(Poolside) 类Apache,附加AI专属法律条款 非商业许可 · Kimi K3(月之暗面) 商用需签约,存在地缘政策风险

Apache 2.0(如Hy3)商用没有限制。OpenMDW(如Laguna S2.1)在类Apache条款上加了AI专属的法律保护。Kimi K3看着最开放,权重可以直接下载,但商用要单独签约——权重可见,不等于开源。

这对两类人是不同的成本项。关注开放模型格局的技术从业者,如果只是做研究或内部实验,三种许可都能拿来白用;但要往商用微调服务上迁移,Hy3的Apache 2.0没有额外负担,Kimi K3则要先走一遍商业授权流程,不能直接上线卖token。评估私有部署和许可风险的企业决策者,如果考虑基于Kimi K3自建服务,商业协议和它可能被卷入的中美政策风险,要提前算进采购成本,不是纯技术选型。

有分析认为,这种商用必须签约的许可结构,反而给了美国政府一个更清晰的政策入口——一旦美国公司要和月之暗面签合同才能拿到推理token,原本模糊的地带就变得可执行、可制裁。这只是一种分析视角,目前还看不到实际的限制动作。

分水岭在哪

Thinking Machines是这轮里最值得说的例子。它2025年初成立时,很少有人把它归到开放模型公司这一类。据其官方口径,微调服务Tinker一年能带来数亿美元营收——这个数字还没有第三方审计,方向却清楚:开放权重本身不值钱,把它变成便宜的token和可持续的微调生意才值钱。

十九世纪的铁路热潮也是这样。铁轨越修越贵,修铁路的公司却越修越多,整合是二十年后的事。开放模型现在的处境和当年有点像,但不完全一样——铁路是重资产、慢周期,模型训练靠的是融资和算力囤积,周期短得多,谁先跑通商业化,分水岭随时可能提前到来。

美团用华为昇腾910练出1.6万亿参数的LongCat-2.0,是目前看到的第一个非华为、非玩具级别、完全靠国产芯片训出来的大模型。这对想自建AI能力的企业是个新变量:供应链不再只有英伟达一条路,但这条路目前只有一个案例,还谈不上成熟。

整合没有来,门槛只是换了个地方重新立起来:从谁能训,变成谁能卖、谁敢卖、卖给谁不会被盯上。这才是接下来几个月最该盯的变量。