Nvidia最新一版开源模型Nemotron 3 Ultra在今年6月发布时,官方给它贴了个标签——"truly open source"。查一下它到底公开了什么,会发现这句话有个隐藏前提:只公开"合法拥有再分发权利"的数据。更让人意外的是,支撑这场开源豪赌的所谓260亿美元投资,翻开SEC文件一看,其实是一份写在合同里、逐年滚动、还在被不断上调的云算力采购承诺,不是一次性砸出去的真金白银。
Interconnects.ai的Nathan Lambert提出过一个框架:开源"训练配方"(数据、代码、权重全公开,如Ai2的Olmo、EleutherAI的Pythia)像开源操作系统,谁都能拿去改、拿去跑;开放权重模型(只给权重和推理代码)更像装进项目里的一个具体软件版本。Nvidia砸钱做Nemotron,图的是让更多人能自己"钓token"——训练出自己的模型,才会持续买它的芯片。这个逻辑没错,但故事讲到这儿,只是一半。
Nemotron到底公开了什么
Nemotron 3 Ultra是550B总参数、55B激活参数的混合Mamba-Transformer MoE,面向长程agentic任务,公开了预训练、后训练、量化和奖励模型的checkpoint。许可协议正从NVIDIA Open Model License转向Linux基金会的OpenMDW 1.1,允许商用、修改、再分发。Nvidia还拉了个"Nemotron Coalition",第一个公布的合作对象是Mistral AI,联合开发基础模型。
这些是真金白银的投入,不是姿态。但"truly open source"这个说法值得打个问号:新增预训练数据里有大量代码token和合成知识token,官方措辞是"公开其拥有再分发权利的数据"——底层数据源不一定能被完整复现。这跟EleutherAI、Ai2那种把整套配方摊开给你看的开源,不是一回事。
260亿,其实是一张滚动账单
Wired报道说Nvidia要砸260亿美元做开源模型,这个数字后来被反复引用,成了"Nvidia豪赌开源"的标准注脚。查SEC文件会发现,这笔钱的真实身份是一份多年期云计算服务采购承诺,分布在2026到2031财年及以后,官方定性是"主要用于研发",没有专门指明砸给Nemotron。
三个月两次上调,说明这更像一个还在滚雪球的承诺,不是一次性下定决心的赌注。同期,Nvidia单季度研发支出同比涨了58%,主要原因是算力和基础设施开支上升——这笔钱花在哪儿,比花了多少更值得问。
一个自己给自己下单的循环
Nvidia付钱给云厂商买算力,云厂商拿这笔钱(加上自己的钱)去买Nvidia的芯片来交付这批算力,Nvidia再用这些算力训练开源模型,去刺激更多人买芯片。这不是财务造假,账目是真实的,但这更像一场自我拉动的需求,不完全等同于外部世界对芯片的独立渴求。把这笔"开源投入"简单读成"市场需求旺盛"的证据,容易高估真实的终端拉力。
原文没提的一个变量:中国的开源模型生态——DeepSeek、Qwen这类项目——正在往华为等非Nvidia芯片上适配。这条路越走越顺,Nvidia靠开源模型在软件层面锁死硬件生态的优势就会被削弱。"防止智能被垄断"听起来像公关辞令,真正让Nvidia加码的,可能是这场硬件层面的地缘竞争更现实。
训练本身正在变得不可及
比数字口径更值得担心的,是训练一个能打的基础模型正在变得像几年前的大规模预训练一样,只有少数人玩得起。眼下开源生态最活跃的部分其实是后训练——用Tinker之类的微调API,拿DeepSeek V4 Flash、GLM 5.x这些现成的开放权重模型改造成agent。这条路火热,但建立在别人训好的底座上。
预训练、后训练这套两三年前定下来的说法,可能要拆成预训练、推理训练、后训练三段——中间那段正在变得跟顶级实验室的黑箱一样,外人摸不到。愿意从零训练、公开全部配方的机构本来就不多,等基础模型训练彻底抽象化,供给端会先枯竭,而不是被"挤出主赛道"。
钓竿好买,鱼塘难开。
- 风险.真正能撑住开源recipe生态的,不是Nvidia账本上滚动的云算力合同,而是底层训练本身还剩多少人能碰得到。
Nvidia想教会所有人钓token,前提是钓竿要一直摆在明面上。眼下的账本告诉我们,这笔钱大概率会持续滚动、持续上调,也大概率会继续含糊——至于底层训练本身还能不能被外人碰到,才是真正决定这场赌局输赢的变量,而这件事,谁都还没给出答案。
