NVIDIA又发了一款开源模型和一个路由工具,乍看是一次很平常的产品更新——参数不算惊人,发布形式也没意外。真正值得琢磨的是两处细节:一是所有"快4倍""任务完成快30%"的说法,全部建立在NVIDIA自己搭的跑分体系上;二是这次真正想抓的,可能不是模型本身,而是决定"这个请求该交给谁处理"的那个开关。

发布了什么

Nemotron 3.5 Lightning是一款300亿参数的混合专家(MoE)开源模型,面向长时间运行的agent系统里那些高频、专项的执行任务——代码审查、工具调用、安全告警监控、账单问答。官方给的数字是:输出速度比同类模型快4倍,agent任务完成速度快30%,依据是自家的PinchBench跑分。

配套发布的NeMo Switchyard是一个开源路由库,能在开源、专有、NVIDIA自家模型之间自动分流请求,不需要开发者重写应用。官方内部测试显示,配合路由后完成同等任务的成本能降到单独用Opus 4.8的约三分之一。

已经宣布定制Lightning的企业包括CrowdStrike(安全)、Harvey/Trajectory(法律)、CodeRabbit/Baseten(代码审查)、Lila Sciences(科研)、Fastino Labs(金融医疗)。接入Switchyard的伙伴也给出了各自的数字:LangChain把7%的调用交给前沿模型,换来74%的成本下降,准确率损失6%;Ramp在SWE-Bench测试里成本降58%、运行时间降33%;Classmethod的初步测试是成本降27%。

事实交代完了,该问的是:这些数字靠不靠得住。

跑分和命名,两处经不起细问

PinchBench听起来像个行业公认基准,但目前找不到独立信源确认它的评测方法论、对比模型名单、测试条件——它更像NVIDIA自建或合作方的评测,不是像SWE-Bench那样被广泛引用、可复现的中立基准。

"4倍速度"这类说法,关键限制是"跟谁比、在什么条件下比"。NVIDIA公布的吞吐量优势,通常建立在TensorRT-LLM这类自家优化推理栈和特定批处理策略之上。换成vLLM、SGLang,或者单条请求(batch size=1)的场景,排名很可能不一样。这是自建跑分的通病:条件定得越贴近自己的强项,数字就越好看。企业真正该问的是,把Lightning部署到自己的推理框架里,还能不能复现这些数字——目前没有任何第三方复测的公开结果。

另一个容易被忽略的细节是命名。"3.5 Lightning"很可能和此前发布的Nemotron 3 Nano 30B-A3B存在直接关联,甚至是同一模型换了名字。原文没披露激活参数、上下文长度这些基本规格,读者没法直接核实两者是不是一件事。对一家靠"开源可控"当卖点的公司来说,这不是小事——如果连模型和上一代的关系都说不清楚,企业要在生产环境里长期依赖它做决策,信心自然要打折扣。

"快4倍"是在什么条件下算出来的 NVIDIA公布的条件 自家TensorRT-LLM + 特定批处理 4倍 PinchBench跑分 未被验证的条件 第三方框架 / batch=1 未知 尚无独立复测

真正的算盘在路由层

Switchyard比Lightning更值得多想一步。它的设定是:企业不用只信一个模型,也不用自己手写路由逻辑,直接把请求交给Switchyard分发——可以分给Nemotron,也可以分给Claude、GPT或者别的开源模型。

问题是:NVIDIA为什么要主动帮开发者调度不是自己家的模型?

决定谁处理请求的开关,比模型本身更值钱。

企业换一个模型很容易,一行配置就能切;换掉整套路由决策逻辑却要重新接入、重新调参,迁移成本高得多。NVIDIA把自己嵌进这一层,哪怕客户主力用的是Claude或GPT,基础设施的话语权也留在了自己手里。这跟当年操作系统、云平台、应用商店的老套路是同一个逻辑:真正赚长期钱的,往往不是用户直接感知的那个产品,而是决定流量怎么走的那道闸门。

NVIDIA卡住了agent技术栈的哪一层 模型层 Nemotron / Claude / GPT / Qwen ... 路由层(真正的卡位点) NeMo Switchyard 推理栈 TensorRT-LLM / NeMo 硬件层 RTX / DGX / Jetson

接下来该盯什么

已经宣布定制Lightning的几家公司,现在拿到的都是发布会级别的效果描述,没有量化的独立数据。它们接下来会不会公开更具体的效果,是判断这次定制划算不划算的关键信号。

对使用RTX、DGX、Jetson这条NVIDIA全栈路线的客户,Switchyard进一步把模型选择和路由决策绑进了同一套生态。短期看确实省事,不用自己维护路由逻辑;长期看,换生态的沉没成本又多了一层。

  • 风险.所有性能数字目前只有NVIDIA一方陈述,没有任何第三方在非NVIDIA优化环境下复测的公开结果。

接下来最该盯的三件事:有没有人在vLLM或SGLang上复测"4倍速度";已经定制Lightning的公司有没有拿出具体的效果数字;Switchyard的开源许可到底能不能商用、能不能再训练再分发。这几条没有答案之前,"更快更省"目前只能算NVIDIA自己讲的故事。