科技媒体在面对发布会时,很容易陷入一种亢奋的惯性:只要企业软件巨头掏出自研模型,就要冠上“前沿实验室感到恐惧”的惊悚标题。

Salesforce 在 Dreamforce 2026 大会上端出的 Koa,正是这种叙事的最新标靶。按官方宣发口径,这是他们与 Nvidia 联合打造的首个企业级推理模型,专攻销售、营销与客服,号称既能让多步复杂推理更廉价,又能把数据安全锁在自家后院。

但热闹属于舞台,真相藏在论文和价目表里。

跑分里的代差:比旧作从容,逢顶尖露怯

先看这套系统的真实成色。2026 年 9 月 14 日提交至 arXiv 的 16 页技术论文(编号 2609.15066)显示,Koa 基于开源权重的 Nvidia Nemotron 3 Super 120B MoE 底座(约 12B 激活参数)打造。研发团队借助 NeMo RL、NeMo Gym 与 NeMo AutoModel 框架,采用 Group Relative Policy Optimization(GRPO)强化学习算法,在覆盖超过 14 个行业的合成企业场景中完成任务后训练。

多轮评测基准跑分横向对照 CRM Bench (垂直业务场景得分) GPT-4.1: 0.81 Koa: 0.86 GPT-5.5: 0.90 BFCL 总分 (复杂多轮工具调用) Koa: 66.63 Claude Opus 4.8: 78.18 Tau2Bench 加权得分 (真实客服推理流程) Koa: 69.41 GPT-5.5: 83.99

官方在宣传中极力强调对通用闭源模型的压制,但论文透露的基准落点十分微妙:

在 CRM Bench 上,Koa 拿到 0.86,高过 Nemotron 基座的 0.84 和上一代基准 GPT-4.1 的 0.81;然而一旦对上当期的顶尖选手,它立刻落后于 Claude Opus 4.8(0.87)与 GPT-5.5(0.90)。

再看衡量 Agent 实操能力的工具调用与复杂客服指标:

在多轮工具调用测试(BFCL)中,Koa 的多轮调用准确率从基座的 54.12% 提升至 59.50%,总分为 66.63,但在同场竞技下,Claude Opus 4.8 拿到了 78.18 的总分。

衡量复杂客服流程的 Tau2Bench 加权得分同样明显:Koa 取得 69.41,Claude Opus 4.8 是 74.00,而 GPT-5.5 更是跑到了 83.99

细分行业的数据反差更大。在零售场景下,Koa 凭借 81.6% 追平了 GPT-5.5;但在航空业务上,Koa 的 62.0% 低于 Claude Opus 4.8 的 69.0%;到了电信行业,Koa 仅录得 60.5%,距离 GPT-5.5 的 95.8% 有着难以忽视的鸿沟。

Salesforce 产品宣传页罗列了一串诱人指标:CRM 操作错误减少 3 倍、行动选择精确度提升 11%、上下文召回可靠性高 2.1 倍、长对话留存率提升 15%。遗憾的是,论文中并未给出这套商业表述的对比基准样本与完整推导。

它确实胜过了早期的 GPT-4.1,但在通用逻辑和复杂调度上,仍未迈过顶级前沿模型的门槛。

隐匿的Token账本与未开源的“开源替代”

外围报道普遍在重复一个观点:Koa 帮企业省了巨额 Token 费用,而且是个开源替代品。

这两个判断都经不起推敲。

先说开源属性。Nvidia 贡献的底座 Nemotron 3 Super 120B 确实开放了权重,但后训练完成的 Koa 本身完全是另一回事。截至 2026 年 9 月 15 日发布,Salesforce 既没有提供 Koa 的权重下载仓库,也没有附带任何开源协议,甚至没有公开合规 Model Card。它目前仅面向选定客户内测,计划要到 2026 年冬季才向美国市场开放一般可用(GA)。换言之,Koa 是一个闭源衍生品

再说推理成本。整篇学术论文与现有产品文档中,没有披露单任务推理消耗的 Token 数、端到端延迟、吞吐量,也没有写出自研推理的能耗指标。所谓“推理架构更高效”,现阶段依然停留在算法设计层面的预期,没有公开可复核的账面凭证。

Code
企业真实支付界面:
无论底层调度何种模型,Agentforce 标准计费为 500 美元 / 10 万 Flex Credits。
折算下来,系统触发一次标准 Action 的固定资费是 0.10 美元。
技术层面的 Token 节约,目前并未直接转化为企业采购账单上的折扣。

企业客户若是冲着降低 IT 支出的目的去用,很可能会扑空。在现行计费框架下,模型跑一次是耗费 800 Token 还是 400 Token,最终买单依据依然是统一动作费;而一旦模型推理失误触发重试,反倒会带来更高的有效调用成本。

Koa 资产形态与落地约束 底层基座:Nvidia Nemotron 3 Super 120B MoE (12B 激活) 开放权重 / 算力绑定 后训练:Salesforce 14 个行业纯合成场景 GRPO 强化学习对齐 闭门自研 / 权重未公开发布 交付形态:Agentforce 云端托管服务 2026 冬季全美 GA 0.10 美元 / 标准 Action

既当选手又当裁判的合成闭环

除了商业包装,Koa 在工程方法论上留存了一个待解的疑问:数据真实性与安全评测。

Salesforce 强调为了确保客户数据主权,Koa 的训练没有摄入一条真实客户数据,全盘依靠构建企业沙盒来生成合成语料。但在具体实现上,技术团队由同系列的 Nemotron Nano 30B 模型同时充当用户模拟器、系统工具仿真器与最终的奖励裁判。

这种让同源模型“左右手互搏”的训练方式,在实验室环境中能刷出漂亮的特定任务收敛曲线,却不可避免带来自反性偏差风险。现实中的企业 CRM 充满了破碎的表格、拼写错误的跟进记录与混乱的权限层级;一旦脱离工整的仿真环境,完全浸泡在人工合成数据里的模型能否适应非标业务,需要打上一个问号。

更值得注意的是安全防护。整整 16 页的学术论文里,未见关于 Prompt 注入拦截、数据越权调用或恶意渗透的防御基准测试。在真实生产环境里,工具调用的准确率只决定了它能不能把事做成,而安全边界才决定了它会不会越权把客户隐私发给第三方。

  • 风险.纯合成环境屏蔽了脏数据,也掩盖了 Prompt 注入与越权调用的防御短板,盲目替换生产环境模型可能放大治理隐患。

明争暗合的商业防守

如果产品力并未反超,Salesforce 为何大费周章?

答案不在技术突破,而在地缘与账本。此前在 Agentforce 架构中,凡是遇到复杂长链条任务,流量全都要经由网关分流至 OpenAI 或 Anthropic。这意味着,Salesforce 辛苦打下的企业客户关系,最后变成了给通用大模型厂商打工的管道。

借道 Nvidia 的 Nemotron 搞出 Koa,真正的价值是为自己竖起一道议价杠杆。有了能够应付常规企业流程的自有底座,面对通用大模型厂商的 API 报价时,Salesforce 才有谈判的筹码。

但他们显然没有破釜沉舟的打算。就在发布 Koa 的同一时间,Salesforce 还联合 Anthropic 推出了 ClaudeForce,让企业可以直接调用 Claude 作为核心 AI 交互界面。一手抓合规防守的自研替代,一手拉拢前沿实验室稳住大客户,两者并行不悖。

春秋时期郑国攻打滑国,齐国出面调停,各方虚实试探,皆在边境存亡之间。Salesforce 并非要掀翻模型实验室的饭碗,而是借开源之名,行闭环控盘之实。对于坐拥丰富业务资产的传统软件巨头来说,只要能守住自己的工作流入口与结算账单,技术领先与否,反倒退居其次了。

  • 结论.Koa 的价值是一根用来平衡上游采购成本的杠杆;企业选型时应当紧盯端到端任务成功率,而非停留在开源叙事表面。