2026年10月1日,AWS旗下Strands Labs开源首个轻量级决策模型Strands Decider 2B,由杰出工程师Marc Brooker基于约19亿参数的Qwen3.5-2B-Base改装发起。该模型效仿初创团队TypeSafe此前推出的Jev模型,同周OpenAI亦公布了类似方向的技术尝试。多方几乎在同一时间扑向同一赛道,背后的驱动力十分明确:当AI系统从单体对话演进为多智能体集群(Swarm Agents),协调层频繁出现工具调用与路由判断,传统前沿大模型的高昂延迟与自回归输出极易引发的JSON格式崩溃,正在成为拖垮整个自动化系统的瓶颈。
但这绝非一场开源轻取闭源的技术替代。当开发者把自回归生成头切除、换上仅靠单次前向传播输出概率的指针头后,虽然换来了百毫秒级的响应速度,却也在高难度推理场景中撞上了断崖式的性能衰退。
剥离自回归生成头,百毫秒级的控制平面重构
在传统的Agent调度链路中,让大语言模型决定下一步做什么往往极为浪费。模型需要逐字自回归吐出包含思考过程和结构化标记的文本,稍有不慎还会因为标点或格式错误破坏下游解析。
官方仓库strands-labs/strands-decider展示了极为激进的技术手术:工程团队完全移除了基座模型的LM Head,取而代之的是一个仅约100万参数的Pointer Head,配合Rank-16 LoRA进行微调。该架构彻底放弃了生成自然语言字符的能力,转而直接读取Transformer最后一层的隐藏状态,在单次前向计算中直接输出预设选项的概率分布。
这一架构改动直接反映在物理性能上。在RTX 3090显卡配合WSL2的测试环境下,该模型中位数延迟仅为115毫秒,P95延迟控制在299毫秒。即使部署在端侧苹果M3 Pro芯片上,处理300 token以内的任务时中位延迟也只有153毫秒(尽管面对全基准长任务时P95延迟会飙升至2628毫秒)。需要分清的是,AWS此番开源的代码库为strands-labs/strands-decider,与第三方开发者Mapika主导的decider-2b属于两个不同项目。
这种架构设计的意图是降低单步决策摩擦。当Agent执行工具分发或流程流转时,不再需要动用庞大的通用生成模型,本地小尺寸指针模型即可提供毫秒级反馈。
穿透JevBench:简单任务满分与复杂推理腰斩
极低延迟的背后,是性能表现的两极分化。
AWS公布的官方基准评估权重为StrandsAgents/strands-decider-2B-hobson-v19。工程团队此前曾尝试调优v20版本,但因评估提升未超训练噪声、且未通过4项预注册测试,该试验权重已被废弃。在预注册的3072-token窗口下,hobson-v19在JevBench公开评测集上取得了72.3%的准确率(231题命中167题),预期校准误差(ECE)为0.052,Brier得分为0.342。
关于排名的争议在此处需要厘清。原文提到该项目曾短暂登顶Jevbench同尺寸榜单,但官方技术记录显示,v19并未正式列入公开排位榜,Brooker本人也在技术博文中坦承早期项目Hobson当时已落后于Mapika模型,当前开源发布并不等同于占据榜首。
真正值得关注的是测试集的难度分层:
| 评估指标 / 任务分级 | OpenAI GPT-5.6 Luna | TypeSafe Jev 1.13 | Strands Decider 2B (v19) |
|---|---|---|---|
| 公开集综合准确率 | 97.1% | 96.3% | 72.3% |
| 简单任务准确率 | 99.4% | 99.1% | 100% |
| 标准任务准确率 | 97.8% | 96.5% | 87.5% |
| 高难任务准确率 | 94.2% | 93.3% | 50.5% |
| 校准误差 (ECE) | 0.016 | 0.027 | 0.052 |
| 调用时延 (中位数) | 0.98秒 | 0.65秒 | 0.115秒 |
| 千次调用预估成本 | 0.176美元 | 0.027美元 | 极低(本地开源计算) |
数据暴露出明显的断层:在明确且低歧义的简单任务上,Strands Decider 2B拿下了100%的满分,标准任务也有87.5%的稳定输出;但在需要多层因果判断的高难度任务中,准确率骤降至50.5%,几乎与抛硬币无异。
更深层的隐患藏在置信度分布里。在4个未见泛化测试集上,当模型输出的置信度大于等于0.9时,其准确率确实高达95.2%。但统计表明,这种模型自己敢打包票的超高置信区间,仅覆盖了23%的样本。在长文本信息抽取与条件充分性判定等长尾场景中,模型表现出严重的欠置信倾向,使得开发者很难单凭单一置信度阈值建立自动化安全边界。
类型安全并非语义正确,级联架构才是解法
社区对这类模型的祛魅正在发生。很多开发者指出,通过Pointer Head直接限定输出集合,本质上是把分类器和重排器包了一层时髦的外衣。
消除格式崩溃并不等于逻辑成立,交出合法结构却选错选项同样是灾难。
更严肃的技术漏洞来自概率校准与安全性。学术界实测表明,哪怕是更成熟的专有模型TypeSafe Jev,在处理逻辑强相关命题时也不完全遵守概率公理,正反互斥命题的概率求和往往并不严格等于1。更重要的是,决策模型完全继承了底层文本模型的提示词注入风险。安全测试证实,黑客向上下文状态中注入虚假的审批通过记录,依然能严重扭曲决策模型的概率分布。
面对开源复刻浪潮,TypeSafe创始人Diogo Almeida公开反驳称,行业低估了让小模型真正具备稳定智能的门槛,目前的开源尝试更像算法工程师在搭建新颖架构,而非解决智能落地的核心难题。目前商业方案Jev 1.13以0.65秒的中位延迟和0.027美元的千次调用成本,依然在复杂推理准确率(96.3%)上拉开明显差距。
- 风险.切忌将小型决策模型作为唯一鉴权或高风险业务终审关卡,结构合法绝不代表免受提示词注入污染。
- 建议.将轻量决策模型部署在协调层入口过滤常规路径,当输出置信度跌破阈值时回退至前沿大模型,方能平衡集群成本与系统稳健性。
随着决策边际成本的骤降,多智能体系统的单日调用频次很可能被推高数倍。但小参数决策模型的定位并非全量替代大模型,通过置信度分层、构建小模型低成本分流与大模型兜底的级联架构,才是当前工业级自动化落地的务实路径。
