2026 年 9 月 20 日,阶跃星成上线了面向智能体任务的新一代旗舰模型 Step 5 Preview。模型采用 600B 总参数、27B 激活参数的稀疏混合专家架构,支持 1M token 上下文与多模态视觉输入,官方宣称要在软件工程与金融分析等任务中推移智能与成本的帕累托前沿。

这并非一次简单的算力堆叠,而是国产模型在大规模工程落地压力下向成本妥协的代表作。但在极低激活率带来的高吞吐和低单价背后,Step 5 Preview 在真实复杂长流程任务中的能力断层,以及高分榜单里的指标口径修饰,决定了它眼下更像是一个用于探索性价比极限的实验品,而非可以直接接管生产环境的通用主力。

4.5% 激活率换来的高吞吐与成本妥协

Step 5 Preview 最核心的架构特征在于极高的稀疏度。600B 的总体模型体量下,每个 token 仅激活 27B 参数,激活比仅约 4.5%。这种设计的目标非常直接:用大参数量维持知识容量,用极小激活计算量压榨推理速度和调用成本。

极低激活率下,仅极少数指示灯随高速吞吐脉冲闪烁
极低激活率下,仅极少数指示灯随高速吞吐脉冲闪烁

第三方评测机构 Artificial Analysis 随后给出的独立实测数据,验证了这种架构在推理效率层面的优势。其智能指数测值为 43.6(四舍五入为 44),平均单任务成本控制在 0.71 美元,运行完整测试套件总耗资约 922.84 美元。

在商业调用的价格模型上,该模型呈现出鲜明的非对称特征。第三方 API 实测价格设定为输入 1.00 美元/1M tokens、缓存读取 0.05 美元/1M tokens、输出 2.70 美元/1M tokens,在常见的 7:2:1 混合调用模式下,综合成本约为 0.51 美元/1M tokens。同时,其推理吞吐速度达到了 99.8 tokens/s,首字延迟(TTFT)为 2.96 秒。

Step 5 Preview 商业调用核心效能实测 4.5% 激活参数比 (27B/600B) 99.8 推理速度 (tokens/s) $0.51 混合成本 (/1M tokens) $0.71 基准任务均价 (/Task)

这一组数据解释了阶跃星成所称的推移帕累托前沿:它并没有刷新人类大模型智能的绝对天花板,而是试图在 44 分这一主流可用智能水位上,把单位经济成本压到同级模型的几分之一。

跑分滤镜下的真实能力断层

高性价比标签的另一面,是模型在面对严苛外部环境时的表现落差。

剥离自测滤镜后,精密试样在严苛复测下的内部腰斩断层(剖面示意)
剥离自测滤镜后,精密试样在严苛复测下的内部腰斩断层(剖面示意)

最直接的反差体现在长程终端操作基准 Terminal-Bench v4 上。Artificial Analysis 的独立复测确认了该成绩为 33.3%(四舍五入后显示为 33%)。这与官方在旧版本 Terminal-Bench v2.1 上取得的 85.0% 毫无可比性,因为两个评测套件的任务难度与环境严苛度存在代际差异。更重要的是,在同一套 v4 测试体系下,GPT-6 Astra 取得了 57.9%,Claude Opus 5 取得了 52.3%,GLM-5.3 也有 41.9%。Step 5 Preview 在这里的断层,说明极低激活参数在应对深层错误排查与非确定性交互时,推理连贯性容易受到抑制。

终端智能体基准 Terminal-Bench v4 横向对照 GPT-6 Astra 57.9% Claude Opus 5 52.3% GLM-5.3 41.9% Step 5 Preview 33.3% Kimi K3 12.6%

官方榜单中的其他亮眼数据同样需要剥除滤镜:

在 ProgramBench 测试中,官方给出的 80.5% 分数属于测试通过率(Test-pass Rate)。根据 ProgramBench 官方榜单规则,该基准对代码工程的实际解决能力有着极为严苛的界定,其排行榜第一名模型的完全解决率(Resolved)仅为 4.5%,接近解决率(Almost-resolved)为 37.0%。用宽泛的用例通过率代替完全解决率,放大了模型的完工表象。

在软件工程自动化基准 DeepSWE v1.1 上,官方声称的 67.7% 分数,截至 2026 年 9 月 3 日的公开排行榜中并无对应记录,属于厂商自测范畴。

至于展现其全语种领跑的 StepCodeBench(标称 49.0%),本身就是阶跃星成自研的私有测试集,涵盖 553 个独立代码库,目前外部既无公开测试套件,也无第三方复现对照。

极低激活率省下的是推理算力,但在长程多轮交互中,模型容易在深水区失准。
  • 风险.官方自选指标无法直接映射到真实工程环境,尤其是把软性测试通过率与独立解决率混淆时,企业极易低估后续人工介入修代码的隐性成本。

生产定位:高性价比试错与边缘实验品

剥除宣发布景后,审视当前的智能体市场格局,各家模型的分工逻辑已经非常清晰。

未正式封箱的裸板工程机,印证早期实验品定位与资料缺失
未正式封箱的裸板工程机,印证早期实验品定位与资料缺失

海外阵营中,Claude Opus 5 依靠对大型代码仓库上下文的稳定掌控,牢牢占据生产级代码重构和深层调试的首席位置;GPT-6 Astra 则在通用推理与复杂指令综合解决率上维持标杆。

国内竞品同样形成了针对性分工。Kimi K3 凭借长上下文工程体系在复杂信息梳理上占优,GLM-5.3 则在高并发吞吐任务中积累了更广泛的生产验证。

相比之下,Step 5 Preview 依然处于明显的早期预览阶段。截至 2026 年 9 月 20 日,其官方产品页面内容甚至尚未完成基础的搜索引擎索引,开发者后台默认主推的依旧是上一代 Step 3.7 Flash。此前社区传出的 Hugging Face 权重仓库目前无法公开访问,官方既未发布正式的技术报告,也未披露完整的 Model Card。

模型产品核心优势关键局限推荐适用场景
Claude Opus 5复杂代码重构、长程可靠性调用单价高昂核心业务代码重构、生产级调试
GPT-6 Astra通用智能与多任务泛化天花板成本极高、工具调用受限高难度综合推理、跨领域规划
GLM-5.3吞吐表现均衡、开放度较高极限代码理解存在波动高并发企业后台服务
Step 5 Preview极低激活成本、吞吐达 99.8t/s长程执行断层、缺乏技术报告边缘流程试错、非核心代码草拟

在长达 22 小时的 MLA GPU 内核优化实验中,Step 5 Preview 取得了 508 TFLOPS 的峰值表现;它在宝可梦红版游戏里也撑过了 3,000 轮交互与 600 万 tokens。这些案例证明它在具备确定反馈信号的场景中拥有自主试错能力。但在复杂的现实业务流中,模型面对的往往是模糊的需求、不完整的日志和充满脏数据的外部系统。

  • 结论.对于企业技术选型团队而言,现阶段不宜将关键生产链条切换至 Step 5 Preview,更务实的做法是将其置于成本敏感的边缘脚本生成、初步信息聚合等环节充当高通量粗筛工具,真正的代码架构改造与核心交易审计仍需交由高可靠性模型兜底。

接下来最核心的观察指标,在于阶跃星成能否在后续开源进展中兑现代码权重与技术报告,并在 DeepSWE 等公开基准排行榜上接受无需挑选参数的第三方直接检验。