Anthropic 于 2026 年 10 月 7 日正式发布轻量模型 Claude Haiku 5.5,并同步上线 Claude 官方平台以及 AWS Bedrock、Google Cloud、Microsoft Azure 三大云服务商。新模型最引人注目的标签是极低的使用门槛:在 100k tokens 提示词范围内,其输入与输出价格分别定为每百万 tokens 0.10 美元和 0.50 美元,官方标价相比上一代 Haiku 4.5 降低达 90%,综合运行成本平均节省约 75%。

这是一次典型的体系化防御动作。在智能体系统逐步转向主模型搭配多个轻量子智能体的背景下,Anthropic 试图用极其廉价的边缘执行者抵御来自 OpenAI 的轻量竞争模型 GPT-6 Luna。然而,账本上看似诱人的折扣与基准跑分,实际上建立在严格的工程条件与隐藏门槛之上。

阶梯定价的深水区:100k Token 的成本分水岭

官方宣传的降价幅度完全集中在短提示词区间。如果调用的提示词长度被控制在 100k tokens 以内,Haiku 5.5 的缓存读取、写入、输入和输出单价分别为 0.01、0.125、0.10 与 0.50 美元。但一旦提示词体积跨过 100k tokens 这一分界线,所有单价将直接飙升 5 倍,分别变为 0.05、0.625、0.50 和 2.50 美元。

定价阶梯机制与长文本陡增风险 短上下文区间(≤100k tokens) 涵盖官方测算中约 90% 的基础请求 $0.10 / $0.50 每百万输入 / 输出 Tokens 单价 缓存读取单价低至 $0.01 / M tokens 长上下文区间(>100k tokens) 多轮对话历史累积或超长检索调用 5× 价格跳变 输入涨至 $0.50,输出涨至 $2.50 / M 成本缓冲带远窄于竞品 272k 阈值

相比之下,竞品 GPT-6 Luna 在不超过 272k 提示词范围内的基础计费同样是 0.10 美元与 0.50 美元,但其阶梯断崖被放置在宽阔得多的 272k tokens 处。在现代多轮智能体作业中,工具调用的执行日志、代码上下文和对话历史极易迅速膨胀。一旦越过 100k 门槛,继续依赖 Haiku 5.5 执行长上下文任务的调用方,可能会发现自己的账单比使用 GPT-6 Luna 还要昂贵。

  • 风险.如果团队没有配置严密的上下文修剪与会话分片策略,多轮智能体调用极易踩中 100k 标记后的五倍溢价陷阱。

跑分显微镜:可调节努力程度背后的成绩折损

Haiku 5.5 是首个支持可调节努力程度(effort setting)的 Haiku 级别模型。官方公布的评测数字相当亮眼:知识工作评测 GDPval-AA 达到 1620,终端代码评测 Terminal-Bench 4.0 拿到 39.2%,桌面操作基准 OSWorld 2.1 线下子集拿下 72.4%。相较于上一代 Haiku 4.5 在 Terminal-Bench 4.0 上交出的 0.0% 白卷,新模型实现了实质性的跨越。

评测基准Haiku 5.5Haiku 4.5GPT-6 Luna
知识工作 GDPval-AA v2.116207351437
桌面操作 OSWorld 2.1 线下子集72.4%15.7%48.9%
跨学科推理 Humanity's Last Exam 无工具45.9%10.2%—
代码执行 Terminal-Bench 4.039.2%0.0%16.4%
视觉推理 Chartography 无工具46.4%6.4%29.1%

但这组漂亮的数据隐藏着一个运行前提。独立技术媒体 The Frontier 披露,官方展示的基准成绩主要在最高努力模式(maximum effort)下跑出,而 API 默认配置其实是中档(medium)。实测显示,GDPval-AA 在中档设定下的实际得分仅为 1277,相比宣传的 1620 分缩水超过 20%。

此外,截至模型上线初期,包括 LMSYS 在内的主流公开独立榜单均未收录 Haiku 5.5 的复现审计数据,非官方追踪站点也存在方法论不透明的情况。这意味着开发者如果直接采用默认 API 参数,将无法在生产环境中直接重现发布文告里展示的纸面实力。

企业落地的真实坐标:调度器而非全能专家

B 端企业的早期测试反馈勾勒出了 Haiku 5.5 更接地气的实际价值:它的长处不是替代旗舰模型攻坚,而是通过压低延迟来改善高频调用的交互手感。

企业协作平台 Asana 在测试中发现,将其接入 AI Teammates 的工单分类和项目搜索流程后,任务完成延迟降低了超过 30%,单轮推理速度提升最高达 2.5 倍。云存储服务商 Box 录得性能指标上升 11 个百分点且延迟减半;AlphaSense 在 400 次文档查询中的准确率从 0.76 提升到 0.84;HubSpot 的三次运行平均准确率则达到了 92.8%。

双层智能体拓扑与成本流动 主脑决策层 Sonnet / Opus 5.5 缓存读取降价 50% 运行成本综合下降 20% 执行中继层 Claude Haiku 5.5 短文本高并发调用 承接总结、路由与压实 端点落地层 环境操作与工具 浏览器操作与终端 吞吐延迟改善显著

配合 Haiku 5.5 的推出,Anthropic 将旗舰级模型 Claude Sonnet 5.5 的缓存读取价格减半至每百万 tokens 0.10 美元,并为 Claude Max 与 Team 订阅用户提供每月 100 至 500 美元不等的 API 额度,同时升级了支持浏览器与电脑操作的 SDK。

这一整套商业组合拳明确展示了 Anthropic 的产品构想:他们并不指望 Haiku 5.5 独当一面去写复杂长代码,而是让降价后的 Sonnet 充当规划总控,让低延迟的 Haiku 充当分流执行的工兵。

  • 建议.工程架构应将 Haiku 5.5 严格限制在分类过滤、上下文压实及简易浏览器动作等短链条环节,长链条逻辑依然需要交由主模型承接。