Anthropic 于 2026 年 10 月 7 日正式发布轻量模型 Claude Haiku 5.5,并同步上线 Claude 官方平台以及 AWS Bedrock、Google Cloud、Microsoft Azure 三大云服务商。新模型最引人注目的标签是极低的使用门槛:在 100k tokens 提示词范围内,其输入与输出价格分别定为每百万 tokens 0.10 美元和 0.50 美元,官方标价相比上一代 Haiku 4.5 降低达 90%,综合运行成本平均节省约 75%。
这是一次典型的体系化防御动作。在智能体系统逐步转向主模型搭配多个轻量子智能体的背景下,Anthropic 试图用极其廉价的边缘执行者抵御来自 OpenAI 的轻量竞争模型 GPT-6 Luna。然而,账本上看似诱人的折扣与基准跑分,实际上建立在严格的工程条件与隐藏门槛之上。
阶梯定价的深水区:100k Token 的成本分水岭
官方宣传的降价幅度完全集中在短提示词区间。如果调用的提示词长度被控制在 100k tokens 以内,Haiku 5.5 的缓存读取、写入、输入和输出单价分别为 0.01、0.125、0.10 与 0.50 美元。但一旦提示词体积跨过 100k tokens 这一分界线,所有单价将直接飙升 5 倍,分别变为 0.05、0.625、0.50 和 2.50 美元。
相比之下,竞品 GPT-6 Luna 在不超过 272k 提示词范围内的基础计费同样是 0.10 美元与 0.50 美元,但其阶梯断崖被放置在宽阔得多的 272k tokens 处。在现代多轮智能体作业中,工具调用的执行日志、代码上下文和对话历史极易迅速膨胀。一旦越过 100k 门槛,继续依赖 Haiku 5.5 执行长上下文任务的调用方,可能会发现自己的账单比使用 GPT-6 Luna 还要昂贵。
- 风险.如果团队没有配置严密的上下文修剪与会话分片策略,多轮智能体调用极易踩中 100k 标记后的五倍溢价陷阱。
跑分显微镜:可调节努力程度背后的成绩折损
Haiku 5.5 是首个支持可调节努力程度(effort setting)的 Haiku 级别模型。官方公布的评测数字相当亮眼:知识工作评测 GDPval-AA 达到 1620,终端代码评测 Terminal-Bench 4.0 拿到 39.2%,桌面操作基准 OSWorld 2.1 线下子集拿下 72.4%。相较于上一代 Haiku 4.5 在 Terminal-Bench 4.0 上交出的 0.0% 白卷,新模型实现了实质性的跨越。
| 评测基准 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna |
|---|---|---|---|
| 知识工作 GDPval-AA v2.1 | 1620 | 735 | 1437 |
| 桌面操作 OSWorld 2.1 线下子集 | 72.4% | 15.7% | 48.9% |
| 跨学科推理 Humanity's Last Exam 无工具 | 45.9% | 10.2% | — |
| 代码执行 Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% |
| 视觉推理 Chartography 无工具 | 46.4% | 6.4% | 29.1% |
但这组漂亮的数据隐藏着一个运行前提。独立技术媒体 The Frontier 披露,官方展示的基准成绩主要在最高努力模式(maximum effort)下跑出,而 API 默认配置其实是中档(medium)。实测显示,GDPval-AA 在中档设定下的实际得分仅为 1277,相比宣传的 1620 分缩水超过 20%。
此外,截至模型上线初期,包括 LMSYS 在内的主流公开独立榜单均未收录 Haiku 5.5 的复现审计数据,非官方追踪站点也存在方法论不透明的情况。这意味着开发者如果直接采用默认 API 参数,将无法在生产环境中直接重现发布文告里展示的纸面实力。
企业落地的真实坐标:调度器而非全能专家
B 端企业的早期测试反馈勾勒出了 Haiku 5.5 更接地气的实际价值:它的长处不是替代旗舰模型攻坚,而是通过压低延迟来改善高频调用的交互手感。
企业协作平台 Asana 在测试中发现,将其接入 AI Teammates 的工单分类和项目搜索流程后,任务完成延迟降低了超过 30%,单轮推理速度提升最高达 2.5 倍。云存储服务商 Box 录得性能指标上升 11 个百分点且延迟减半;AlphaSense 在 400 次文档查询中的准确率从 0.76 提升到 0.84;HubSpot 的三次运行平均准确率则达到了 92.8%。
配合 Haiku 5.5 的推出,Anthropic 将旗舰级模型 Claude Sonnet 5.5 的缓存读取价格减半至每百万 tokens 0.10 美元,并为 Claude Max 与 Team 订阅用户提供每月 100 至 500 美元不等的 API 额度,同时升级了支持浏览器与电脑操作的 SDK。
这一整套商业组合拳明确展示了 Anthropic 的产品构想:他们并不指望 Haiku 5.5 独当一面去写复杂长代码,而是让降价后的 Sonnet 充当规划总控,让低延迟的 Haiku 充当分流执行的工兵。
- 建议.工程架构应将 Haiku 5.5 严格限制在分类过滤、上下文压实及简易浏览器动作等短链条环节,长链条逻辑依然需要交由主模型承接。
