一次搜索,两分钱,八秒钟——这是Mixedbread给专用搜索智能体Toast 1报出的价目表。
对照一下:让GPT-5、Claude这类前沿模型自己翻文档、找证据,单次可能要几毛钱到几美元,还得等二十秒到四分钟。Toast 1的逻辑很直接:找证据这件事,不该让最贵的模型亲自动手。
发生了什么,对谁有用
Toast 1接到问题,先拆成子查询,调用检索工具、核对来源,最后打包证据交出去。它能单独跑,也能挂在前沿模型下面当检索子代理,把上下文和算力都留给推理。
官方报的价目:
| 配置 | 单次成本 | 延迟中位数 |
|---|---|---|
| 标准查询 | 约0.016–0.023美元 | 约8秒 |
| 高质量融合 | 约0.05–0.07美元 | 约11秒 |
它和自家Mixedbread Search配合最顺,但官方说可以直接接进企业现有检索索引,不用换后端。
对天天在算Agent账单的工程团队,值得做的不是急着换检索后端,而是先拿现有检索栈接一次Toast 1,跑一批真实任务,看正确率和成本曲线是不是也跟着变。
对正在评估法律、金融知识库方案的技术决策者,法律基准的结果更适合当预算测算的参考——它证明的是"省钱",不是"更准",两者不能划等号去做采购决策。
数据说了什么,说不了什么
金融基准OfficeQA Pro V2上,GPT-5.6 Sol单独跑正确率33%。接上Toast 1做检索子代理,正确率跳到70%,每任务成本约1.15–1.20美元。
要澄清:70%和60%背后是不同模型、不同Agent框架、不同检索栈的组合。图注写的是"只换检索方式",但实际对照牵涉的变量不止检索层,增量不能全部记在Toast 1一个组件头上。
法律基准Harvey LAB抽样33个任务,三种检索方案——原生文件搜索、接入Mixedbread Search、再加Toast 1子代理——最终分数完全一样,都是55分。但Token从8060万降到2300万,成本降幅超过六成。
这张图同样只标注了检索方式的变化,三种配置背后的调用链路其实不完全相同,不是一次干净的单变量实验。能确认的只有一件事:同样的分数,消耗差了三倍多。
金融任务里,Toast 1帮模型答得更对。法律任务里,它只帮模型答得更省。这是两件不同的事,不该混着说。
我怎么看
这些数字都来自Mixedbread自己的测试。法律基准只抽了33个任务的子集,样本量偏小,"最高快12倍、便宜10倍"这类说法,换一批任务未必能复现。
抛开夸张的倍数,方向站得住。前沿模型越来越贵,拿它去翻文档、查证据,本身就是浪费。
"术业有专攻",放在Agent经济里同样成立:小模型专啃检索,大模型专管推理,是明摆着的分工。Mixedbread提到的SID-1、Chroma的Context-1走的都是类似路线——这不是一家公司在孤军作战,更像一个新分工层正在被反复验证。
接下来该盯的不是Toast 1单家的成绩单,而是有没有独立评测机构或企业客户拿真实账单验证这套分工。第三方数据一旦站住,通用大模型在检索环节的溢价就该开始往下砍了。
两分钱一次搜索,便宜是真便宜。但便宜到底靠不靠谱,还得等别人来验一遍。
