Exa在2026年9月24日上线了代号为“Lists without Limits”的Agent Ultra,把搜索代理的单次任务时长直接拉到了30分钟至3小时。随之公布的还有一张漂亮的战报:在WANDR、DeepSearchQA、WideSearch以及内部的Company Find-All四个基准测试中,这项服务全面压制了Opus 5.5、GPT-6 Astra与Perplexity Agent。
表面上看,这像是垂类搜索对通用大模型的一次完胜。但我更在意的是它背后的工程实质:这根本不是给普通人做日常问答的即时对话工具,而是一个按重算力计费、动辄耗费数美元乃至数十美元的离线数据批处理管道。
跑分领先背后的裁判戏法
官方通告里最抓人眼球的,是Agent Ultra在各大评测中的压制性数字。在Perplexity开源的WANDR基准上,它拿下了81.4%的软召回率,绝对值超出Opus 5.5达9.1个百分点;而在涵盖17个领域、900道长程任务的DeepSearchQA中,其F1得分也冲到了93.9%。
但只要翻开测试实现,就会发现这场比赛的跑道并不对称。DeepSearchQA最初的设计是借助Gemini 2.5 Flash作为语义裁判,而Exa在运行WANDR测试时,不仅将底层抓取工具全量替换成了自家的千亿文档索引,甚至调整了数据传输逻辑,并指定gpt-6-luna担任打分裁判。部分竞品数据沿用其公开战绩,部分则由Exa代跑。
这种“既当运动员又换裁判器械”的做法,在业内早已司空见惯,却难掩测试环境的偏向性。更耐人寻味的是Company Find-All这项内部任务:通稿中写着Agent Ultra平均每任务抓出2,451个合规实体,将Opus 5.5的146个甩在身后;但在Exa更早披露的版本里,这个数字曾记录为229行(竞品仅为48至60行)。口径剧烈跳变的自研基准,很难直接视作通用的行业标尺。
算力账本里的单价与总价
所谓“更便宜”,往往只存在于特定计算公式里。
Exa极力强调其低成本优势:在WideSearch中单任务支出为3.85美元,比Perplexity低25%、比Opus 5.5便宜40%、比GPT-6 Astra省下54%;在DeepSearchQA里也宣称成本比GPT-6 Astra低了52%。但只要拉到复杂长任务下,账目便立刻变重。
在WANDR测试中,Agent Ultra单任务的中位数开销是18.53美元。虽然低于Opus 5.5的32.92美元、Perplexity Agent的28.38美元以及GPT-6 Astra的23.09美元,但这依旧是一笔沉甸甸的云端开支。而在Company Find-All内部测试里,官方披露单任务绝对支出最低的反而是GPT-6 Astra,仅需7.35美元。
所谓的低成本并非单次调用的廉价,而是重算力饱和攻击下对单实体的边际摊薄。
Exa的技术调度依赖一套混合策略:先由主智能体拆解任务,分发给子智能体集群,再根据分析环节的难易度动态路由模型——轻量步骤分发给小模型,推理密集处调用前沿模型。它确实在一个任务内搜罗了海量数据,但在企业真实采购的账本上,跑十几个复杂任务就意味着数百美元的流出。
文档断层与真实的落地场景
工程实现中的细节差异往往比公关口径更为刺眼。
通稿宣称只要在API里配置effort: "ultra"即可体验该能力,代码走的是标准异步端点POST https://api.exa.ai/agent/runs。但翻看其公开文档与代码库,固定档位的枚举值目前其实封顶于xhigh(单次请求标价1.00美元)。
Exa原有的公开阶梯非常清晰:从minimal的0.012美元、low的0.025美元、medium的0.10美元,到high的0.50美元;自动挡按算力与工具计费,计算单元为0.10美元/ACU,检索工具调用为0.005美元/次。宣传中的“ultra”虽然默认预算拉到了20美元(支持配置1到100美元),但在工程集成的命名口径上,显然还处于演进与打磨之中。
| 计费档位 / 参数 | 单次基准单价 | 任务耗时特征 | 适用业务场景 |
|---|---|---|---|
| minimal 至 medium | $0.012 - $0.10 | 毫秒至数秒 | 简单实体比对、实时轻量查询 |
| high 至 xhigh | $0.50 - $1.00 | 数十秒至分钟级 | 结构化多源比对、基础实体富化 |
| Agent Ultra (宣传档位) | 中位数 $18.53 (上限$20) | 30分钟至3小时 | 全网穷尽挖掘、离线拓客与尽调 |
这种长时程也决定了它的受众相当聚焦。
- 结论.它适合金融机构做穿透式尽调或投研图谱、GTM团队批量清洗并富化销售线索,以及模型团队收集特定训练语料。
- 提醒.社区开发者在Hacker News上的反馈指出了另一个软肋——Exa基于千亿静态文档索引在人名与实体关联上极其扎实,但面对即时突发新闻或高权限墙后数据时覆盖能力依然有限。
天下之事,备于内者难应于外。长达数小时的异步任务,要求调用方建立完善的容错与轮询逻辑。当网络抖动或长尾页面出现死链时,模型极易为了满足穷尽要求而陷入低效空转。它不是万能的个人助手,而是一台专供企业做脏活累活的自动化铲矿机。
