Exa在2026年9月24日上线了代号为“Lists without Limits”的Agent Ultra,把搜索代理的单次任务时长直接拉到了30分钟至3小时。随之公布的还有一张漂亮的战报:在WANDR、DeepSearchQA、WideSearch以及内部的Company Find-All四个基准测试中,这项服务全面压制了Opus 5.5、GPT-6 Astra与Perplexity Agent。

表面上看,这像是垂类搜索对通用大模型的一次完胜。但我更在意的是它背后的工程实质:这根本不是给普通人做日常问答的即时对话工具,而是一个按重算力计费、动辄耗费数美元乃至数十美元的离线数据批处理管道。

跑分领先背后的裁判戏法

官方通告里最抓人眼球的,是Agent Ultra在各大评测中的压制性数字。在Perplexity开源的WANDR基准上,它拿下了81.4%的软召回率,绝对值超出Opus 5.5达9.1个百分点;而在涵盖17个领域、900道长程任务的DeepSearchQA中,其F1得分也冲到了93.9%。

但只要翻开测试实现,就会发现这场比赛的跑道并不对称。DeepSearchQA最初的设计是借助Gemini 2.5 Flash作为语义裁判,而Exa在运行WANDR测试时,不仅将底层抓取工具全量替换成了自家的千亿文档索引,甚至调整了数据传输逻辑,并指定gpt-6-luna担任打分裁判。部分竞品数据沿用其公开战绩,部分则由Exa代跑。

这种“既当运动员又换裁判器械”的做法,在业内早已司空见惯,却难掩测试环境的偏向性。更耐人寻味的是Company Find-All这项内部任务:通稿中写着Agent Ultra平均每任务抓出2,451个合规实体,将Opus 5.5的146个甩在身后;但在Exa更早披露的版本里,这个数字曾记录为229行(竞品仅为48至60行)。口径剧烈跳变的自研基准,很难直接视作通用的行业标尺。

离线批处理引擎与即时搜索的机制分化 传统对话式检索 代表:通用模型搜索模式 响应耗时:5 到 30 秒 任务形态:单次问答与摘要 实体捕获:受限长尾衰减,易遗漏 单次成本:极低(不足0.1美元) Agent Ultra 离线集群 代表:子智能体并行挖掘 响应耗时:30 分钟至 3 小时 任务形态:枚举万级列表与校验 实体捕获:子集群暴力穷尽遍历 单次成本:重度开销(上限达20美元)

算力账本里的单价与总价

所谓“更便宜”,往往只存在于特定计算公式里。

Exa极力强调其低成本优势:在WideSearch中单任务支出为3.85美元,比Perplexity低25%、比Opus 5.5便宜40%、比GPT-6 Astra省下54%;在DeepSearchQA里也宣称成本比GPT-6 Astra低了52%。但只要拉到复杂长任务下,账目便立刻变重。

在WANDR测试中,Agent Ultra单任务的中位数开销是18.53美元。虽然低于Opus 5.5的32.92美元、Perplexity Agent的28.38美元以及GPT-6 Astra的23.09美元,但这依旧是一笔沉甸甸的云端开支。而在Company Find-All内部测试里,官方披露单任务绝对支出最低的反而是GPT-6 Astra,仅需7.35美元。

所谓的低成本并非单次调用的廉价,而是重算力饱和攻击下对单实体的边际摊薄。

Exa的技术调度依赖一套混合策略:先由主智能体拆解任务,分发给子智能体集群,再根据分析环节的难易度动态路由模型——轻量步骤分发给小模型,推理密集处调用前沿模型。它确实在一个任务内搜罗了海量数据,但在企业真实采购的账本上,跑十几个复杂任务就意味着数百美元的流出。

WANDR基准单任务中位数成本与耗时上限 $18.53 Ultra中位数任务开销 低于竞品的23至32美元 3.0 h 单任务最大执行上限 常规复杂任务需约30分钟 $20.00 默认计费安全阈值 支持可调范围$1至$100

文档断层与真实的落地场景

工程实现中的细节差异往往比公关口径更为刺眼。

通稿宣称只要在API里配置effort: "ultra"即可体验该能力,代码走的是标准异步端点POST https://api.exa.ai/agent/runs。但翻看其公开文档与代码库,固定档位的枚举值目前其实封顶于xhigh(单次请求标价1.00美元)。

Exa原有的公开阶梯非常清晰:从minimal的0.012美元、low的0.025美元、medium的0.10美元,到high的0.50美元;自动挡按算力与工具计费,计算单元为0.10美元/ACU,检索工具调用为0.005美元/次。宣传中的“ultra”虽然默认预算拉到了20美元(支持配置1到100美元),但在工程集成的命名口径上,显然还处于演进与打磨之中。

计费档位 / 参数单次基准单价任务耗时特征适用业务场景
minimal 至 medium$0.012 - $0.10毫秒至数秒简单实体比对、实时轻量查询
high 至 xhigh$0.50 - $1.00数十秒至分钟级结构化多源比对、基础实体富化
Agent Ultra (宣传档位)中位数 $18.53 (上限$20)30分钟至3小时全网穷尽挖掘、离线拓客与尽调

这种长时程也决定了它的受众相当聚焦。

  • 结论.它适合金融机构做穿透式尽调或投研图谱、GTM团队批量清洗并富化销售线索,以及模型团队收集特定训练语料。
  • 提醒.社区开发者在Hacker News上的反馈指出了另一个软肋——Exa基于千亿静态文档索引在人名与实体关联上极其扎实,但面对即时突发新闻或高权限墙后数据时覆盖能力依然有限。

天下之事,备于内者难应于外。长达数小时的异步任务,要求调用方建立完善的容错与轮询逻辑。当网络抖动或长尾页面出现死链时,模型极易为了满足穷尽要求而陷入低效空转。它不是万能的个人助手,而是一台专供企业做脏活累活的自动化铲矿机。