让一个自主编写代码的 AI 跑上几十分钟,中途调用上百次外部工具,工程师最怕的不是模型变笨,而是进程莫名崩溃。在传统的重试机制里,一个微小的网络抖动或超时,就会把前面积累的执行上下文全部清零,重新跑一次既浪费算力,又可能带来状态不一致的灾难。
柏林初创公司 Restate 拿出的解法正在吸引资本下注。Restate 刚刚宣布完成 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 与 Capital One Ventures 参投。这家由流计算框架 Apache Flink 联合创作者 Stephen Ewan 等人于 2022 年创办的公司,此前在 2024 年 6 月拿过 Redpoint 领投的 700 万美元种子轮(Essence VC 和 firstminute.capital 参投)。他们把自研的轻量级持久化执行引擎推向了当下最拥挤的赛道:正面迎击赛道巨头 Temporal。
巨头阴影下的架构代际差
持久化执行(Durable Execution)并不是新鲜概念,它负责在进程崩溃或网络中断后,让程序从断点精准恢复,而无需重头执行。这个领域长久以来的代名词是 Temporal。2019 年创立的 Temporal 走的是成熟的企业级路线,其在 2026 年 2 月刚完成由 Lightspeed 领投的 3 亿美元 D 轮融资,报道称其估值已飙升至 125.5 亿美元。
但 Temporal 诞生于微服务盛行的时代。它的经典架构建立在外部数据库+工作流轮询之上:执行状态写入 Cassandra、PostgreSQL 或 Elasticsearch,后端的 Worker 节点通过长轮询拉取任务。这种设计跑低频、粗粒度的电商结账或转账流程极其稳健,可一旦碰上单次执行包含成百上千次工具调用的 AI Agent,高昂的调度开销和数据库写入延迟就成了瓶颈。
Restate 的技术底气来自创始团队深厚的分布式流处理基因。三位联合创始人 Stephen Ewan、Igal Shilman 和 Till Rohrmann 曾是流计算平台 Data Artisans(后被阿里巴巴收购更名为 Ververica)的核心骨干。他们没有沿用把状态委托给外部数据库的做法,而是把流计算里的内嵌状态机与复制日志直接塞进了单一运行时。
去掉了外部数据库的网络中转与复杂的 Worker 抢锁,Restate 宣称其持久化操作的 P99 延迟开销低于 10 毫秒,生产环境吞吐量超过 100,000 actions/秒。在代码生成平台 Replit 的实际生产场景中,每个隔离单元的处理能力可以达到 25,000 actions/秒,足以应对一次 Agent 任务内部吞吐的数千个细粒度持久化步骤。
Replit 倒戈背后的经济账本
Restate 能够在市场上迅速立足,关键在于拿下了 Replit 这个标杆案例。Replit 总裁兼 AI 负责人 Michele Catasta 公开表示,Replit Agent 已经从 Temporal 迁移至 Restate,并在跨可用区运行数十个自建云单元。
对于 Replit 而言,代码生成是一个容错率极低的连续链路。必须理清的是,Replit 的安全底座靠的是沙箱运行环境、文件系统快照以及版本化数据库,这些机制保证了文件变更能够按需回滚;而持久化执行引擎解决的是更高层面的问题:一旦容器重启或环境抖动,Agent 的推理与工具调用链路必须能无缝接续。
不少开发者被 Restate 吸引,直接原因是明面上的价格落差。在云端计费策略上,两家给出了截然不同的定价方案:
| 平台与方案 | 月度基础费用与配额 | 额外调用单价(每百万次) | 存储与额外计费项 |
|---|---|---|---|
| Restate Starter | 75 美元/月(含 500 万次动作) | 25 美元递减至 10 美元 | Virtual Object 存储另计 |
| Restate Business/Prem | 300 美元(2000万次)/ 1000 美元(5000万次) | 阶梯递减至 10 美元 | 针对高吞吐场景定制 |
| Temporal Cloud | 100 美元/月基础计划费 | 50 美元(AWS 基准价) | 企业服务支持与存储另计 |
但这里潜藏着一个计费口径的认知陷阱。Temporal 的动作(Action)计量偏向粗粒度,主要对工作流启动、Activity 触发和外部信号计数;而在 Restate 的模型中,由于其将所有内联步骤、RPC 调用、Promise 状态写入全部纳入调度,每一个细微环节都在消耗动作额度。这意味着,在 Agent 的复杂推理循环里,Restate 的总调用次数可能会成倍增加,综合持有成本未必像单价对比那样悬殊。
- 提醒.评估持久化方案不能只看每百万次调用的单价标签,必须先按自身业务的调用拓扑,测算单次任务触发的内部状态写入总数。
吞吐量之外的隐形暗礁
工程选型从来没有免费的午餐。Restate 凭借轻量和低延迟撕开了市场的一角,但摆在它面前的壁垒依然厚重。
架构的极简往往意味着运维依赖的极度集中。
Temporal 之所以把状态交给外部企业级数据库,是因为 Cassandra 和 SQL 拥有数十年的生产验证与灾备经验,出现问题时运维团队有现成的工具链去排查。Restate 将复制日志、调度和状态完全收敛在一个自研二进制组件中,虽然换取了极致性能,却也让自身成为了整个系统的强状态单点。一旦底层存储在复杂分区故障下出现未知异常,排查成本会远高于标准的数据库方案。
此外,Temporal 在生态层面构筑的防线相当坚固。目前 Temporal 已经针对主流的 Agent 框架发布了专用集成支持,包括 OpenAI Agents SDK、LangGraph、Google ADK、Pydantic AI、Mastra 以及 Vercel AI SDK。而企业客户在采购时,不仅看重延迟指标,更看重系统是否具备处理突发峰值的能力。Temporal Cloud 目前支持自动扩容至 300,000 actions/秒以上,曾扛住过超 150,000 actions/秒的突发流量。
目前关于 Replit 全面迁移的消息,主要仍来自 Restate 单方面的宣传与引述,Replit 官方博客并未发布完整的独立架构复盘。一家刚刚完成 A 轮融资、团队规模尚小的初创企业,要在 Fortune 500 客户的核心系统里真正取代百亿美元体量的行业标准,光靠极客式的性能优势还远远不够。
- 结论.对于高频工具调用、延迟敏感且链路轻量的 Agent 原生应用,Restate 是极具竞争力的现代化底座;但在涉及复杂合规审计与多云容灾的企业核心业务中,Temporal 依靠外挂成熟存储构筑的生态护城河短期内依然牢固。
