OpenAI这次没发新模型,而是把Codex和ChatGPT for Work背后跑了很久的那套“agent运行时”直接封装成一个公开的API——Agents API,现在进入公开测试。文档里的承诺很干脆:一次调用,指定任务、模型、工具、环境,就能拿到一个能长时间独立工作、会用工具、能调度子agent的“生产级agent”。
听起来像是把复杂的agent工程一次性打包卖给了所有开发者。但开发者社区翻完文档后,先问的不是“好不好用”,而是“出了事算谁的”。
发生了什么
- 一次API调用创建agent,OpenAI负责托管和维护背后的harness。
- harness来自开源的Codex代码库,GitHub上公开可查。
- 运行环境三选一.OpenAI托管沙箱、开发者自有基础设施、九家合作沙箱伙伴(Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel)。
- 定价上不额外收费,只按tokens和工具用量计费。
工程上确实解决了几个真痛点:上下文快接近上限时自动压缩,让长会话不用开发者自己写压缩逻辑;工具多了会先做工具检索,按需加载定义,省token也保住缓存;找到工具之后再用programmatic tool calling并行跑、串联跑,海量数据处理完只把结果带回上下文;复杂任务还能拆给子agent并行处理,各自维护自己的上下文,主agent最后汇总。这些都是Codex这类长时agent真实踩过的坑,不是凑功能清单。
开发者真正在算的三笔账
Reddit和Hacker News的关注点完全不在一个频道上。 Reddit更在意能不能快速搭起原型、跟LangChain、CrewAI、AutoGen这类开源方案比划算不划算;Hacker News更在意架构控制权和安全边界。两边合起来,其实指向同一个问题:这套东西离生产环境到底还有多远。
第一笔账是成本放大。传统API是一次请求一次计费,agent不是。一个用户操作,可能触发主agent规划、工具调用、子agent并行、结果汇总,中间可能是十次以上的模型和工具调用。“只为tokens和工具付费”这句话没错,但没告诉你多步调用会把账单放大到什么程度,也没给单次运行的预算上限或最大轮次限制——这恰恰是开发者社区问得最多的功能缺口。
第二笔账是锁定升级。以前大家担心的是模型锁定,换个供应商重新调prompt就是了。现在业务逻辑、状态管理、评估流程、工具策略、可观测性全部长在OpenAI托管的harness上,迁移成本不再是换模型那么简单——开源代码库能看不代表能低成本脱离托管服务自己跑一套等效系统。这是从“绑模型”升级成“绑运行时”。
第三笔账是授权边界。agent会读文件、跑代码、调工具,一旦被prompt injection劫持,这些动作会变成发邮件、改记录、退款这类真实后果。approval机制是否真的能拦住这类攻击,目前只能存疑。
能跑通demo不等于能扛生产,这中间隔着的正是这三笔账。
- 风险.approval机制的实际有效性、以及托管沙箱与九家合作伙伴沙箱在隔离粒度、网络访问权限、密钥传递方式上的具体差异,OpenAI都没有给出细节。
锁定从哪层升级到了哪层
以前换供应商,改的是模型层的prompt和调用方式。现在开发者把状态、评估、工具策略都交给OpenAI托管的harness,等于把控制权往上让了一层。开源代码库能看,不代表能拿来自己跑一套等效系统脱离托管——这中间的工程和运维成本,才是真正的迁移门槛。
古人说“君子不立危墙之下”,放在这里不算过度引申——真正老练的开发者不会把授权、状态、幂等性这些关键控制权整体交给一个还在公开测试的第三方运行时,而是把Agents API当成一个能力强但不完全可信的规划和推理组件,自己在应用层多留一道审计和确认的墙。
Agents API现在更像是一个把agent工程门槛拉低的原型加速器,能不能变成真正的生产控制平面,要看接下来几件事:沙箱隔离细节能不能补齐、pricing page的成本结构是不是真的可预测、有没有受监管行业能拿出来的生产案例。这些答案目前还没有,只能说:入门快了,出门的账,还得开发者自己先算清楚。
