OpenAI 产品主管 Thibault Sottiaux 在接受 TechCrunch 采访时表示,“世界似乎已经准备好了”。他谈论的重点是 AI 智能体:模型不再只回答问题,而是开始替用户浏览网页、整理资料,甚至执行一连串操作。TechCrunch 还提到,Sottiaux 直接向 OpenAI 联合创始人 Greg Brockman 汇报。
这透露出 OpenAI 当前的产品重心,但不能被理解成用户已经准备好把决定权全部交给 AI。市场确实在寻找能做事的工具,产品是否值得托付却是另一个问题。智能体下一阶段的竞争,也将从模型会不会操作,转向操作失败后能否停下、恢复和追责。
OpenAI 把智能体推到产品主线,用户规模还不能证明信任成立
OpenAI 已经为智能体路线铺了多块产品拼图。2025 年初推出的 Operator 研究预览版可以操作浏览器,完成点击、输入和填写表单等任务;Deep Research 则用于检索、阅读并整理多来源信息。两者都在把 ChatGPT 从对话框推向任务执行工具。
Sottiaux 同时负责产品体验,并直接向 Brockman 汇报,至少表明智能体不是一项孤立实验。OpenAI 正试图把模型能力、交互方式和产品交付放到同一条管理链路上,减少研究演示与实际使用之间的落差。
专访提到的约 2000 万用户,则需要谨慎看待。报道没有清楚说明这是注册用户、活跃用户,还是曾经使用过相关功能的人,也没有给出付费率和重复使用情况。这个数字可以说明市场有兴趣,却不足以证明用户已经形成稳定习惯。
判断智能体是否真正可用,还缺几项更关键的数据:
- 多步骤任务一次完成的比例;
- 用户中途接管或取消的频率;
- 操作失败后能否恢复,而不是从头再来;
- 涉及邮件、支付和企业系统时,权限如何分级;
- 错误操作由谁发现、谁承担损失。
如果这些指标没有公开,“世界准备好了”更像对需求的判断,还不是对产品成熟度的证明。
竞争对手也在操作电脑,差距将落在权限和纠错上
OpenAI 并不是唯一押注智能体的公司。Anthropic 在 2024 年公开 computer use,让 Claude 通过 API 查看屏幕并操作电脑;Google 同年公布 Project Mariner,展示浏览器内理解页面和执行任务的能力。
三家公司选择了相近方向,说明行业已经形成共识:只提高回答质量,很难继续显著扩展产品价值。AI 必须进入用户原本使用的网页、软件和工作流程。
但会点击鼠标只是起点。浏览器页面变化、登录状态失效、弹窗干扰和信息歧义,都会让长链条任务出错。任务步骤越多,前面一次小误判越容易在后面放大。
消费产品和企业产品面对的标准也不同:
| 关键问题 | 个人用户场景 | 企业部署场景 |
|---|---|---|
| 成功标准 | 节省时间,偶尔接管可以接受 | 结果稳定,可重复执行 |
| 权限范围 | 邮箱、日历、网页账号 | 客户数据、内部系统、财务流程 |
| 失败代价 | 多花时间,重新操作 | 数据泄露、错误付款、合规责任 |
| 必要机制 | 操作前确认、随时停止 | 分级授权、审批、日志和审计 |
| 采购判断 | 好不好用、是否愿意付费 | 能否接入系统、追责和控制风险 |
这也是智能体商业化最容易被忽略的限制。个人用户可能愿意让 AI 试着订餐或整理行程,企业却不会因为演示流畅,就允许它直接修改客户资料、提交合同或发起付款。
传统 RPA 软件早已证明,企业愿意为自动化付费;它也留下了一个参照。RPA 虽然不够灵活,但执行路径固定、权限边界清楚。生成式智能体更灵活,也更难预测。OpenAI 若想吃到企业预算,不能只证明它比 RPA 聪明,还要证明它在关键步骤上同样可控。
普通用户别急着开放高风险权限,企业采购应先限定任务
对个人用户而言,最现实的变化是授权请求会越来越多。智能体需要读取邮件、日历和网页内容,才能完成跨应用任务。但读取信息与代替用户采取行动,不该使用同一级权限。
涉及付款、删除文件、发送外部邮件和提交法律文件的任务,现阶段更适合保留人工确认。资料搜集、会议整理和低风险表单填写,则可以优先尝试。省下几分钟,不值得换来一次无法撤回的错误操作。
企业采购团队也不必急着把智能体铺到所有岗位。更稳妥的做法,是从范围清楚、错误可恢复的流程开始测试,例如内部知识检索、工单分类或文档初稿。合同审批、财务付款和客户数据修改,应继续保留人工复核。
接下来最该观察的也不是又多了多少用户,而是 OpenAI 是否公开更硬的产品指标,并补齐企业真正会问的能力:权限分级、审批节点、操作日志、人工接管和失败恢复。只有这些机制进入产品,智能体才会从好看的演示变成可以接预算的工具。
