OpenAI 今天甩出两份报告,最扎眼的一句话是:用得最猛的头部企业,人均产出的token是普通企业的8.3倍,而半年前,一月份,这个差距只有2.6倍。三倍的跃升,足够让任何一个还在纠结要不要上马agentic AI的CIO心里一紧。

但这把尺子,从头到尾都攥在OpenAI自己手里。

先看数字:企业AI确实在变

几个事实值得先摆清楚:

  • 截至6月,Codex生成的token占Codex和ChatGPT企业客户合计输出的64%,说明越来越多企业开始把整段任务直接甩给agent,而不是一问一答式的辅助。
  • 头部企业(月度使用量前10%)人均输出token是中位水平企业的8.3倍,1月时只有2.6倍。
  • 头部企业每周使用Plugins的比例是21%、skills是19%,普通企业分别只有9%和3%——OpenAI自己内部,这个数字是95%。
  • 自2月以来,Codex的周活跃企业用户在法律领域涨了108倍、销售和招聘各41倍、营销26倍,工程领域只涨了5倍。
  • 采纳了AI的美国上市公司,资产规模、员工数量、研发投入都比没采纳的公司更高。
frontier gap 半年翻三倍 2.6x 1月差距 8.3x 6月差距 差距的分母分子,都是OpenAI自己统计

这五条事实拼起来,讲的是同一个故事:企业AI正从“问答”走向“执行”,而做得深的公司和做得浅的公司之间,缝隙越来越大。

问题是,衡量“深”的这根尺子,是token产出量。

token量,不等于活干得好

Token是模型输出的字符碎片,不是业务价值。一个agent写一份冗长的法律尽调报告,token量会很高;一个客服agent三句话解决问题、审批人一分钟点头通过,token量反而很低。

文本密集型的职能天然在这个指标上占便宜,运营、客服这类短交互、高决策密度的工作反而会被低估。法律领域Codex用户暴增108倍,听起来惊人,但暴增的到底是产出的合同草稿数量,还是产出的token长度,报告没有拆开讲。

样本本身也有问题。这些数据来自已经购买OpenAI企业产品的公司——本身就是数字化程度更高、领导层更愿意试错的一批人。用他们的用量差距去说明“整个企业界的AI能力鸿沟”,逻辑上跳了一步。

  • 风险.token量高估文本密集型职能的“采用深度”,低估短交互高价值工作,报告样本本身也偏向已经领先的公司。

差距的另一种解释:不是能力,是权限

8.3倍的差距,还有一个更朴素的解释:不是模型能力差了三倍,是企业内部允许agent接触的数据和工具差了三倍

受严格监管、处理敏感数据的部门——比如医疗、金融的核心业务线——很可能是被公司自己的合规规则挡在门外,而不是AI用不明白。反过来,一个被批准做低风险草稿工作的团队,token量蹿得很高,也未必代表业务真的被重塑了。

治理开放度和能力差距,混在同一个数字里,报告没有把它们分开。这恰恰是最该分开看的地方:如果frontier gap扩大主要来自权限而非能力,那么“抓紧上agentic AI”这句建议,落到具体企业头上,第一步该做的其实是重新梳理数据授权,而不是急着换模型。


Codex不该跟“全家桶”比

OpenAI讲的是自己的故事,但企业agentic AI这场仗,场上不止一个玩家。微软靠Office、Teams、GitHub的现成分发渠道铺Copilot;谷歌在Workspace和Cloud客户里推Gemini;Anthropic靠编程和长文本推理的口碑打Claude Code。

Codex是一个编程代理,它更合适的对照对象是GitHub Copilot和Claude Code,而不是微软或谷歌整套的“agentic全家桶”。“Codex贡献了64%的token”这句话,讲的是Codex在自己产品线里的比重,不是OpenAI在整个企业agent赛道上的领先幅度。这个区别,报告标题里没写,但读者心里要有。

Codex周活跃用户增速(自2月) 法律 108x 销售 41x 招聘 41x 营销 26x 工程 5x 基数越低,倍数越吓人;工程增速最慢,因为它本来基数最大

法律领域涨108倍,很大程度是因为它去年的基数几乎是零——从10个用户涨到1080个,也是108倍。工程领域只涨5倍,恰恰是因为它已经是agentic AI最早、最成熟的战场,基数本来就大。倍数好看,但不能直接当作“法律行业AI渗透已经反超工程”的证据。

早期员工爬得快,还是被留在原地

报告里另一个反直觉的发现:早期职业员工用AI比高管更多,六个月后每周发的消息比高管多13条。OpenAI把这解读成一种比较优势——年轻人更敢用,效率更高。

这个解读只对了一半。至少还有另一种可能:初级岗位的工作内容本身更贴合大模型能干的活(写初稿、整理信息、跑第一版分析),而高管的AI使用往往被团队和系统内嵌,遥测根本看不到。

  • 结论.更值得追问的是,AI替年轻人代做的那部分基础工作,恰恰是过去他们靠“做中学”攒经验、攒判断力的部分。效率提上去了,成长路径会不会被顺手削薄,报告没有回答,业内也没有共识。
尺子握在谁手里,数字讲的就是谁的故事

企业该做的,不是照着OpenAI这套frontier/typical的框架去对标自己,而是先搞清楚:自己公司token量低,是能力不够,还是权限没开;用得多的部门,产出的是真正的业务决策,还是好看的草稿。等第三方机构拿出一套跨厂商、看业务结果而不是看token的评估方法之前,这类报告更适合当参考,不适合当KPI。