OpenAI应用研究主管Boris Power在一次长访谈中给出了一个反常态的口径:公司80%到90%的研发资源已经直接越过当前代际,投向了GPT-7、GPT-8甚至更遥远的未来版本。在他眼里,类似GPT-5.1到5.2这样在代际内部用专用数据微调做出的优化,在内部被视为极其短视的妥协,因为大模型产业绝大部分价值只来自于代际的彻底跃升。
这番表态撕开了一道巨大的认知落差。当多数开发者还在琢磨如何压榨当前模型的提示词技巧时,头部实验室早已把精力抽离了修修补补的日常。但这也带来了一个现实的追问:在尚未给出GPT-7与GPT-8正式路线图的当下,这样庞大的远期赌注,究竟靠什么支撑,又在回避什么?
巨塔与副产物:从参数竞赛转向分层蒸馏
理解OpenAI的代际执念,先要看清他们眼下的赚钱逻辑。截至2026年9月,官方文档记录的最新主力是GPT-5.6,并细分出了Sol、Terra、Luna等不同层级。商业落地要求推理成本一降再降,但OpenAI并未把主力研发压在端侧小模型的局部改良上,而是选择先造出一座极其庞大的前沿教师模型,再将其能力向下蒸馏。
在Power的逻辑里,代际内的小版本虽能靠特定数据换来短暂提升,但每次大版本跳跃之后,整个能力基准都会重置,工程师不得不推倒重来。
这种研发构架决定了外部企业和开发者的处境:花大代价在现有版本上搭建的精巧外挂,很可能在下一次代际模型发布时被直接抹平。不过,实验室能如此决绝地将九成兵力推向数年后,原因还在于研发方式本身已经变了。
自加速飞轮:智能体工时达到人类的3.1倍
真正的变量并不是人类研究员在加班,而是智能体正在接管模型研发。截至2026年8月中旬,OpenAI研发团队内部的智能体工作量与人类工作量之比已达3.1:1。换算下来,人类每投入1个工作日,系统里的自主智能体就会完成相当于3.1个工作日的任务。
这些数字员工已经深度渗入底层内核优化、训练数据配方配比以及模型输出的自我纠错。研发不再只是靠人力在白板前推导公式,而变成了一套自我迭代的软件工程飞轮:模型正在被用来设计下一代更强的模型。
决定代际演进速度的不再是研究员的作息表,而是代码库里自我调试的机器集群。
但这套递归加速机制也把整个行业分成了两个截然不同的阵营。OpenAI在全速推动AI自动化研发,而Anthropic在其负责任扩展策略(RSP)中划出了明确红线,对AI自主加速自身研发设定了防破坏安全门槛;Google DeepMind则通过多智能体科学系统Co-Scientist与世界模型Genie,建立起面向不可信智能体的审计机制。当机器开始写机器的代码,速度不仅是生产力,也变成了不受控的来源。
合格同事的修辞与长程崩溃的现实
在访谈中,Power将GPT-4总结为需要精细提示,GPT-5需要密集反馈,而GPT-6则已经像一个可以直接交付目标的合格同事。他甚至认为当前AI的核心瓶颈不在于模型质量,而在于用户引导,即多数普通用户根本不知道怎么向大模型提需求。
这个判断听起来轻巧,却遮盖了更深层的工程困境。把模型比作同事是一种精巧的公关包装,业界评测和实际生产环境里遇到的硬伤,从来不只是用户不会写指令,而是长程轨迹下的可靠性雪崩。
当任务从几分钟的单轮问答延展到数小时甚至数天的连续调用时,模型在多步骤规划中产生的误差会像滚雪球一样累加。OpenAI自己的内部报告也承认,长时间运行的系统会暴露出短期评测完全检测不到的失效模式,迫使团队紧急引入轨迹级监控与新的长程对齐测试。一个连续工作十几个小时后可能突然偏离初始目标的系统,在现实业务里很难被称为合格同事。
- 风险.若缺乏严密的过程验错与权限审计机制,盲目把多步骤长程任务托付给模型,系统性逻辑崩溃的代价将远超提示词优化节省的人工。
十吉瓦的物理重力:代际跃迁的资本底牌
抛开算力自动化和模型架构,前沿竞争最终撞上的是物理法则。远期规划的GPT-7与GPT-8,需要前所未见的电力与基础设施来承载。这也是OpenAI推进Stargate计划的核心原因:至2029年在美国建设10吉瓦容量的AI基础设施。
截至2026年初,该计划已完成规划容量的过半建设。十吉瓦的电网负荷,已经完全不是普通互联网软件迭代的概念,而是一场吞噬电力、变压器和重工业资本的围猎。
工欲善其事,必先利其器。大模型从单体参数的文字对齐,走到了智能体自研发与重基建并行的阶段。OpenAI把九成精力押在遥远的代际上,不仅是一场算法上的远征,更是在用庞大的资本重工业壁垒,试图在后继者赶上之前彻底拉开物理代差。
但对于整个产业而言,神话远期版本的叙事正在边际递减。在10吉瓦的电网与不可靠的长程任务之间,决定一家企业生死的往往不是GPT-8有多完美,而是当下的业务能否在长轨迹崩溃发生前,把那套粗糙的模型真正嵌进运转的现实里。
