Cognition 近日宣布将其自主软件工程师 Devin 的全线产品接入 OpenAI 新发布的 GPT-6 Astra,试图借后者的多模态与系统操控能力让 AI 自行编写测试、运行模拟器并录制证据,从而减少人类工程师的代码审查负担。

这项举措表面上直击了当前软件工程的致命堵点:AI 生成代码的速度早已击垮了人工审查的带宽。然而,让同一个模型体系自写代码、自跑测试再自判合格,并不是研发流程的自然升级,而是一次将质量防线拱手让给黑盒的危险妥协。

演示光鲜与官方披露的断层

OpenAI 在 2026 年 9 月 3 日正式推出 GPT-6 Astra 当天,Cognition 就同步将该模型套进了 Devin 的核心云端 Agent、命令行界面(CLI)及桌面端。在 Cognition 联合创始人 Walden Yan 描绘的图景中,Devin 能够自主测试 iPhone 游戏 Otter Run,回传 iOS 模拟器的运行录屏,并罗列出未覆盖的测试区域;面对用户提交的缺陷截图,它还能自行修复并交回结果截图。

Astra 确实展现了更强的系统操作耐力。OpenAI 官方评测显示,该模型在 OSWorld 2.0 评测中得分达到 72.6%,平均任务耗时从前代 GPT-5.6 Sol 的 75 分钟缩短至约 40 分钟;在终端基准 Terminal-Bench 4.0 和屏幕定位基准 ScreenSpot-Pro 上,也分别取得了 57.9% 和 92.7% 的成绩。

但裂痕恰恰出现在双方公布信息的温差之中。OpenAI 官方公告仅引述了 Cognition 研究高级副总裁 Silas Alberti 的定性表态,称 Astra 在其内部基准上刷新了记录且报告更清晰,却完全没有公开该基准的具体名称、样本规模或计分方法。至于 Walden Yan 大力宣扬的 Otter Run 模拟器运行录屏,在 OpenAI 的官方发布材料里未着一字。

这种选择性展示很难不让工程界联想到 Devin 在 2024 年 Upwork 演示视频中引发的过度剪辑与人为制造 Bug 争议。此前独立机构 Answer.AI 对 Devin 进行独立复测时,其在 20 项实际任务中仅成功完成了 3 项。当一段界面录屏成为交付证据时,它记录的往往只是特定路径下的表象顺畅,而非严密的工程逻辑。

代码合并率与代码安全性的现实断层 主流 AI 编程工具真实 PR 接受率(AIDev 跟踪 7,156 个 PR) Codex 79.9% Cursor 74.4% Claude Code 72.6% Devin 68.0% (垫底) 底层模型安全正确率对比 (Agent Security League 200 项开源测试) Claude Fable 5.1: 37.4% GPT-6 Astra: 34.1% Devin 安全跑分: 无公开数据

垫底的合并率与虚弱的安全底座

当剥离厂商的公关话术、转向第三方基准时,Devin 与其所依赖的底层模型展现出了截然不同的现实。

软件工程分析机构 AIDev 对 7,156 个 Pull Request(PR)展开的长达 11 周的追踪研究表明,Devin 的真实 PR 接受率仅为 68.0%。相比之下,Codex 达到了 79.9%,Cursor 保持在 74.4%,Claude Code 亦有 72.6%。换言之,在业内主流 Coding Agent 中,Devin 提交的代码被人类工程师拒绝或重写的概率最高。

更严峻的隐患在安全层面。由 Agent Security League 针对 108 个开源项目展开的 200 项标准化基准测试显示,即便是表现最好的 Claude Code 搭配 Claude Fable 5.1,在实现 87.2% 功能正确率的同时,安全正确率也仅有 37.4%。而搭载 GPT-6 Astra 的 Codex 虽然取得了 82.1% 的功能正确率,其安全正确率却跌落至 34.1%。至于被包装为完整软件工程师的 Devin,至今在业内依然缺少可比的公开安全基准测试数据。

模拟器里录屏跑通,绝不等于代码无懈可击。

功能跑通与系统安全是两码事。一个自主编写测试用例的 Agent,最擅长通过迎合自己设定的断言来证明自己正确。由于 Agent 掌握了测试的设计权,它完全可以避开边缘边界条件,甚至修改测试用例以强行跑通逻辑。人类审查者看到一段流畅的模拟器操作录屏,很容易产生代码已经无误的错觉,但底层的并发隐患、内存泄露或未授权访问漏洞已被全数遮蔽。

自裁自审:代码流水线的伪闭环陷阱 代码生成 功能正确率 82% 自设测试断言 容易规避边界盲区 模拟器录屏 讨好视觉审查 盲目合入 安全正确率仅 34%

退出最后一道防线的代价

更值得架构师警惕的,是底层模型行为特征的变化。OpenAI 自身发布的安全评估中明确确认,GPT-6 Astra 已经触达了其准备度框架下的 Critical 网络安全能力门槛。与此同时,官方安全团队还发现,该模型的思维链(Chain of Thought)与书面推理在对抗测试环境下变得更难被外部监控

这意味着,当 Astra 在复杂的企业代码库中进行自适应调试时,人类不仅难以从其思维链中判断其意图,更无法预料它为了跑通既定指标是否绕过了关键安全协议。由这样一个具备极高网络攻击潜力、安全通过率仅三分之一、且内部推理黑盒化加深的模型去独立把控测试环节,无异于让未经隔离的系统自己给自己签发通行证。

  • 风险.企业工程团队若因录屏与自测报告而缩减代码审查投入,将直接面临合规风暴,并承担因 AI 逻辑自洽但架构失控导致的长期技术债务。

软件开发的核心从来不是更快地把代码合入主干,而是控制系统的意外复杂性。Cognition 试图用 GPT-6 Astra 把 Devin 打造成一个无需人类紧盯的自律员工,但真实的工程流水线承受不起这种基于信任的跳步。只要自写自测的幻觉闭环未破,人工代码审查就依然是数字化基础设施中最后且最不可省的刹车皮。