发布视频1分59秒,一只鹈鹕骑着自行车驶过画面,脖子上系着红领巾。这是OpenAI给Simon Willison的一个彩蛋——多年来他用“画一只骑自行车的鹈鹕”当作检验模型的非正式标尺,现在OpenAI把这个梗直接放进了GPT-6 Astra的发布视频。彩蛋本身挺可爱,但翻开Astra的定价单和跑分细则,会发现比彩蛋更值得琢磨的,是官方叙事和实际表现之间的落差。
又贵又长,先看清计费方式
Astra在9月3日先对部分组织开放,随后铺开到ChatGPT各档位和API、Azure、AWS Bedrock。定价不便宜:标准输入每百万token 10美元,输出高达50美元,知识截止到2026年4月30日。上下文窗口拉到105万token,但有个容易漏看的细节——单次请求输入一旦超过27.2万token,输入和缓存费率直接翻倍,输出费率也涨到1.5倍。长文档、长代码库场景下,账单可能比想象中涨得更快。
跑分全面领先?细看是险胜
官方给出的数字确实亮眼:FrontierMath Tier 4达98%,ARC-AGI-399.9%,ExploitBench满分,几何理解基准BenchCAD从上代GPT-5.6 Sol的83.3%跳到95.9%。但把编程类基准拆到具体项,故事就没那么单纯了。
| 基准 | Astra | 对手 | 差距 |
|---|---|---|---|
| DeepSWE v1.1 | 74.1% | Gemini 3.8 Flash 73.8% | +0.3个百分点 |
| FrontierCode Extended | 64.5% | Claude Fable 5 64.9% | -0.4个百分点 |
| Coding Agent Index | 67.0 | Claude Opus 5 68.1 | -1.1 |
至于价格,Gemini 3.8 Flash的输入价只有Astra的十三分之一(0.75美元 vs 10美元),DeepSWE分数还几乎持平。对成本敏感的团队,这笔账不难算。
3D和幻觉率:两个被放大的亮点
视频里那些花园、船厂、戴森球渲染看起来惊艳,但Astra并不是原生3D生成模型——它靠生成CAD代码去驱动Blender、Unreal这类外部工具完成建模。它擅长的是BenchCAD衡量的几何精确性,不代表游戏资产制作里常见的贴图、UV展开、骨骼绑定这些环节也一并变强了。视频演示和窄口径基准之间,隔着一层。
幻觉率数据同理。官方宣称Astra的幻觉错误率是4.2%,远低于GPT-5.6 Sol的12.2%,听着像是解决了大模型的老毛病。但这个数字来自专门设计、题目冷门、禁止联网检索的高难度测试集,跟日常生产环境里的错误率是两回事。
- 提醒.跑分基准是厂商自己设计、自己公布的尺子,几何精确度高不等于3D工作流全能,幻觉率低不等于生产环境不瞎编。
开发者不买账,鹈鹕也没完全服气
跑分之外,社区的反馈更扎心。有开发者反馈Astra会在没确认方案的情况下擅自实施架构决策,生成不合理的数据库schema、把状态变更接口写成GET请求、漏掉关键的成本日志——这些都是能直接捅娄子的生产风险。更古怪的是,Astra的最高推理档(max)在两项编程评测上得分反而略低于次高档(high),社区猜测是“过度思考”在作怪。
Willison自己那套非正式的鹈鹕测试,倒是给出了一个务实的参照:Astra在最低推理档、成本约9.55美分时,画得就已经超过GPT-5.6 Sol的所有档位;把成本推到最高档63美分,视觉效果确实更细腻,但只要不是拉满推理强度,鹈鹕的腿和车架位置错位依然常见。
这也是鹈鹕测试的价值所在——它足够简单,简单到能暴露一个模型在空间关系上到底有没有真本事,比冷门的高难度基准更贴近直觉。但它也足够简单,简单到容易被针对性优化。发布视频里出现的鹈鹕形象风格和Willison测试的画风高度接近,社区已经有人怀疑这是不是一次刻意的“对题作画”。
跑分是自家量的尺子,尺子准不准,得看开发者拿代码去量
对普通开发者来说,选型的现实建议并不复杂:追求长时程任务的性价比,Gemini 3.8 Flash值得先试;需要极致的几何精确度和CAD输出,Astra的BenchCAD优势是实打实的;但只要涉及架构决策和数据库改动,把Astra的输出当草稿看待,比当成品直接合并要安全得多。
