OpenRouter更新了OpenAI「GPT-6 Astra」的价目表:官方标价输入$10、输出$50,每百万token。但页面自己算出来的"加权平均实付价"却是输出$51.53——比标价还贵一块多。一个刚上线的旗舰模型,账单居然比自己的价目表还贵,这不是四舍五入的误差,是藏在计费规则里的一道断崖。
更值得说的是,这次上线本身也不干净。Astra这个代号在正式发布前,在社区里被当假消息、当骗局讨论了将近一周,直到OpenAI在9月初正式确认存在。OpenRouter页面呈现出"五家供应商、数据齐全"的样子,更像是分阶段放量中的一个截面,不是全量真相——已经有用户反馈按地区和账号出现无法访问的情况。
一张价目表里的反常数字
OpenRouter同时列出了OpenAI Flex、Azure、OpenAI、Azure(US)、OpenAI Fast五条通道,价格、延迟、吞吐量各不相同。奇怪的是,页面统计的加权平均输出价$51.53,高于所有供应商标注的listed价$50。
这不是显示错误,是信号:有相当一部分流量,正在走比标价更贵的通道。
272K token是道断崖,不是分水岭
OpenAI官方文档给出的定价比OpenRouter页面复杂得多:标准输入$10/M、缓存输入$1/M、缓存写入$12.5/M、标准输出$50/M。但一旦请求的输入超过272,000 token,计费规则不是"超出部分单独算",而是整条请求整体切换到长上下文费率——输入$20/M、输出$75/M。
这就是加权均价反超标价的原因。跑长文档、跑深度研究、跑长程agentic任务的用户,很容易在不知不觉中踩过这条线,账单直接翻倍。
- 提醒.长上下文任务在拼接历史消息、工具调用记录、浏览器操作日志时,很容易悄悄越过272K这道门,而费率是整单切换,不是超出部分加价。
官方跑分打不过第三方复现
OpenAI公布的对比数据看着确实凌厉:相比前代GPT-5.6 Sol,ExploitBench 100% vs 78.5%,SRE-Bench单次88.0% vs 55.9%,Terminal-Bench 57.9% vs 37.3%。这是一份典型的"甲方自证"成绩单。
但第三方跟踪站modelbeats.com给出的图景没那么一边倒:在AutomationBench上,Astra只有41.4%,低于另一款模型的50.8%;长上下文检索任务里,Muse Spark的表现据称也优于Astra。
《孟子》说"尽信书,不如无书"。厂商自己发的跑分单,拿来当营销没问题,拿来当独立结论就危险。ExploitBench、SRE-Bench赢的是对照组是自家上一代,AutomationBench输的是对照组是别人家的模型——这两组数字放在一起看,才是完整的画面。
价目表的整洁,常常是接入还没做完的假象。
- 结论.判断一个模型是否"真的可用、真的划算",不能只看聚合平台上那张齐整的表格,要看计费断点在哪、第三方复现结果如何。
对开发者和企业客户来说,现实的功课是两条:核对长上下文任务是否会越过272K这道门,以及在接入agentic能力之前,找一份独立复现数据对照官方跑分。Astra的能力可能确实强,但强多少、贵多少,现在只能拿到一半的答案——staged rollout有没有走完,独立评测有没有跟上,都还得再等一等。
