Ornith AI放出了新一代开源模型Ornith-1.5,官方给的说法是:397B旗舰款在Terminal-Bench 2.1和DeepSWE两项上"打平"Claude Opus 4.8。翻开完整跑分表才发现,DeepSWE这一项,Opus其实是56.0分打不过59.0分,领先了3分。所谓打平,是挑了赢面最大的题目打平。
这次发布一口气给了三档模型:397B、35B、9B,全部MIT协议开源,9B还配了GGUF、MLX量化版,能直接塞进iPhone和Android。真正值得聊的,不是这个"打平"的说法站不站得住,而是它背后那套让模型自己出题、自己搭工具、自己打分的训练机制,到底改变了什么。
从自己搭脚手架,到自己出考卷
Ornith-1.0的思路是让模型自己设计任务专属的agent scaffold——工具怎么调、任务怎么拆、流程怎么编排,不再靠人工写死。Ornith-1.5把这条路走完整:模型现在自己出题,自己搭脚手架,自己跑出解答rollout,三段全部用GRPO联合优化,奖励从rollout一路回传到出题和搭架子这两步。
这套机制最容易被人问的一句话是:自己出题、自己判分,会不会自己给自己作弊?官方给了一个具体答案。任务奖励是验证性×前沿难度×新颖性的乘法结构,三者缺一不得分;前沿难度目标设在0.2的成功率——模型解得越顺,这道题的奖励就自动跌下去,逼着出题的那部分模型持续出难题。脚手架本身也单独有奖励,专门衡量它是否"抗作弊",能不能防住评测器被绕过。
这个设计思路是对的:它确实堵住了"出简单题骗奖励""脚手架放水"这两个最直接的漏洞。但设计合理不等于已经验证充分——训练用了多少算力、生成了多少任务、被拒绝的比例是多少,报告里一个数字都没有。
397B到底强在哪,弱在哪
把397B和Opus 4.8的完整分数摆在一起看,画面比"打平"复杂得多。
规律很清楚:终端操作、检索类agentic任务它能打甚至反超,纯推理和更难的软件工程任务(SWE-bench Pro、HLE)还是被Opus拉开距离。这说明自我提升循环目前最见效的地方,是那些能靠rollout大量刷经验的任务类型,而不是需要更深推理能力的题目。通用智能这个词,离均匀分布还有距离。
真正的黑马是35B,不是397B
新闻稿的镜头都对着397B,但35B-A3B这档更值得开发者盯着看。它每个token只激活约3B参数,DeepSWE分数从Ornith-1.0的0.0直接跳到22.0,NL2Repo从34.6升到46.2,agentic coding上还压过参数量更大的稠密模型Gemma 4-31B和Meta的Muse Glimmer-30B。
- 结论.低激活参数换来接近甚至反超更大模型的性能,才是这轮发布里最有落地价值的信号,比旗舰款的"打平"叙事更实在。
9B dense这一档同样值得记一笔:原生26万token上下文,YaRN能扩到百万级,BF16权重约19GB,量化后能塞进手机跑本地agent。对想在端侧部署coding助手的团队,这个尺寸比大模型的跑分表更有操作意义。
打平这句话,第三方还没点头
所有跑分都是自己跑五次取平均,HLE和MCP-Atlas还用Claude Opus当裁判——让对手给自己判分,这事本身就值得多想一层。孟子说"尽信书,则不如无书",厂商自己写的成绩单,先打个问号再往下看不是苛刻,是常识。
更实在的疑点在DeepSWE的公开独立榜。这个榜8月13日更新,早于Ornith-1.5发布,自然还没收录它的56.0分。有意思的是,独立榜给Opus 4.8的分数是59%,跟Ornith官方表里引用的一模一样——分歧只出现在开源同行身上。
差距不大,一两个百分点,大概率是评测协议或时间点不同造成的正常波动,不是刻意造假的证据。但这恰恰是问题所在:连基线对齐都存在这种细微偏差,56.0这个还没被任何人复现过的数字,现在只能算是厂商自己的说法。
所谓打平,是挑了赢面最大的题目打平。
- 风险.训练算力、任务生成规模、拒绝率全部缺失,"自我提升"目前是一条技术路线的展示,不是一份可复现的证据。
Ornith-1.5值得记住的,不是"打平Opus"这句话,是那套让机器自己出题、自己搭工具、自己打分的循环第一次跑出了完整闭环,以及35B-A3B用极低推理成本换来的性价比。397B的成绩单,等DeepSWE榜更新了再回头看,可能更准。
