Ante上线不久,star数已经过千,一个只有15MB的Rust二进制,号称能替代Claude Code和Codex,不用联网、不用账号,甚至能完全离线跑本地模型。它给自己贴了三个标签:可验证、可负担、可随处跑。翻到文档底部才发现,这三个词里最硬的那一个——可验证——恰恰是空的:核心代码不开源,官方给出的跑分,唯一愿意站出来交叉印证的,是被测模型的提供方自己。
这不是一个小瑕疵,是这类项目最容易被读者忽略、也最该被追问的地方。
发生了什么
- 产品.单一二进制、零运行时依赖的终端coding agent,内嵌pinned managed llama.cpp,指向本地GGUF模型可完全离线运行。
- 跑分.Terminal-Bench 2.1(89任务×5次试验),用开源权重模型DeepSeek V4 Flash 0731,拿到82.7%(368/445试验),推理成本约68美元。
- 资源.同样20个并行任务放进Docker,峰值内存比Claude Code少约7倍,平均CPU少约9倍,磁盘I/O少约5倍。
- 开源范围.文档、协议(protocol-shape)、SDK(agent-sdk)、评测管线(ante-harbor)走Apache 2.0;核心harness本体只发预编译二进制。
- 遥测.默认开启,需手动关闭。
可验证的“验证”,谁来做
82.7%这个数字乍看很扎实:具体任务数、试验次数、build版本、原始跑测记录都给了链接。但支撑它的核心harness,只是一个二进制文件。你能跑,不能看。第三方想复现,只能重新跑一遍这个黑箱,而不是审查它到底怎么算出这个分数。
更微妙的是交叉验证的来源。文档里提到的唯一复现方是DeepSeek——用自己“未发布的DeepSeek Harness(minimal mode)”跑出同一个82.7%。DeepSeek正是这次被测模型的提供方,一个模型厂商替自己模型的跑分背书,动机上很难叫独立审计。古人讲“疑人不用,用人不疑”,这次反过来了:该被质疑的,恰恰是这唯一的证人。
- 风险.闭源核心加利益方背书的组合,一旦有人复现不出82.7%,信任成本会一次性透支。
闭源的理由站得住吗
Antigma Labs对不开源核心的解释是“先解决安全和隐私顾虑,同时探索agentic时代的开源该怎么运作”。听起来谨慎,细看经不起推敲。它给用户的建议是“放进沙箱运行”,可这等于把闭源二进制本该承担的审查责任,转嫁给用户自己去搭沙箱。沙箱能防止它跑坏你的系统,防不住它悄悄做了什么你看不到的事。
遥测默认开启是同一逻辑的延伸。Ante主打无账号、不锁厂商,却在一个拥有shell和git完整写权限的工具里,把数据上报设成默认选项。关不关是用户的自由,但“默认开着”这个选择本身,已经说明产品分析的需求排在了隐私顾虑前面。
这场戏该怎么看
Ante真正的差异化,不在“又一个类Claude Code的开源竞品”,而在把本地推理、多provider切换、多agent编排,塞进一个足够小、足够快的二进制里。这件事本身有价值,尤其对想摆脱API账单和厂商锁定的个人开发者。
但企业级的信任靠的不是“我们很快、很省资源”,靠的是“你能查我说的是不是真的”。Ante在最该拿出证据的一环选择了自证——自己发跑分证书,再找一个有共同利益的模型厂商盖章。
可验证、可负担、可随处跑——现在只有后两句站得住。
- 结论.真正决定Ante能不能成为基础设施的,不是跑分好看,而是有没有人愿意免费替它作证。
如果Antigma Labs真想把“可验证”三个字站住,下一步该做的不是继续压二进制体积,而是找一家没有利益关系的机构复现这个82.7%,或者干脆把核心harness的源码摆出来给人看。企业安全团队会先在沙箱里跑一轮再决定要不要留;个人开发者图的是省钱和自由,可以先用起来,但别把它的跑分当成已经验证过的事实。
