一个只会说"帮我把用户输入的内容存下来"的产品小白,和一个反复强调"要可预测成本、要托管服务"的资深工程师,分别问了Claude Code和Cursor该用哪种数据库。五分钟后,两边给出的答案一模一样:Neon。这是Armature团队一次实验的结果,也是他们后续做更大规模测试的起点——如果这种"殊途同归"能在更多场景里重复出现,说明coding agent的选型判断值得信任;如果不能,开发者交给AI去做的技术选型,可能没有想象中靠谱。
Armature随后跑了16,893次sandbox会话,覆盖75个仿真代码仓库、1,163种prompt变体,让Claude Code、Codex、Cursor三个agent不只是"推荐",而是真的把方案写进代码。团队最后挑出5,292次会话、覆盖51个仓库和18个行业,连同全部traces一起公开。这大概是目前能看到的关于"AI到底怎么选技术栈"最大规模的公开测试,但读完全部结果,会发现它讲的其实是两个故事。
数据库、支付、存储,几个品类几乎一家独大
单看具体品类,答案确实呈现出赢家通吃的样子。
数据库品类,Neon拿下66%的选择率,而被提及242次、知名度更高的Supabase反而被压在下面,原因据分析多是它把auth、storage、realtime打包进定价,agent觉得"要的只是数据库,不想要一整套"。支付品类,Stripe选择率接近九成,几乎垂直垄断,只在欧盟合规场景输给更专门的Paddle、Mollie。存储和邮件品类竞争激烈一些,S3占45%,Resend以35.6%小胜Postmark的27.4%。
更值得记住的一组数字,是"被提及"和"被选中"之间的落差。
在这套系统里,PayPal被提到139次,一次没赢过——同批会话里Stripe拿走了124次胜利;LangChain是被提及最多的框架,194次里只赢了4次;Netlify被提152次,只成了6次真正的部署选择。名气和曝光,不等于被agent真正采纳。
42%的一致率,和开篇故事说的不是一回事
三个agent对同一类需求,只有42%的概率选中同一个工具。也就是说,超过一半场景里,Claude Code、Codex、Cursor会给出不同答案。语音agent品类就是个典型:同一个需求,Claude Code选Twilio,Codex选OpenAI Realtime API,Cursor选Vapi——三个agent,三个答案。
三个agent只有四成机会选中同一个工具,这才是真正该被记住的数字。
这跟开篇"vibe coder和资深工程师都被推荐Neon"暗示的"殊途同归"其实是两回事。那个案例更像是一次精心挑中的巧合,而不是可以推广的规律。原因也不难找:三家agent依赖的信息来源天差地别。Codex在94%的会话里主动搜网,而且九成时候用site:这类限定词直奔可信域名;Cursor约三分之二会上网查;Claude Code主要靠自己的先验知识判断,只有约三成场景会搜索,遇到冷门品类才多查一些。它们不是在评估同一套信息做决策,而是各自带着不同的"知识底子"给答案——这也解释了为什么Claude Code更爱自己动手写(19%的场景选择自建方案,是Codex和Cursor的近两倍)。
谁在当裁判,谁又在数钱
更该多问一句的,是这套测试本身的设计。16,893次会话里,最终只有5,292次、约三成一被认定"有效"并公开,剩下近七成去了哪里、为什么没被纳入,原文没细说,只说"不代表无效,可能是还没准备好发布"。
同时,扮演"用户"去追问agent的,和最后判定"谁赢了"的,是同一个模型Gemini 3.7 Flash——它既是考生的对话伙伴,又是阅卷人。这个模型自己对哪些品牌更熟悉、训练数据里谁被提得更多,会不会提前带偏了结局,目前没有办法验证。
- 风险.模拟用户与最终裁判共用一个模型,且近七成会话未说明为何未纳入公开结果,榜单的中立性缺乏交叉验证。
再往上一层看,Armature本身就是一家帮开发者工具厂商"优化在AI面前的曝光"的公司,文章开头也主动写明了这一点。这份榜单既是一次测量,也是一次能力展示——它证明Armature确实能看懂agent怎么选,同时暗含"我们能帮你影响这个选择"的生意逻辑。
该看什么
Vercel去年披露超过三成部署由coding agent发起,同比涨了十倍,这意味着"被agent推荐"正变成一条新的获客通道,"agent-SEO"这类生意才刚刚冒头,Armature就是其中一家。
对vibe coder和中小团队来说,AI给出的Neon、Stripe这类答案,大概率不会踩坑,因为它们确实是各品类里赢面最大的选项。但换一个agent、换一次问法,结果可能完全不同——把AI的第一句回答当成"行业共识",本身就是一种风险。接下来更值得盯的,是有没有真正跟商业利益无关的第三方,拿同样的方法把这套测试再跑一遍,看看42%这个数字站不站得住。
