FermiSense拿5个前沿模型和自己微调的9B开源模型,做了同一套电商目录审核测试。前沿模型里表现最好的一个,也只拿到76.9分;那个只花了大约500美元做强化学习微调的9B模型,拿到87.3分。

推理成本上更悬殊:这个专用小模型的成本只有前沿方案的几十分之一。分数更高,成本更低,这组对比值得任何关心AI落地成本的人多看一眼。

87.3分对76.9分,差距从哪来

这套评测让AI agent做电商平台每天都要做的事:看一条商品listing,判断类目,核对品牌是否合规,提取尺寸材质等属性,给出裁决。FermiSense让几种前沿模型配置和训练过的9B模型,在同一套评测口径下跑分。

版本得分(相对理论满分)推理成本(每千条)
微调后的9B专用模型87.3%约$0.5
测试中最佳前沿模型配置76.9%约$20~$34
同一个9B模型,未训练基座64.2%

微调后,这个模型比自己训练前的水平相对提升了36%,比它打赢的前沿模型相对高出13.5%。注意,这是相对提升,不是13.5个百分点的差距。

同一套流程,三种分数 87.3% 微调后9B模型 76.9% 最佳前沿模型配置 64.2% 同模型未训练基座 五个前沿模型即便优化prompt,分数也卡在同一区间内 训练过的专用模型越过了这道天花板

成本这边差得更悬殊。专用模型推理成本约每千条0.5美元,比测试里最便宜的前沿方案低约40倍,比得分最高的那个前沿方案低约68倍。

每千条审核成本 得分最高前沿方案 $34 最便宜前沿方案 $20 微调9B专用模型 $0.5

文章给出两组场景化的年成本参照,口径不完全一致:日均4000万次审核决策对应约700万美元;日均1000万条listing对应约1000万美元。两组数字的处理量级和统计口径不一样,不能直接互相换算,只能看方向——量级都比同规模调用前沿模型API低了一截。

这套打法,适用于谁

不止FermiSense这么干。

公司场景结果
Bridgewater用分析师标注训练模型判断文件相关性错误率比最佳前沿模型低约30%
Harvey给法律agent做强化学习自建评分标准上跑赢GPT-5.5、Claude Opus 4.8
Intercom(Fin Apex)客服模型在数十亿条交互上后训练解决率更高、成本更低

三家公司做的是同一件事:先用前沿模型把流程跑通,顺便攒数据;等自动化过了原型阶段,再用强化学习把判断力压进自己掌控的小模型。前沿模型没退场,它负责打地基、处理通用和复杂的任务;专用模型接手高频、规则稳定、判断标准明确的那部分工作。

这套打法能成立,要同时满足四个条件:任务高频重复、规则相对稳定、有专有数据、能打分。少一个,强化学习就没有靶子。

企业里管AI落地、管技术架构的人,不用看到87.3分就急着上线自己的强化学习管线。先核对前面四个条件占了几个:占不齐,继续调前沿模型API更划算;占齐了,才值得算自建团队、评测和长期运维这笔账。

运营高频审核、客服或风控流程的团队,处境更直接。目录审核、工单分类、风控裁决,规则稳定、量大、可打分,天然符合上面的条件,是最适合内化进专用模型的场景。但内化不是调一次参数就完事,评测维护、数据治理、模型迭代要一直跟着做,团队编制得配上。

风险也要说清楚:这套结果来自FermiSense自建的任务、图像库和打分器,没有第三方复核,不能直接外推成"9B模型普遍打败所有前沿模型"。87.3%是相对理论满分的比例,不是通用场景下的准确率。500美元只是训练本身的费用,不包括数据清洗、评测搭建、算力和长期运维——这些账,自托管团队都要自己扛。

接下来值得盯的是:这类结果有没有在其他行业、其他任务上被第三方复现;那些真的自建了专用模型的团队,一年后是省了钱,还是把省下的API费用又花回了运维和治理上。

我的判断

巧妇难为无米之炊。前沿模型再强,没有一家公司的专属流程、数据和评分标准,给出的也只是通用答案——够用,但不够准。

真正决定胜负的,是一家公司有没有把重复决策、专有数据和可量化的评分机制,攒成一个只属于自己的模型。参数量本身不是关键。

参数可以租,判断力买不到。受影响最大的,是那些坐拥海量重复决策的平台——电商审核、客服工单、风控裁决,规则稳定、量大、可打分,天然适合把判断力内化进一个小模型。

但这不是免费的胜利。省下的是每次调用的API费用,换来的是数据治理、评测维护、模型迭代这些长期活儿——都要自己扛。这笔账值不值,看这家公司愿不愿意把活儿做扎实,而不是只看一张漂亮的对比图。