Postgres云数据库厂商Neon和强化学习训练创业公司Castform联合发了一篇博客,标题很直接:他们用RL(强化学习)微调过的开源小模型,在检索任务上干掉了前沿模型GPT-5.6 Sol——成本便宜100倍,效果还更好。这个说法乍看很有冲击力,但仔细一查会发现一个尴尬的事实:GPT-5.6 Sol这个模型名字,在任何公开渠道都找不到独立资料。对比的敌人如果查无此人,这场"胜利"从起点上就站不住。

发生了什么:一篇联合博客,一个查无实据的对手

原文给出的数字相当具体:用GPT-5.6 Sol跑一次典型的多轮搜索请求,耗时超过10秒,成本约0.03美元;经过RL post-training的开源模型能把成本压到百分之一,效果持平甚至更好。Castform的训练管道直接挂在Neon的Lakebase Search上——用lakebase_textlakebase_vector两个检索工具,把企业自己的文档、工单、wiki自动转成训练用的问答对,再设计一个由检索命中、引用正确、答案正确三部分组成的奖励函数,跑强化学习循环。

这套技术路径本身不新鲜。开源社区里Search-R1、R1-Searcher等工作,早就在验证同一个思路:用结果导向的强化学习,教小模型自己判断什么时候搜、怎么改写查询、什么时候该停。Castform的贡献是把这条路做成了产品——号称让企业不用碰GPU和机器学习细节,就能把私有数据训练成一个专用检索代理。这个产品化方向是真实的,问题出在证明它有效的方式上。

检索代理的基准测试,该信几分

强化学习检索代理这个领域已经攒了不少公开的方法论争议:baseline是否公平,算力和搜索预算是否对齐,奖励函数是不是只做了粗糙的字符串匹配,训练集和测试集有没有偷偷重叠导致模型"蒙对"而不是真的学会推理。这些坑不是凭空猜测,是学术圈已经反复讨论过的已知陷阱。

对比对象如果连身份都不透明,「击败前沿模型」就只是一句广告词

Castform和Neon的博客里,这几个问题一个都没有回答。评测用了多大的测试集?GPT-5.6 Sol调用时用的是什么配置、多少次搜索预算?$0.03和>10秒这两个数字,测的到底是同一批任务吗?原文只给了一张对比图,没有给方法说明。这不是吹毛求疵——同一批人如果自己发布数据、自己下结论,又不披露过程,读者就没有办法判断这100倍是真的技术优势,还是选了一个对自己友好的对比场景算出来的。

「Lakebase Search更快」这类话,也该按同一标准查

博客里还隐含了另一层比较:Neon的Lakebase Search被拿来当作RL训练和推理时的检索底层,暗示它比传统的pgvector方案更适合这种高并发、高频调用的agent场景。这个判断有没有道理,取决于一件事:是不是在相同的召回率、相同的硬件、相同的索引参数、相同的并发和延迟百分位下测的。行业里对向量检索性能比较有一套约定俗成的规矩,就是因为"更快"这个词太容易靠调参数刷出来。原文没有披露任何索引配置,这个"更快"目前只能算一句立场声明,不是一份可复现的测试结果。

谁该在意,接下来看什么

对正在用RAG或agentic search架构的企业开发团队来说,RL post-training把开源小模型训练成专用检索代理,如果真的成立,确实能省一大笔前沿模型的调用费用——这是一个实实在在的商业动机,值得关注。但在独立复现出现之前,直接把这篇博客当作选型依据,风险不小。

  • 风险.目前没有第三方复现过这组对比数据,企业如果照着这个数字做预算规划,赌的是厂商的自我陈述而不是可验证的基准。

对Neon这样的Postgres云厂商而言,绑定Castform这类RL训练工具,本质是在抢企业数据基础设施这块地盘的叙事权——谁能让企业觉得"我的数据库+你的训练工具"就是新一代agent的标配,谁就多一层护城河。对OpenAI这类闭源模型厂商,如果开源+RL post-training路线真在特定任务上性价比更高,冲击的会是检索和Agent产品线的溢价空间,但这个"如果"目前缺少足够证据支撑。

接下来真正该盯的,是三件具体的事:GPT-5.6 Sol的真实身份和定价来源能不能被查证;Castform是否会公开训练数据生成流程、奖励函数代码和完整评测集;有没有独立于Neon和Castform的第三方,拿同一批任务把这个对比重新跑一遍。没有这些,「击败前沿模型」就只是一个讲得很漂亮的故事。