Roboflow把OpenAI刚发布的GPT-5.6系列拉进自己的测试台,最先跳出来的数字是:检测分数从上一代GPT-5.5的13.8,跳到新模型Sol的46.2,涨了三倍多。检测一直是OpenAI视觉能力最弱的一环,这次算是补上了大半。

但账本翻到后面没那么好看。Sol一张图要跑近10秒,花掉2.5美分,分辨率一高还容易框选失稳。需要说明的是,这些数字来自Roboflow即将发布但尚未公开的VLM基准,目前没有第三方复核,Roboflow自己也在卖Playground产品——这层商业背景值得留一个心眼。

检测和计数,这次真的补上了

三个新模型里,Sol检测分数最高,Terra和Luna紧随其后,三款都远超GPT-5.5。计数准确率也全线上涨。

模型检测mAP@50计数准确率官方定位
GPT-5.513.864.9%旧基线
Sol46.273.0%旗舰档
Terra44.767.6%中间档
Luna43.366.2%最便宜档
检测分数 mAP@50 GPT-5.5 13.8 旧基线 Sol 46.2 最强旗舰 Terra 44.7 中间档 Luna 43.3 最便宜档

Sol在文档版面识别上表现不错,标题、段落、表格、签名都能框出来。药丸、鸡蛋这类密集重叠的场景,大部分对象也能识别到。

这对做视觉Agent、文档自动化的团队是实打实的好消息。检测曾是OpenAI最明显的短板,这一项终于追上了第一梯队。

OCR和提取没跟上,代价也没省下来

检测跃升没有带动全面进步。Sol的OCR相似度和文本提取准确率,反而比GPT-5.5还低。

模型OCR相似度文本提取准确率单张图成本单张图耗时
GPT-5.591.2%87.6%未单独公布未单独公布
Sol90.7%82.5%约2.5美分约10秒

这更像一次偏科式补课:练强了框选和计数,读文字反而没跟上。Terra、Luna在这两项上表现更弱,Roboflow这次也没有单独列出具体数字。

代价也摆在那儿。图像一旦接近或超过2000×2000像素,尤其在低推理强度下,框选容易失稳、出现错位。调高推理强度能缓解,但token、延迟和成本会一起往上走。

坐标格式也很敏感。GPT-5.6更适合绝对像素XYXY格式,用错格式能让分数掉15个mAP点——这不是简单换个提示词就能修的问题,得改调用代码。

同一份测试里,Gemini 3.5 Flash的检测和计数分数都更高,单价却只要0.8美分,不到Sol的三分之一。放到真实场景里,这才是最扎心的对比。

对不同人分别意味着什么

如果你的产品已经在用OpenAI的模型做检测或计数——比如自动标注、库存盘点、货架识别,Sol值得测,但别急着切生产环境。先用自己的小样本跑一轮,重点看高分辨率图和坐标格式是否踩坑,再决定要不要换。

如果你在做模型选型、管推理成本,现在不是下单的时机。这份基准还没正式公开,没有第三方复核,Roboflow也有卖Playground的动机。真正该等的,是基准正式发布后,有没有别的团队用不同数据集复现出同样的差距。如果只靠这一份自测就换供应商,风险在于分数可能随最终发布版本调整。

如果一定要在GPT-5.6家族里选,Sol不是唯一答案。Luna的检测和计数分数同样远超GPT-5.5基线,官方给它的定位是"最便宜档",如果要跑量,这是更值得先测的一个。但它的OCR和文本提取表现如何,Roboflow这次没有单独列出,这个缺口值得追问,而不是默认它样样都行。


临渊羡鱼,不如退而结网。OpenAI这次是真在补课,检测分数从13.8到46.2,不是嘴上说说。但"OpenAI历代最强视觉模型",只是跟自己比。放到整个赛道里,Sol还要面对一个更便宜、检测计数分数都更高的对手。

接下来最该盯的,是这份基准正式公布后能不能被复现,以及OpenAI会不会为OCR和文本提取补一轮训练。模型看着更强了,规模化部署的账反而更难算——网结得晚,但没白结,鱼却还没真的上钩。