Roboflow把OpenAI刚发布的GPT-5.6系列拉进自己的测试台,最先跳出来的数字是:检测分数从上一代GPT-5.5的13.8,跳到新模型Sol的46.2,涨了三倍多。检测一直是OpenAI视觉能力最弱的一环,这次算是补上了大半。
但账本翻到后面没那么好看。Sol一张图要跑近10秒,花掉2.5美分,分辨率一高还容易框选失稳。需要说明的是,这些数字来自Roboflow即将发布但尚未公开的VLM基准,目前没有第三方复核,Roboflow自己也在卖Playground产品——这层商业背景值得留一个心眼。
检测和计数,这次真的补上了
三个新模型里,Sol检测分数最高,Terra和Luna紧随其后,三款都远超GPT-5.5。计数准确率也全线上涨。
| 模型 | 检测mAP@50 | 计数准确率 | 官方定位 |
|---|---|---|---|
| GPT-5.5 | 13.8 | 64.9% | 旧基线 |
| Sol | 46.2 | 73.0% | 旗舰档 |
| Terra | 44.7 | 67.6% | 中间档 |
| Luna | 43.3 | 66.2% | 最便宜档 |
Sol在文档版面识别上表现不错,标题、段落、表格、签名都能框出来。药丸、鸡蛋这类密集重叠的场景,大部分对象也能识别到。
这对做视觉Agent、文档自动化的团队是实打实的好消息。检测曾是OpenAI最明显的短板,这一项终于追上了第一梯队。
OCR和提取没跟上,代价也没省下来
检测跃升没有带动全面进步。Sol的OCR相似度和文本提取准确率,反而比GPT-5.5还低。
| 模型 | OCR相似度 | 文本提取准确率 | 单张图成本 | 单张图耗时 |
|---|---|---|---|---|
| GPT-5.5 | 91.2% | 87.6% | 未单独公布 | 未单独公布 |
| Sol | 90.7% | 82.5% | 约2.5美分 | 约10秒 |
这更像一次偏科式补课:练强了框选和计数,读文字反而没跟上。Terra、Luna在这两项上表现更弱,Roboflow这次也没有单独列出具体数字。
代价也摆在那儿。图像一旦接近或超过2000×2000像素,尤其在低推理强度下,框选容易失稳、出现错位。调高推理强度能缓解,但token、延迟和成本会一起往上走。
坐标格式也很敏感。GPT-5.6更适合绝对像素XYXY格式,用错格式能让分数掉15个mAP点——这不是简单换个提示词就能修的问题,得改调用代码。
同一份测试里,Gemini 3.5 Flash的检测和计数分数都更高,单价却只要0.8美分,不到Sol的三分之一。放到真实场景里,这才是最扎心的对比。
对不同人分别意味着什么
如果你的产品已经在用OpenAI的模型做检测或计数——比如自动标注、库存盘点、货架识别,Sol值得测,但别急着切生产环境。先用自己的小样本跑一轮,重点看高分辨率图和坐标格式是否踩坑,再决定要不要换。
如果你在做模型选型、管推理成本,现在不是下单的时机。这份基准还没正式公开,没有第三方复核,Roboflow也有卖Playground的动机。真正该等的,是基准正式发布后,有没有别的团队用不同数据集复现出同样的差距。如果只靠这一份自测就换供应商,风险在于分数可能随最终发布版本调整。
如果一定要在GPT-5.6家族里选,Sol不是唯一答案。Luna的检测和计数分数同样远超GPT-5.5基线,官方给它的定位是"最便宜档",如果要跑量,这是更值得先测的一个。但它的OCR和文本提取表现如何,Roboflow这次没有单独列出,这个缺口值得追问,而不是默认它样样都行。
临渊羡鱼,不如退而结网。OpenAI这次是真在补课,检测分数从13.8到46.2,不是嘴上说说。但"OpenAI历代最强视觉模型",只是跟自己比。放到整个赛道里,Sol还要面对一个更便宜、检测计数分数都更高的对手。
接下来最该盯的,是这份基准正式公布后能不能被复现,以及OpenAI会不会为OCR和文本提取补一轮训练。模型看着更强了,规模化部署的账反而更难算——网结得晚,但没白结,鱼却还没真的上钩。
