GPT-5.6 Sol视觉能力实测:检测mAP从13.8飙到46.2,OpenAI这次认真对待视觉了

OpenAI在2026年7月9日发布了GPT-5.6系列,一口气推出三款模型:Sol、Terra和Luna。发布会的焦点是computer use能力——模型能操控桌面应用、导航界面、理解3D可视化场景。这些能力的前提是模型必须具备足够强的视觉理解力。

Roboflow团队拿到模型后,把三款模型丢进了自研的VLM基准测试套件,覆盖检测、计数、OCR和数据提取四大方向。测试结果令人意外:Sol在目标检测上的mAP@50从GPT-5.5的13.8暴涨到46.2,OpenAI在视觉领域终于追了上来。

目标检测:从短板到实用

GPT-5.5在视觉检测上的表现可以用惨淡来形容。13.8 mAP@50意味着模型基本无法准确定位画面中的物体。Sol把这一分数提升到46.2,Terra和Luna分别拿到44.7和43.3。检测能力从模型的最大短板变成了可用的工具。

文档版面检测是Sol的拿手好戏。面对标题、段落、表格、图片和签名的混合排版,Sol能准确区分每个区域。许多文档工作流需要先定位页面元素,再做OCR或数据提取,Sol在这一步上表现稳定。

密集场景同样难不倒Sol。Roboflow用了药丸和鸡蛋的密集排列图来测试。传统VLM在物体数量增多时,输出的文本会变长,漏检、重复和坐标错误的风险陡增。Sol在这种场景下仍检测出大部分物体。

一个小技巧:提示GPT-5.6返回绝对像素坐标XYXY格式效果最好。Gemini 3.5 Flash则用0到1000范围的归一化YXYX坐标更佳。用错坐标格式会让检测性能下降约15个mAP点。

计数能力:Luna也碾压上一代

GPT-5.5的计数准确率为64.9%。Sol提升到73.0%,Terra拿到67.6%,Luna达到66.2%。Luna是系列中最便宜的模型,依然全面超越上一代旗舰。

测试中有一个难度极高的场景:大量重叠的金属支架。Sol给出了正确计数,展示了对遮挡物体的理解力。另一个测试要求Sol只计算特定评分区域内的弹孔数量,模型准确识别了哪些物体该数、哪些不该数。

药blister pack(泡罩包装)的计数则暴露了短板。反射光、重复的布局、填充和空槽之间的微小视觉差异让Sol频频出错。一个异常糖果的测试案例中,Sol给出了错误答案——到底是数错了还是理解错了类别,目前难以判断。

OCR与数据提取:进步有限

OCR方面,Sol拿到90.7%的平均相似度分数,比GPT-5.5的91.2%还低0.5个百分点。Terra和Luna分别为88.8%和88.4%。纯文字转录能力基本没变。

文本提取的差距更明显。Sol得分82.5%,低于GPT-5.5的87.6%。Terra和Luna分别为81.4%和79.4%。所谓文本提取,是要求模型从复杂画面中抓取特定信息片段,而非全文转录。

Sol在某些场景表现亮眼:手写笔记的完整转录、脏旧轮胎侧面曲面上印的轮胎规格、冰球转播画面中的实时比分提取。但在一个小巧垂直印刷、低对比度且有反射的保质期标签上,Sol完全读不出来。

成本与延迟:Sol最贵,Luna最香

视觉能力的提升伴随着更高的Token消耗。规模小的时候差异不明显,但到了批量处理时,Token量直接决定成本。

每张图的处理延迟:Sol约10秒,Terra约6秒,Luna略超5秒。单图成本方面,Sol约2.5美分,Terra约1美分,Luna不到0.5美分。对比之下,Gemini 3.5 Flash每张图0.8美分,延迟接近5秒,仍在检测和计数基准上领先。

Luna在延迟和质量的平衡上表现最佳。速度接近Gemini 3.5 Flash,检测和计数能力却超越GPT-5.5。如果你需要在成本和质量之间找平衡点,Luna是系列中最务实的选择。

大图稳定性问题

Sol在2000×2000像素以上的大图上会出现不稳定行为。模型会输出与画面内容完全不匹配的检测框,框的位置呈不自然的排列,比如整齐的行列或均匀分布的组群。OpenAI确认了这个问题。

提高推理强度(reasoning effort)能改善稳定性,代价是Token消耗、延迟和成本同步上涨。最务实的做法是发送前对大图做缩放或裁剪。

定价策略与市场格局

GPT-5.6 Sol在OpenRouter上的定价为每百万Token输入2.50美元、输出15美元,原价5美元和30美元,目前有50%折扣。上下文窗口100万Token,知识截止2026年2月。定位为复杂推理、编程和智能体工作流的旗舰模型,在命令行多步骤编程和长周期问题解决上表现突出。

Gemini 3.5 Flash在性价比上仍然领先。0.8美分一张图的价格,加上检测和计数基准上的最高分,让它在高吞吐场景下依然是首选。GPT-5.6的优势在于Agent、屏幕理解和文档工作流——OpenAI在视觉推理上的进步,让它在需要看懂界面、理解文档结构、做视觉判断的场景中变得更有竞争力。

GPT-5.6系列标志着OpenAI开始认真对待视觉能力。Sol的检测mAP从13.8跳到46.2,这种跃迁在AI模型迭代中并不常见。缺陷依然存在——成本高、延迟长、大图不稳定、OCR原地踌步。但视觉理解力的跃升让Sol成为OpenAI迄今为止最强的视觉模型,也让GPT-5.6在多模态竞争中有了真正的底气。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号