GPT-5.6视觉能力评测:Sol成为OpenAI最强视觉模型
Roboflow对OpenAI新发布的GPT-5.6系列进行视觉基准测试,结果显示Sol在检测和计数上大幅进步,但成本与延迟仍存短板。
上周,OpenAI宣布了GPT-5。6阵容,介绍Sol、Terra和Luna车型。在发布过程中,团队高度关注计算机的使用,展示了能够导航和操作桌面应用程序的模型。OpenAI强调了UI代理和详细的3D可视化,但两者都依赖于更强的视觉理解。
为了衡量它们的视觉能力,我们通过即将推出的VLM基准测试来运行这些模型,我们计划在未来几周内发布该基准。该基准涵盖常见视觉任务,包括检测、计数、OCR和数据提取。在这篇文章中,我们将仔细了解GPT-5的作用。
6人在他们每个人身上表演。Sol显然是OpenAI迄今为止发布的最好的视觉模型。这种跳跃在物体检测和计数中尤其明显,其中GPT-5。5远远落后于最强的VLM。Terra和Luna没有Sol那么强大,但都在GPT-5上表现出有意义的进步。
5.在Roboflow Playground中测试Sol、Terra和Luna,并将其结果与Claude Fable 5和Gemini 3等模型进行比较。5在相同的视觉任务中闪现。对象检测检测是GPT-5。
6显示最清晰的跳跃。GPT-5。5分13分。在我们的基准中,8 mAP@50,而Sol达到46。2. Terra和Luna紧随其后,享年44岁。7和43。3、运动物体检测从主要弱点变成实用能力。
文档布局检测是GPT-5最明显的优势之一。6.
索尔很好地处理了标题、段落、表格、图像和签名。许多文档工作流程首先在OCR或数据提取开始之前定位页面的相关部分。GPT-5。6在密集场景中也表现出色。药丸和鸡蛋示例包含许多紧密聚集在一起的类似物体,这是基于VLM的检测的常见弱点。
与传统检测器不同,VLM将每个类标签和坐标集生成为文本。随着对象数量的增加,响应会变得更长,并且丢失对象、重复或坐标错误的风险也会增加。尽管如此,索尔还是在两个场景中检测到了大多数物体。为了获得最佳检测结果,请提示GPT-5。
6个模型返回以图像像素为单位的绝对XYXY坐标。这与双子座3不同。5 Flash,YXYX坐标标准化为0-1000范围时表现最佳。使用错误的坐标格式会减少GPT-5。6检测性能在我们的基准测试中提高了约15 mAP点。
在少数情况下,GPT-5。6 Sol在图像中看似随机的部分返回了框。许多人与地面真相没有重叠,或几乎没有重叠。这些盒子通常不会匹配可见对象,而是形成不自然的布局,例如直线或均匀间隔的组。我们与OpenAI分享了这些例子。
他们的团队证实,Sol在2,000 x 2,000像素或更大像素的图像上变得不太稳定,尤其是在推理工作较低的情况下。
更高的推理工作可以提高稳定性,但也会增加代币使用、延迟和成本。在将大图像发送到OpenAI API之前调整大小或裁剪是最实用的解决方案。对象计数整个GPT-5中的计数得到了改善。6阵容。索尔得到73分。
我们的基准为0%,高于64。GPT-5为9%。5,而Terra和Luna达到67。6%和66。2%。Luna是阵容中最便宜的型号,其表现仍然优于之前的OpenAI基线。作为基准测试的一部分,我们测试的案例不仅仅需要发现对象和返回总数。
索尔计算了严重重叠的金属支架,这对于传统物体探测器和VLM来说都是一个困难的情况。索尔还只计算了选定得分区内的弹孔,这表明他了解要计算哪些物体以及规则适用的地方。事实证明,泡罩包装要困难得多。
在单独的提示中,我们要求索尔数空槽和仍然密封在包装内的药丸。重复的布局、反射以及填充和空插槽之间的微小视觉差异使得这两项任务变得困难。异常糖果示例暴露了不同类型的失败。索尔给出了错误的计数,但尚不清楚该模型是否错误地计算了糖果或误解了目标类别。
OCR和数据提取OCR性能保持接近GPT-5。5.索尔获得了90分。7%的平均相似度得分,只有0。落后GPT-5 5 5分。5点91分。2%,而Terra和Luna则达到88%。8%和88。4%。
文本提取方面的差距更大,Sol得分为82分。5%,而87%。GPT-5为6%。5. Luna和Terra紧随其后,享年81岁。4%和79。4%。作为基准测试的一部分,我们将完整转录与定向提取分开。
OCR要求模型转录所有可见文本,而文本提取则要求特定的信息。Sol在两种情况下都能很好地处理手写笔记,在一种情况下生成完整的转录,在另一种情况下提取所需的日期。Sol在嵌入复杂视觉场景的文本上表现良好。
它能读取一个轮胎尺寸序列,该序列印在一个脏的、磨损的轮胎的曲面上。在另一个例子中,它从曲棍球广播中提取实时比分,并以请求的格式返回答案,测试视觉阅读和指令遵循。一些看起来简单的提取任务仍然失败。
Sol无法读取泡罩包装上印刷的有效期。文本很小、垂直、对比度低,并且受到反射的影响,这可能解释了错误。权衡GPT-5中代币使用率更高,愿景也随之而来。6阵容。这种差异在小型测试中不那么重要,但在规模测试中变得更加重要,因为代币数量直接增加了处理成本。
在我们的基准中,Sol平均每张图像接近10秒。Terra将时间缩短到6秒左右,而Luna则以5秒多一点的时间完成。Luna在阵容中提供了最强的延迟质量平衡,速度接近双子座3。
5 Flash,但性能仍优于GPT-5。5关于检测和计数。在我们的基准中,Sol的成本大约为2。每张图片5美分,成为仅次于Claude Fable 5的第二昂贵型号。Terra将每张图像的平均成本降低至约1美分,而Luna的成本不到0美分。
5美分。在0。每个图像8美分,双子座3。5 Flash比Sol便宜得多,同时仍然领先于我们的检测和计数基准。这使得它成为成本跨大型图像批次而变化的数据密集型工作负载的有力选择。
Roboflow Playground可让您与Claude Fable 5、Gemini 3一起测试Sol、Terra和Luna。5个Flash和执行相同任务的其他VLM。外卖使用GPT-5。
6、OpenAI比以前更接近领先的VLM。检测从弱点转变为可用能力,整个型号系列的计数也得到了改进。仍然有明确的限制。双子座3。在我们的基准测试中,5 Flash仍然是大容量检测和计数的更好实用选择,尤其是就其价格而言。
GPT-5。6表明OpenAI现在更加认真地对待视觉。Sol仍然存在缺陷,尤其是在成本、延迟和一些不稳定的检测案例方面,但进展不容忽视。对于代理、屏幕理解、文档工作流程和视觉推理,该版本使OpenAI成为比以前更强大的选择。
引用这篇文章使用以下条目在您的研究中引用此帖子:彼得·斯卡尔斯基。(Jul 2026年16月)。GPT 5。
6 Sol是OpenAI有史以来发布的最好的“视觉”模型。Roboflow博客:https://blog. roboflow。com/openai-gpt-5-6/