GPT 5.6 Sol 是 OpenAI 迄今发布的最佳“视觉”模型
摘要
OpenAI 的 GPT-5.6 Sol 在基准测试中被评估为该公司迄今最强的视觉模型,与 GPT-5.5 等前代模型相比,在物体检测和其他视觉任务上表现出显著提升。
暂无内容
查看缓存全文
缓存时间: 2026/08/17 12:50
# GPT 5.6 Sol 是 OpenAI 迄今发布的最佳“视觉”模型
来源:https://blog.roboflow.com/openai-gpt-5-6/
上周,OpenAI 发布了 GPT-5.6 系列,推出了 Sol、Terra 和 Luna 模型。在发布直播 (https://www.youtube.com/watch?v=Wq45rvPGNHs&ref=blog.roboflow.com) 中,团队重点展示了计算机操作 (https://blog.roboflow.com/use-a-vlm-to-control-pc/),演示了模型导航和操作桌面应用程序的能力。OpenAI 强调了 UI 代理和详细的 3D 可视化,但这两者都依赖于更强的视觉理解能力。
为了衡量其视觉能力,我们使用即将推出的 VLM 基准测试对这些模型进行了评估,该基准计划在未来几周内发布。该基准涵盖了常见的视觉任务,包括检测、计数、OCR 和数据提取。在本文中,我们将详细探讨 GPT-5.6 在每项任务中的表现。
Sol 显然是 OpenAI 迄今发布的最佳视觉模型。这种飞跃在物体检测和计数任务中尤为明显,在这些任务上,GPT-5.5 曾远远落后于最强大的 VLM。Terra 和 Luna 不如 Sol 强大,但两者相比 GPT-5.5 都取得了显著进步。
在 Roboflow Playground 中测试 Sol、Terra 和 Luna,并在相同的视觉任务上将其结果与 Claude Fable 5 和 Gemini 3.5 Flash 等模型进行比较。
Roboflow Playground (https://playground.roboflow.com/object-detection/gemini-3-5-flash-vs-gpt-5-6-sol-vs-claude-fable-5?ref=blog.roboflow.com)
## 物体检测
检测是 GPT-5.6 表现出最明显飞跃的领域。在我们的基准测试中,GPT-5.5 得分为 13.8 mAP@50 (https://blog.roboflow.com/mean-average-precision),而 Sol 达到了 46.2。Terra 和 Luna 紧随其后,分别为 44.7 和 43.3,使物体检测从一个主要弱点转变为一项实用能力。
文档布局检测是 GPT-5.6 最明显的优势之一。Sol 能够很好地处理标题、段落、表格、图像和签名。许多文档工作流程在开始 OCR 或数据提取之前,都从定位页面相关部分开始。
GPT-5.6 在密集场景中也表现出色。药片和鸡蛋的示例包含许多紧密排列的相似物体,这是基于 VLM 检测的一个常见弱点。与传统检测器不同,VLM 以文本形式生成每个类别标签和一组坐标。随着物体数量增加,响应变得更长,漏检、重复或坐标错误的风险也随之增加。尽管如此,Sol 在两个场景中都检测到了大多数物体。
为了获得最佳检测效果,提示 GPT-5.6 模型返回以图像像素为单位的绝对 XYXY 坐标。这与 Gemini 3.5 Flash 不同,后者在使用归一化到 0–1000 范围的 YXYX 坐标时表现最佳。在我们的基准测试中,使用错误的坐标格式会使 GPT-5.6 的检测性能降低约 15 个 mAP 点。
在少数情况下,GPT-5.6 Sol 返回的边界框出现在图像看似随机的区域。许多框与真实值没有重叠,或几乎没有重叠。这些框通常无法匹配可见物体,而是形成不自然的布局,例如直线排列或均匀分组。
我们将这些示例分享给了 OpenAI。他们的团队确认,Sol 在约 2000×2000 像素或更大的图像上稳定性会下降,尤其是在推理努力程度较低时。提高推理努力程度可以改善稳定性,但也会增加 token 使用量、延迟和成本。在发送图像到 OpenAI API 之前,调整大小或裁剪大图像是最实用的解决方法。
## 物体计数
GPT-5.6 全系列的计数能力都有所提高。Sol 在我们的基准测试中得分为 73.0%,高于 GPT-5.5 的 64.9%,而 Terra 和 Luna 分别达到 67.6% 和 66.2%。Luna 是该系列中成本最低的模型,其表现仍然优于之前的 OpenAI 基线。
作为基准的一部分,我们测试了需要超越简单发现物体并返回总数的案例。Sol 计算了严重重叠的金属支架,这对于传统物体检测器和 VLM 都是一个困难的案例。Sol 还只计算了选定得分区域内的弹孔,这表明它理解了要计数哪些物体以及规则适用的位置。
泡罩包装的计数则困难得多。在不同的提示中,我们要求 Sol 计算空位和仍在包装内密封的药片数量。重复的布局、反射以及填充和空位之间的微小视觉差异使得两项任务都很困难。
“异常糖果”示例暴露了另一种类型的错误。Sol 给出了错误的计数,尽管目前尚不清楚是模型数错了糖果,还是误解了目标类别。
## OCR 和数据提取
OCR 性能与 GPT-5.5 接近。Sol 达到了 90.7% 的平均相似度分数,仅比 GPT-5.5 的 91.2% 低 0.5 个百分点,而 Terra 和 Luna 分别达到 88.8% 和 88.4%。在文本提取方面差距更大,Sol 得分为 82.5%,而 GPT-5.5 为 87.6%。Luna 和 Terra 分别为 81.4% 和 79.4%。
作为基准的一部分,我们将完整转录与针对性提取分离开来。OCR 要求模型转录所有可见文本,而文本提取则要求获取特定信息。Sol 在两种设置下对笔记手写体都表现良好,在一个案例中生成了完整转录,在另一个案例中提取了请求的日期。
Sol 在嵌入复杂视觉场景中的文本方面表现出色。它读取了印在一个脏旧轮胎弯曲表面上的轮胎尺寸序列。在另一个示例中,它从冰球比赛直播中提取了实时比分,并按照要求的格式返回答案,同时测试了视觉阅读和指令遵循能力。
一些看似简单的提取任务仍然失败了。Sol 无法读取印在泡罩包装上的有效期。文字很小、垂直排列、对比度低,并受到反射影响,这可能是导致错误的原因。
## 权衡取舍
视觉能力的提升伴随着 GPT-5.6 全系列更高的 token 使用量。这种差异在小规模测试中影响不大,但在大规模应用中变得更加重要,因为 token 数量直接增加了处理成本。
在我们的基准测试中,Sol 处理每张图像平均耗时接近 10 秒。Terra 将此缩短至约 6 秒,而 Luna 略高于 5 秒。Luna 提供了该系列中最佳的延迟-质量平衡,其速度接近 Gemini 3.5 Flash,同时在检测和计数方面仍优于 GPT-5.5。
在我们的基准测试中,Sol 每张图像的成本约为 2.5 美分,使其成为继 Claude Fable 5 (https://blog.roboflow.com/claude-fable-5-for-vision/) 之后第二昂贵的模型。Terra 将平均成本降低至每张图像约 1 美分,而 Luna 的成本低于 0.5 美分。
Gemini 3.5 Flash 每张图像成本为 0.8 美分,比 Sol 便宜得多,同时仍在我们的检测和计数基准测试中保持领先。这使其成为数据密集型工作负载(成本随大批量图像而扩展)的强大选项。Roboflow Playground (https://blog.roboflow.com/roboflow-playground) 允许你在相同任务上测试 Sol、Terra 和 Luna,与 Claude Fable 5、Gemini 3.5 Flash 以及其他 VLM 进行对比。
## 总结
借助 GPT-5.6,OpenAI 比以前更接近领先的 VLM。检测从弱点转变为可用的能力,整个模型系列的计数能力都有所提升。
仍然存在明显的局限性。根据我们的基准测试,Gemini 3.5 Flash 仍然是大批量检测和计数的更佳实用选择,尤其是在其价格优势下。
GPT-5.6 表明 OpenAI 现在更加重视视觉能力。Sol 仍然存在缺陷,尤其是在成本、延迟以及一些不稳定的检测案例方面,但其进步不容忽视。对于代理、屏幕理解、文档工作流程和视觉推理而言,这次发布使 OpenAI 成为一个比以前强大得多的选择。
相似文章
GPT-5.6 系列 (2分钟阅读)
OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。
GPT-5.6 Sol 帮助优化自身推理
OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。
5.6 Sol 在通用工作中的潜力被低估(7分钟阅读)
OpenAI 发布了 GPT-5.6 Sol,这是一款旗舰模型,适用于跨应用和企业数据的长时间自主工作,配备超频模式(Ultra mode)及子代理,可实现更快、更强的结果。该模型内部被用于辅助训练 Luna,并在成本和性能上相较此前版本有显著提升。
@gdb: Sol 正在发生一些特别的事情:
InvincibleHunter 声称 GPT-5.6 Sol 是有史以来最令人印象深刻的模型,在数学和视觉能力上有巨大改进,超越了其他模型。