SOCO:视觉基础模型中语义对象对应性的基准测试

Hugging Face Daily Papers 论文

摘要

SOCO基准通过一致的部件级标注和关键点描述来评估视觉模型中的结构化对象理解,揭示了语言驱动定位与视觉对应之间的差距,同时证明了其对下游任务性能的强大预测能力。

由于评估协议不一致以及部件级监督有限,衡量视觉基础模型中的结构化对象理解仍然具有挑战性。语义对应(SC)通过测试对象部件在大幅变化的外观、视角和几何形状下能否跨实例和类别进行匹配,来评估这一能力。为了系统地进行SC评估,我们引入了SOCO——一个用于语义对象对应性的新基准,它提出了对应类型的分类法,并在100个类别和超过100万个对应对上提供了一致、功能上有意义的关键点标注。此外,SOCO还包含关键点语言描述,使得能够评估大型视觉-语言模型(LVLM)及其细粒度的部件级理解。综合实验揭示:(i)视觉基础骨干网络编码了强大的语义结构,但在相关类别之间传递对应关系的能力较差,且只能部分捕获对象部件位置;(ii)LVLM在文本提示的部件定位方面强于视觉参考的跨图像匹配,揭示了语言驱动定位与细粒度视觉对应之间的差距;(iii)对应性能比ImageNet分类更能预测密集下游任务的性能,包括分割、跟踪、3D姿态估计和3D检测。这些发现共同将SOCO定位为评估视觉和多模态基础模型中结构化、部件级表示质量的基准。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:35

论文页面 - SOCO:视觉基础模型中语义对象对应关系的基准测试

来源:https://huggingface.co/papers/2605.31597

摘要

语义对象对应关系(Semantic Object Correspondence, SOCO)基准通过一致的部件级标注和关键点描述评估视觉模型中的结构化对象理解,揭示了基于语言的定位与视觉对应之间的差距,同时证明了对下游任务性能的强预测能力。

由于评估协议不一致和部件级监督有限,衡量视觉基础模型中的结构化对象理解仍然具有挑战性。语义对应关系(SC)通过测试对象部件是否能在不同实例和类别之间在大幅变化的外观、视角和几何形状下匹配来评估这一能力。为了进行系统的SC评估,我们引入了SOCO,一个新的语义对象对应关系基准,它提出了对应关系类型的分类法,并在100个类别和超过100万个对应关系对上提供一致、功能上有意义的关键点标注。此外,SOCO包含关键点语言描述,使得能够评估大型视觉-语言模型(LVLMs)及其细粒度的部件级理解。全面的实验揭示:(i) 视觉基础骨干网络编码了强大的语义结构,但在相关类别间传递对应关系较差,且仅部分捕捉对象-部件位置;(ii) LVLMs在文本提示的部件定位方面比视觉参考的跨图像匹配更强,暴露了基于语言的定位与细粒度视觉对应之间的差距;(iii) 对应关系性能比ImageNet分类更强地预测了密集下游任务的性能,包括分割、跟踪、3D姿态估计和3D检测。总之,这些发现使SOCO成为视觉和多模态基础模型中结构化、部件级表示质量的基准。

查看arXiv页面 (https://arxiv.org/abs/2605.31597)查看PDF (https://arxiv.org/pdf/2605.31597)项目页面 (https://genintel.github.io/SOCO/)GitHub3 (https://github.com/GenIntel/OmniProbe)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31597)

在你的代理中获取本文:

hf papers read 2605.31597

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

没有链接本文的模型

在模型的README.md中引用arxiv.org/abs/2605.31597以在此页面链接它。

引用本论文的数据集 1

GenIntelLab/SOCO 更新于大约22小时前 • 20 • 1 (https://huggingface.co/datasets/GenIntelLab/SOCO)

引用本论文的Space 0

没有链接本文的Space

在Space的README.md中引用arxiv.org/abs/2605.31597以在此页面链接它。

包含本论文的集合 0

没有包含本文的集合

将本文添加到集合 (https://huggingface.co/new-collection) 以在此页面链接它。

相似文章

KODA:面向视觉-语言基础模型的对比表示比较与对齐

arXiv cs.LG

本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。

将视觉-语言接地视为双向概念对应

Hugging Face Daily Papers

本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。