SOCO:视觉基础模型中语义对象对应性的基准测试
摘要
SOCO基准通过一致的部件级标注和关键点描述来评估视觉模型中的结构化对象理解,揭示了语言驱动定位与视觉对应之间的差距,同时证明了其对下游任务性能的强大预测能力。
查看缓存全文
缓存时间: 2026/06/02 15:35
论文页面 - SOCO:视觉基础模型中语义对象对应关系的基准测试
来源:https://huggingface.co/papers/2605.31597
摘要
语义对象对应关系(Semantic Object Correspondence, SOCO)基准通过一致的部件级标注和关键点描述评估视觉模型中的结构化对象理解,揭示了基于语言的定位与视觉对应之间的差距,同时证明了对下游任务性能的强预测能力。
由于评估协议不一致和部件级监督有限,衡量视觉基础模型中的结构化对象理解仍然具有挑战性。语义对应关系(SC)通过测试对象部件是否能在不同实例和类别之间在大幅变化的外观、视角和几何形状下匹配来评估这一能力。为了进行系统的SC评估,我们引入了SOCO,一个新的语义对象对应关系基准,它提出了对应关系类型的分类法,并在100个类别和超过100万个对应关系对上提供一致、功能上有意义的关键点标注。此外,SOCO包含关键点语言描述,使得能够评估大型视觉-语言模型(LVLMs)及其细粒度的部件级理解。全面的实验揭示:(i) 视觉基础骨干网络编码了强大的语义结构,但在相关类别间传递对应关系较差,且仅部分捕捉对象-部件位置;(ii) LVLMs在文本提示的部件定位方面比视觉参考的跨图像匹配更强,暴露了基于语言的定位与细粒度视觉对应之间的差距;(iii) 对应关系性能比ImageNet分类更强地预测了密集下游任务的性能,包括分割、跟踪、3D姿态估计和3D检测。总之,这些发现使SOCO成为视觉和多模态基础模型中结构化、部件级表示质量的基准。
查看arXiv页面 (https://arxiv.org/abs/2605.31597)查看PDF (https://arxiv.org/pdf/2605.31597)项目页面 (https://genintel.github.io/SOCO/)GitHub3 (https://github.com/GenIntel/OmniProbe)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31597)
在你的代理中获取本文:
hf papers read 2605.31597
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
没有链接本文的模型
在模型的README.md中引用arxiv.org/abs/2605.31597以在此页面链接它。
引用本论文的数据集 1
GenIntelLab/SOCO 更新于大约22小时前 • 20 • 1 (https://huggingface.co/datasets/GenIntelLab/SOCO)
引用本论文的Space 0
没有链接本文的Space
在Space的README.md中引用arxiv.org/abs/2605.31597以在此页面链接它。
包含本论文的集合 0
没有包含本文的集合
将本文添加到集合 (https://huggingface.co/new-collection) 以在此页面链接它。
相似文章
MARCO:探索语义对应中未见空间的航行器
MARCO 提出一种轻量高速的语义对应模型,通过由粗到精的目标与自蒸馏框架结合 DINOv2,在未知关键点上也达到 SOTA 精度与泛化能力。
KODA:面向视觉-语言基础模型的对比表示比较与对齐
本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。
RoboSemanticBench:诊断VLA模型动作预测中的语义基础
RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。
将视觉-语言接地视为双向概念对应
本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。
SIGNPOST-Bench:多模态大语言模型中文本-视觉冲突消解基准
提出SIGNPOST-Bench,一个用于评估多模态大语言模型如何消解文本与视觉线索之间冲突的基准,采用反事实图像变体与地理定位作为诊断手段。