看我之意:面向视频细粒度对象理解的视觉与语言表征对齐
摘要
SWIM是一种新颖的训练策略,仅使用文本提示即可对齐视觉和语言表征以实现细粒度对象理解,并在训练期间利用掩码监督来改善跨模态注意力。该方法引入了NL-Refer数据集,并在细粒度对象理解基准测试中取得了优于基于视觉提示的方法的性能。
查看缓存全文
缓存时间: 2026/05/25 06:36
论文页面 - See What I Mean: 为视频细粒度对象理解对齐视觉与语言表征
Source: https://huggingface.co/papers/2605.18018
摘要
SWIM 是一种训练方法,通过掩码监督和新的数据集解决跨模态注意力错位问题,仅使用文本提示即可对齐视觉与语言表征,实现细粒度对象理解。
我们提出 SWIM(See What I Mean),一种新颖的训练策略,仅通过文本提示就能对齐视觉与语言表征,实现细粒度对象理解。与需要显式视觉提示(如掩码或点)的现有方法不同,SWIM 仅在训练阶段利用掩码监督来引导跨模态注意力(https://huggingface.co/papers?q=cross-modal%20attention),使模型在推理时能够自动关注用户指定的对象。我们对预训练多模态大语言模型(MLLMs)的跨模态注意力分析揭示了一个系统性差异:属性词在视觉模态中产生尖锐、局部的激活,而对象名词则由于语义参考偏差和分布式高级表征而呈现弥散、分散的模式。为解决这种错位,我们构建了 NL-Refer 数据集,这是一个丰富的数据集,其中每个对象掩码都与精确的自然语言指代表达式配对。SWIM 从对象名词中提取多层跨模态注意力图(https://huggingface.co/papers?q=multi-layer%20cross-attention%20maps),并与真实掩码强制空间一致性(https://huggingface.co/papers?q=spatial%20consistency)。实验结果表明,SWIM 显著改善了文本-视觉对齐,并在细粒度对象理解基准上取得了优于基于视觉提示方法的性能。代码和数据可在 https://github.com/HumanMLLM/SWIM 获取。
查看 arXiv 页面(https://arxiv.org/abs/2605.18018)查看 PDF(https://arxiv.org/pdf/2605.18018)项目页面(https://github.com/HumanMLLM/SWIM)GitHub80(https://github.com/HumanMLLM/SWIM)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.18018)
在你的代理中获取此论文:
hf papers read 2605\.18018
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
BBBBCHAN/SWIM-7B 视频文本到文本• 8B• 5天前更新 • 29 • 2(https://huggingface.co/BBBBCHAN/SWIM-7B)
引用此论文的数据集1
BBBBCHAN/NL-Refer 预览• 5天前更新 • 168 • 2(https://huggingface.co/datasets/BBBBCHAN/NL-Refer)
引用此论文的 Space0
没有链接此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.18018,即可在此页面添加链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏(https://huggingface.co/new-collection)中,即可在此页面添加链接。
相似文章
哪种预训练范式更能服务于空间智能?视觉语言模型与视频生成模型的实证比较
本文通过系统性的冻结特征探测研究,比较了视觉语言模型(VLMs)和视频生成模型(VGMs)在空间智能任务上的表现。研究发现,VLMs在语义标签和实例分组方面表现优异,而VGMs则提供更好的密集几何和相机运动信号。两种模型的简单融合在所有维度上均展现出强劲性能。
大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。
PARCEL: 基于池锚重采样与条件弹性查询的高效视觉语言理解
PARCEL提出了一种新颖的视觉语言模型架构,利用池锚重采样和条件弹性查询来提高不同视觉令牌预算下的效率和性能,优于现有的matryoshka基线。
@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。
LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。