看我之意:面向视频细粒度对象理解的视觉与语言表征对齐

Hugging Face Daily Papers 论文

摘要

SWIM是一种新颖的训练策略,仅使用文本提示即可对齐视觉和语言表征以实现细粒度对象理解,并在训练期间利用掩码监督来改善跨模态注意力。该方法引入了NL-Refer数据集,并在细粒度对象理解基准测试中取得了优于基于视觉提示的方法的性能。

我们提出了SWIM(See What I Mean,意为“看我之意”),这是一种新颖的训练策略,它对齐视觉和语言表征,仅从文本提示即可实现细粒度对象理解。与需要显式视觉提示(如掩码或点)的现有方法不同,SWIM仅在训练期间利用掩码监督来引导跨模态注意力,使得模型在推理时能够自动关注到用户指定的对象。我们对预训练多模态大语言模型(MLLMs)的跨注意力分析揭示了一个系统性差异:属性词在视觉模态中产生尖锐的局部激活,而对象名词由于语义参考偏差和分布式高层表征而呈现出弥散且分散的模式。为了解决这种不对齐问题,我们构建了NL-Refer,一个丰富的数据集,其中每个对象掩码都配有一个精确的自然语言指代表达式。SWIM从对象名词中提取多层跨注意力图,并强制与真实掩码保持空间一致性。实验结果表明,SWIM显著改善了文本-视觉对齐,并在细粒度对象理解基准测试中取得了优于基于视觉提示的方法的性能。代码和数据可在 https://github.com/HumanMLLM/SWIM{https://github.com/HumanMLLM/SWIM} 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:36

论文页面 - See What I Mean: 为视频细粒度对象理解对齐视觉与语言表征

Source: https://huggingface.co/papers/2605.18018

摘要

SWIM 是一种训练方法,通过掩码监督和新的数据集解决跨模态注意力错位问题,仅使用文本提示即可对齐视觉与语言表征,实现细粒度对象理解。

我们提出 SWIM(See What I Mean),一种新颖的训练策略,仅通过文本提示就能对齐视觉与语言表征,实现细粒度对象理解。与需要显式视觉提示(如掩码或点)的现有方法不同,SWIM 仅在训练阶段利用掩码监督来引导跨模态注意力(https://huggingface.co/papers?q=cross-modal%20attention),使模型在推理时能够自动关注用户指定的对象。我们对预训练多模态大语言模型(MLLMs)的跨模态注意力分析揭示了一个系统性差异:属性词在视觉模态中产生尖锐、局部的激活,而对象名词则由于语义参考偏差和分布式高级表征而呈现弥散、分散的模式。为解决这种错位,我们构建了 NL-Refer 数据集,这是一个丰富的数据集,其中每个对象掩码都与精确的自然语言指代表达式配对。SWIM 从对象名词中提取多层跨模态注意力图(https://huggingface.co/papers?q=multi-layer%20cross-attention%20maps),并与真实掩码强制空间一致性(https://huggingface.co/papers?q=spatial%20consistency)。实验结果表明,SWIM 显著改善了文本-视觉对齐,并在细粒度对象理解基准上取得了优于基于视觉提示方法的性能。代码和数据可在 https://github.com/HumanMLLM/SWIM 获取。

查看 arXiv 页面(https://arxiv.org/abs/2605.18018)查看 PDF(https://arxiv.org/pdf/2605.18018)项目页面(https://github.com/HumanMLLM/SWIM)GitHub80(https://github.com/HumanMLLM/SWIM)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.18018)

在你的代理中获取此论文:

hf papers read 2605\.18018

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

BBBBCHAN/SWIM-7B 视频文本到文本• 8B• 5天前更新 • 29 • 2(https://huggingface.co/BBBBCHAN/SWIM-7B)

引用此论文的数据集1

BBBBCHAN/NL-Refer 预览• 5天前更新 • 168 • 2(https://huggingface.co/datasets/BBBBCHAN/NL-Refer)

引用此论文的 Space0

没有链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.18018,即可在此页面添加链接。

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到收藏(https://huggingface.co/new-collection)中,即可在此页面添加链接。

相似文章

@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。

X AI KOLs Following

LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。