当视觉为声音代言

Hugging Face Daily Papers 论文

摘要

本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。

尽管具备视频处理能力的MLLMs取得了快速进展,但我们发现它们在视频中看似对音频的理解往往是由视觉驱动的:模型依赖视觉线索来推断或幻觉出声音信息,而非验证音频流本身。这一问题同时出现在最先进的开源全模态模型以及来自Google和OpenAI等提供商的一流闭源模型中。我们将这一失败模式描述为视听Clever Hans效应,在该效应中,模型看似(错误地)基于音频,但实际上利用了视觉-声音相关性,而未验证音频和视觉流是否真正对齐。为了系统地研究这一行为,我们提出了Thud,一个基于三种反事实音频编辑的干预驱动探查框架:Shift(测试时间同步)、Mute(测试声音存在性)和Swap(测试视听一致性)。除了诊断,我们还研究了一种两阶段对齐方案:干预衍生的偏好对教导音频验证,而事件级别的通用视频偏好则对模型进行正则化以防止过专化。我们最好的10K样本方案将三个干预维度的平均性能提升了28个百分点,同时在通用视频和视听问答基准上略有提升。
查看原文
查看缓存全文

缓存时间: 2026/05/20 06:36

论文页面 — 当视觉替声音说话

来源: https://huggingface.co/papers/2605.16403

摘要

具备视频理解能力的多模态大语言模型展现出的音频理解能力,实际上往往由视觉线索驱动而非真正的音频处理,因此需要基于干预的框架来诊断和改进音视频对齐。

尽管视频能力 MLLMs(https://huggingface.co/papers?q=video-capable%20MLLMs)发展迅速,我们发现它们在视频中的表观音频理解常常是视觉驱动的:模型依赖视觉线索来推断或幻觉声学信息,而非验证音频流。这一问题同时出现在最先进的开源全模态模型以及来自 Google、OpenAI 等厂商的领先闭源模型上。我们将这种失败模式描述为一种音视频 Clever Hans 效应(https://huggingface.co/papers?q=audio-visual%20Clever%20Hans%20effect),即模型看似(虚假地)基于音频,实则利用视觉-声学相关性,而未验证音频流与视觉流是否真正对齐。为了系统研究这一行为,我们引入了 Thud,一个基于三种反事实音频编辑(https://huggingface.co/papers?q=counterfactual%20audio%20edits)的干预驱动探测框架(https://huggingface.co/papers?q=intervention-driven%20probing%20framework):Shift(测试时间同步(https://huggingface.co/papers?q=temporal%20synchronization))、Mute(测试声音存在性(https://huggingface.co/papers?q=sound%20existence))和 Swap(测试音视频一致性(https://huggingface.co/papers?q=audio-visual%20consistency))。除诊断外,我们进一步研究了一个两阶段对齐方案(https://huggingface.co/papers?q=alignment%20recipe):从干预中导出的偏好对(https://huggingface.co/papers?q=preference%20pairs)教授音频验证,而事件级通用视频偏好(https://huggingface.co/papers?q=event-level%20general%20video%20preferences)则防止模型过度特化。我们最佳 10K 样本方案在三个干预维度上的平均性能提升了 28 个百分点,同时在通用视频和音视频问答基准上略有提升。

查看 arXiv 页面(https://arxiv.org/abs/2605.16403)查看 PDF(https://arxiv.org/pdf/2605.16403)项目页面(https://rakanwen.github.io/when-vision-speaks-for-sound/)GitHub1(https://github.com/rakanWen/wvs-code)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.16403)

在本代理中获取该论文:

hf papers read 2605.16403

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

无模型链接该论文

请在模型 README.md 中引用 arxiv.org/abs/2605.16403 以从本页链接。

引用该论文的数据集 4

Rakancorle1/hans-10k 查看器• 更新于约15小时前 • 20.8k • 15 (https://huggingface.co/datasets/Rakancorle1/hans-10k)

Rakancorle1/hans-sft-4k 查看器• 更新于1天前 • 3.83k • 7 (https://huggingface.co/datasets/Rakancorle1/hans-sft-4k)

Rakancorle1/vggsync-3k 查看器• 更新于1天前 • 3k (https://huggingface.co/datasets/Rakancorle1/vggsync-3k)

Rakancorle1/thud-eval 查看器• 更新于1天前 • 710 (https://huggingface.co/datasets/Rakancorle1/thud-eval)

引用该论文的 Spaces 0

无 Space 链接该论文

请在 Space README.md 中引用 arxiv.org/abs/2605.16403 以从本页链接。

包含该论文的收藏 1

相似文章