当视觉为声音代言
摘要
本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。
查看缓存全文
缓存时间: 2026/05/20 06:36
论文页面 — 当视觉替声音说话
来源: https://huggingface.co/papers/2605.16403
摘要
具备视频理解能力的多模态大语言模型展现出的音频理解能力,实际上往往由视觉线索驱动而非真正的音频处理,因此需要基于干预的框架来诊断和改进音视频对齐。
尽管视频能力 MLLMs(https://huggingface.co/papers?q=video-capable%20MLLMs)发展迅速,我们发现它们在视频中的表观音频理解常常是视觉驱动的:模型依赖视觉线索来推断或幻觉声学信息,而非验证音频流。这一问题同时出现在最先进的开源全模态模型以及来自 Google、OpenAI 等厂商的领先闭源模型上。我们将这种失败模式描述为一种音视频 Clever Hans 效应(https://huggingface.co/papers?q=audio-visual%20Clever%20Hans%20effect),即模型看似(虚假地)基于音频,实则利用视觉-声学相关性,而未验证音频流与视觉流是否真正对齐。为了系统研究这一行为,我们引入了 Thud,一个基于三种反事实音频编辑(https://huggingface.co/papers?q=counterfactual%20audio%20edits)的干预驱动探测框架(https://huggingface.co/papers?q=intervention-driven%20probing%20framework):Shift(测试时间同步(https://huggingface.co/papers?q=temporal%20synchronization))、Mute(测试声音存在性(https://huggingface.co/papers?q=sound%20existence))和 Swap(测试音视频一致性(https://huggingface.co/papers?q=audio-visual%20consistency))。除诊断外,我们进一步研究了一个两阶段对齐方案(https://huggingface.co/papers?q=alignment%20recipe):从干预中导出的偏好对(https://huggingface.co/papers?q=preference%20pairs)教授音频验证,而事件级通用视频偏好(https://huggingface.co/papers?q=event-level%20general%20video%20preferences)则防止模型过度特化。我们最佳 10K 样本方案在三个干预维度上的平均性能提升了 28 个百分点,同时在通用视频和音视频问答基准上略有提升。
查看 arXiv 页面(https://arxiv.org/abs/2605.16403)查看 PDF(https://arxiv.org/pdf/2605.16403)项目页面(https://rakanwen.github.io/when-vision-speaks-for-sound/)GitHub1(https://github.com/rakanWen/wvs-code)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.16403)
在本代理中获取该论文:
hf papers read 2605.16403
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
无模型链接该论文
请在模型 README.md 中引用 arxiv.org/abs/2605.16403 以从本页链接。
引用该论文的数据集 4
Rakancorle1/hans-10k 查看器• 更新于约15小时前 • 20.8k • 15 (https://huggingface.co/datasets/Rakancorle1/hans-10k)
Rakancorle1/hans-sft-4k 查看器• 更新于1天前 • 3.83k • 7 (https://huggingface.co/datasets/Rakancorle1/hans-sft-4k)
Rakancorle1/vggsync-3k 查看器• 更新于1天前 • 3k (https://huggingface.co/datasets/Rakancorle1/vggsync-3k)
Rakancorle1/thud-eval 查看器• 更新于1天前 • 710 (https://huggingface.co/datasets/Rakancorle1/thud-eval)
引用该论文的 Spaces 0
无 Space 链接该论文
请在 Space README.md 中引用 arxiv.org/abs/2605.16403 以从本页链接。
包含该论文的收藏 1
相似文章
视觉为何无法成为通用桥梁:在多语言MLLMs中纠正模态异步性
本文在多语言MLLMs中识别出Ghost Anchor现象,即视觉信号在早期对齐阶段未被充分利用,并提出ANCHOR训练框架以提升视觉语义涌现和跨语言性能。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象
本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。
从感知到决策:多模态大语言模型中听觉与视觉感知的信息流
本文研究了音频与视觉信息在音频-视觉大语言模型(AVLLMs)中的流动方式,揭示了AVLLMs根据输入配置采取顺序或并行路由,并且某些token在信息传输后可被丢弃以提高效率。
看见不等于共享:一些视觉语言模型在不对称对话中高估共同基础
本文研究了视觉语言模型中的一种偏差,即模型在对话中高估了共同理解,将感知访问与沟通基础相混淆。研究结果对对话系统和VLM评估具有启示意义。