intervention-framework

标签

Cards List
#intervention-framework

当视觉为声音代言

Hugging Face Daily Papers · 2026-05-13 缓存

本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈