标签
Interhuman 团队将一种持续的 AI 幻觉(重复一个特定的不存在引语)追踪到两个叠加的 bug:系统提示词中隐藏的一个示例,以及使模型背诵而非报告静默的训练后行为。
本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。