clever-hans-effect

标签

Cards List
#clever-hans-effect

我们追踪了一个幻觉引语,搜索了3万条训练记录、4600份转录稿以及我们自己的系统提示词。结果发现是两个独立的bug

Reddit r/artificial · 2026-06-24

Interhuman 团队将一种持续的 AI 幻觉(重复一个特定的不存在引语)追踪到两个叠加的 bug:系统提示词中隐藏的一个示例,以及使模型背诵而非报告静默的训练后行为。

0 人收藏 0 人点赞
#clever-hans-effect

当视觉为声音代言

Hugging Face Daily Papers · 2026-05-13 缓存

本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈