通过分阶段自奖励缓解多模态幻觉
摘要
PSRD 框架通过分阶段自奖励解码和蒸馏轻量奖励模型,无需额外监督即可将 LVLM 的多模态幻觉降低一半。
查看缓存全文
缓存时间: 2026/04/22 10:35
论文页面 - 通过分阶段自奖励缓解多模态幻觉
来源:https://huggingface.co/papers/2604.17982
摘要
我们提出了一种新的自奖励框架 PSRD,可在推理阶段动态抑制大视觉-语言模型的幻觉,无需外部监督,仅依赖分阶段自奖励信号与蒸馏轻量奖励模型即可高效完成幻觉纠正。
大视觉-语言模型(https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(LVLMs)仍饱受视觉幻觉(https://huggingface.co/papers?q=vision%20hallucination)困扰,即生成内容与视觉输入不符。现有方法要么依赖大规模标注数据微调,计算开销巨大;要么采用静态事后策略,忽视幻觉出现的动态特性。为此,我们引入全新的自奖励框架(https://huggingface.co/papers?q=self-rewarding%20framework),在推理时实现动态幻觉缓解(https://huggingface.co/papers?q=hallucination%20mitigation),无需外部监督。
实验发现,视觉幻觉呈现分阶段动态规律,在每个语义阶段开始时达到峰值。基于该洞察,我们提出 PSRD(Phase-wise Self-Reward Decoding),通过分阶段自奖励信号在线纠正幻觉。为降低解码过程中反复自评的成本,我们将 LVLMs 中的幻觉指导信号(https://huggingface.co/papers?q=hallucination%20guidance%20signal)蒸馏至轻量奖励模型(https://huggingface.co/papers?q=lightweight%20reward%20model)。该奖励模型在解码过程中实时提供针对性干预指导,实现精准抑制幻觉。
实验表明,PSRD 将 LLaVA-1.5-7B 的幻觉率降低 50.0%,在四大 LVLMs、五大幻觉评测基准上全面超越现有事后方法。进一步分析证实,PSRD 有效缓解幻觉传播(https://huggingface.co/papers?q=hallucination%20propagation),并在性能与推理效率(https://huggingface.co/papers?q=inference%20efficiency)之间实现高度可控的权衡。
查看 arXiv 页面(https://arxiv.org/abs/2604.17982)
查看 PDF(https://arxiv.org/pdf/2604.17982)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.17982)
在智能体中获取该论文:
hf papers read 2604.17982
未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型链接该论文
在模型 README.md 中引用 arxiv.org/abs/2604.17982 即可在此处显示。
引用该论文的数据集 0
暂无数据集链接该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.17982 即可在此处显示。
引用该论文的 Spaces 0
暂无 Space 链接该论文
在 Space README.md 中引用 arxiv.org/abs/2604.17982 即可在此处显示。
包含该论文的收藏 0
暂无收藏包含该论文
将本论文加入收藏(https://huggingface.co/new-collection)即可在此处显示。
相似文章
拆解病态捷径:用于忠实LVLM解码的因果框架
本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。
缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。
通过混合模式优势正则化减轻大型推理模型中的事实幻觉
介绍了MARGO,一种强化学习框架,通过比较思考和非思考轨迹,使用混合模式优势正则化来减轻大型推理模型中由思考引发的幻觉。
FADE:通过减少语言先验主导性来缓解大型视觉语言模型中的幻觉
本文提出FADE,一种无需训练的方法,通过削弱关键层的FFN输出来减少语言先验主导性,从而缓解大型视觉语言模型中的幻觉,并在多个基准测试中证明了有效性。
幻觉检测引导的临床摘要偏好优化
介绍了HDSR和HDSR-PL方法,这些方法使用幻觉检测器来指导迭代自我改进和偏好学习,在MIMIC-IV-Note上使用Llama和Gemma模型进行临床摘要时,幻觉减少高达48%。