通过分阶段自奖励缓解多模态幻觉

Hugging Face Daily Papers 论文

摘要

PSRD 框架通过分阶段自奖励解码和蒸馏轻量奖励模型,无需额外监督即可将 LVLM 的多模态幻觉降低一半。

大型视觉-语言模型(LVLM)仍饱受视觉幻觉困扰,即生成回答与视觉输入不一致。现有方法要么依赖大规模标注数据进行微调,计算开销巨大;要么采用静态事后策略,忽视幻觉出现的动态性。为此,我们提出一种全新的自奖励框架,在推理阶段无需外部监督即可动态抑制幻觉。实验发现,视觉幻觉呈现分阶段动态模式,在每个语义阶段开始时达到峰值。基于该洞察,我们提出 PSRD(Phase-wise Self-Reward Decoding),利用分阶段自奖励信号在线纠正幻觉。为降低解码过程中反复自评估的成本,我们将 LVLM 的幻觉指导信号蒸馏至轻量奖励模型。该模型随后在解码过程中即时提供针对性干预指导,实现精准抑制幻觉。PSRD 将 LLaVA-1.5-7B 的幻觉率显著降低 50.0%,在四个 LVLM 的五项幻觉评测基准上全面超越现有事后方法。进一步分析表明,PSRD 有效阻断幻觉传播,并在强劲性能与推理效率之间实现高度可控的权衡。
查看原文
查看缓存全文

缓存时间: 2026/04/22 10:35

论文页面 - 通过分阶段自奖励缓解多模态幻觉

来源:https://huggingface.co/papers/2604.17982

摘要

我们提出了一种新的自奖励框架 PSRD,可在推理阶段动态抑制大视觉-语言模型的幻觉,无需外部监督,仅依赖分阶段自奖励信号与蒸馏轻量奖励模型即可高效完成幻觉纠正。

大视觉-语言模型(https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(LVLMs)仍饱受视觉幻觉(https://huggingface.co/papers?q=vision%20hallucination)困扰,即生成内容与视觉输入不符。现有方法要么依赖大规模标注数据微调,计算开销巨大;要么采用静态事后策略,忽视幻觉出现的动态特性。为此,我们引入全新的自奖励框架(https://huggingface.co/papers?q=self-rewarding%20framework),在推理时实现动态幻觉缓解(https://huggingface.co/papers?q=hallucination%20mitigation),无需外部监督。

实验发现,视觉幻觉呈现分阶段动态规律,在每个语义阶段开始时达到峰值。基于该洞察,我们提出 PSRD(Phase-wise Self-Reward Decoding),通过分阶段自奖励信号在线纠正幻觉。为降低解码过程中反复自评的成本,我们将 LVLMs 中的幻觉指导信号(https://huggingface.co/papers?q=hallucination%20guidance%20signal)蒸馏至轻量奖励模型(https://huggingface.co/papers?q=lightweight%20reward%20model)。该奖励模型在解码过程中实时提供针对性干预指导,实现精准抑制幻觉。

实验表明,PSRD 将 LLaVA-1.5-7B 的幻觉率降低 50.0%,在四大 LVLMs、五大幻觉评测基准上全面超越现有事后方法。进一步分析证实,PSRD 有效缓解幻觉传播(https://huggingface.co/papers?q=hallucination%20propagation),并在性能与推理效率(https://huggingface.co/papers?q=inference%20efficiency)之间实现高度可控的权衡。

查看 arXiv 页面(https://arxiv.org/abs/2604.17982)
查看 PDF(https://arxiv.org/pdf/2604.17982)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.17982)

在智能体中获取该论文:

hf papers read 2604.17982

未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

暂无模型链接该论文

在模型 README.md 中引用 arxiv.org/abs/2604.17982 即可在此处显示。

引用该论文的数据集 0

暂无数据集链接该论文

在数据集 README.md 中引用 arxiv.org/abs/2604.17982 即可在此处显示。

引用该论文的 Spaces 0

暂无 Space 链接该论文

在 Space README.md 中引用 arxiv.org/abs/2604.17982 即可在此处显示。

包含该论文的收藏 0

暂无收藏包含该论文

将本论文加入收藏(https://huggingface.co/new-collection)即可在此处显示。

相似文章

拆解病态捷径:用于忠实LVLM解码的因果框架

arXiv cs.AI

本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。

幻觉检测引导的临床摘要偏好优化

arXiv cs.CL

介绍了HDSR和HDSR-PL方法,这些方法使用幻觉检测器来指导迭代自我改进和偏好学习,在MIMIC-IV-Note上使用Llama和Gemma模型进行临床摘要时,幻觉减少高达48%。