UniProbe:使用多结构内部表示的大型视觉语言模型可学习令牌级幻觉检测器

Hugging Face Daily Papers 论文

摘要

UniProbe是一个轻量级检测器,它使用基于图的多结构内部表示来识别大型视觉语言模型中的幻觉令牌,将物体幻觉减少高达55%,同时延迟增加最小。

大型视觉语言模型(LVLMs)实现了令人印象深刻的视觉推理和对话能力,但经常幻觉出不受视觉输入支持的内容。有效的缓解需要令牌级定位,从而能够进行有针对性的干预,而无需丢弃整个响应。现有的检测器需要昂贵的全模型微调,依赖于忽略模型生成过程的外部验证器,或将内部信号简化为孤立特征和手工统计,丢弃了空间、序列和关系结构。我们介绍了UniProbe,一个轻量级、统一、可学习的检测器,它从单次前向传播中建模冻结的LVLM的异构计算轨迹。UniProbe在图像块、查询令牌和生成的令牌上构建一个有向图,其中注意力权重编码它们的关系。它使用交替的结构感知模块处理此轨迹:用于关系证据的GNN,用于二维视觉几何的ViT,以及用于响应顺序的GRU。交替它们允许空间、关系和序列证据在整个检测器中交互。我们进一步开发了一个用于幻觉感知解码的流式变体,它在生成过程中检测并重新采样幻觉令牌,以及一个自适应策略,使检测器与LVLM自身的生成对齐。在各种LVLM骨干网络中,UniProbe实现了最先进的令牌级和物体幻觉检测。在解码过程中,它在标准生成延迟的1.06倍时,将物体幻觉减少高达55%。
查看原文
查看缓存全文

缓存时间: 2026/08/17 07:44

论文页面 - UniProbe:基于多结构内部表征的可学习视觉语言模型幻觉检测器

来源:https://huggingface.co/papers/2608.10835 发布于 8月11日

·

提交者https://huggingface.co/Dvir

Samuel (https://huggingface.co/Dvir) 于8月17日

摘要

UniProbe是一个轻量级的可学习检测器,它使用有向图和交替的GNN、ViT以及GRU模块,在冻结的大型视觉语言模型中识别幻觉标记,从而实现生成过程中的实时重采样。

大型视觉语言模型(https://huggingface.co/papers?q=Large%20Vision-Language%20Models)(LVLMs)已展现出令人印象深刻的视觉推理和对话能力,但常常会生成视觉输入无法支撑的幻觉内容。有效的缓解措施需要标记级定位(https://huggingface.co/papers?q=token-level%20localization),从而实现针对性干预,而无需丢弃整个回复。现有检测器需要昂贵的全模型微调、依赖于忽略模型生成过程的外部验证器,或者将内部信号简化为孤立的特征和手工设计的统计量,忽略了空间、序列和关系结构。

我们提出了UniProbe,一个轻量级、统一且可学习的检测器,它通过单次前向传播来建模冻结的LVLM的异构计算轨迹。UniProbe在图像块、查询标记和生成的标记上构建了一个有向图(https://huggingface.co/papers?q=directed%20graph),并利用注意力权重(https://huggingface.co/papers?q=attention%20weights)来编码它们之间的关系。它通过交替的结构感知模块处理该轨迹:用于关系证据的GNN(https://huggingface.co/papers?q=GNN)、用于二维视觉几何的ViT(https://huggingface.co/papers?q=ViT)以及用于响应顺序的GRU(https://huggingface.co/papers?q=GRU)。将它们交错使用,使得空间、关系和序列证据能够在检测器中持续交互。我们进一步开发了一个用于幻觉感知解码的流式变体,该变体在生成过程中检测并重采样幻觉标记,同时还提出了一种将检测器与LVLM自身输出对齐的自适应(https://huggingface.co/papers?q=self-adaptation)策略。

在不同的LVLM骨干网络上,UniProbe在标记级和对象级幻觉检测(https://huggingface.co/papers?q=hallucination%20detection)方面均达到了最先进的水平。在解码过程中,它在标准生成1.06倍的延迟下,将对象幻觉降低了高达55%。

查看arXiv页面 (https://arxiv.org/abs/2608.10835)查看PDF (https://arxiv.org/pdf/2608.10835)项目页面 (https://research.nvidia.com/labs/par/uniprobe/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.10835)

通过代理获取本文:

hf papers read 2608.10835

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型数量:0

没有模型链接此论文

在模型README.md中引用 arxiv.org/abs/2608.10835 以从本页面链接。

引用本文的数据集数量:0

没有数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2608.10835 以从本页面链接。

引用本文的Spaces数量:0

没有Space链接此论文

在Space README.md中引用 arxiv.org/abs/2608.10835 以从本页面链接。

包含本文的收藏夹数量:0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接。

相似文章

多模态大语言模型的统一幻觉模糊测试

arXiv cs.CL

本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。

提示嵌入探针(PEP):从隐藏状态检测大语言模型幻觉

arXiv cs.CL

本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。

基于开权重代理分析器激活的幻觉检测

arXiv cs.CL

本文介绍了一种代理分析器框架,通过分析小型开权重模型的内部激活状态而非生成模型本身,来检测大型语言模型中的幻觉。与 ReDeEP 等现有方法相比,该方法在 RAGTruth 等基准测试中表现出更优越的性能,证明了分析方法的优劣比模型大小更为关键。

HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉

arXiv cs.CL

北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。