SpanCalib-VLM:视觉语言模型中的校准幻觉跨度检测

Hugging Face Daily Papers 论文

摘要

SpanCalib-VLM提出了一种混合系统,该系统结合了多模态序列标注器和生成式视觉语言模型,以增强幻觉跨度检测和校准,并在SHROOM-Visions任务中实现了性能提升。

在大型视觉语言模型(LVLMs)中检测幻觉需要准确的跨度定位和良好校准的置信度分数。微调后的生成式VLMs在识别幻觉文本跨度方面表现出色,但存在过度自信和高推理延迟的问题。判别式序列标注器提供确定性的速度和优越的校准,但表现出保守的跨度召回率。我们提出SpanCalib-VLM,一个用于SHROOM-Visions共享任务的混合双系统,该系统结合了多模态序列标注器(由XLM-RoBERTa-Large与SigLIP视觉编码器通过交叉注意力融合而成)和我们的微调生成式VLM(Qwen3.5-4B-SHROOM-SFT)。通过联合校准融合策略,来自生成模型的候选跨度使用序列标注器校准的概率重新评分。在SHROOM-Visions英语评估划分中,我们的集成达到了0.41的皮尔逊校准相关性和0.39的总体IoU,干净响应IoU为0.91},总体检测准确率为70.7%。我们将模型权重和代码公开发布。
查看原文
查看缓存全文

缓存时间: 2026/09/01 15:40

论文页面 - SpanCalib-VLM:视觉语言模型中校准化的幻觉片段检测

来源:https://huggingface.co/papers/2608.29974

摘要

一种结合多模态序列标注器和生成式视觉语言模型的混合系统,通过联合校准融合机制提升了幻觉片段检测的准确性和校准性。

检测大型视觉语言模型(Large Vision-Language Models, LVLMs)中的幻觉现象,既需要精确的片段定位(span localization),也需要良好校准的置信度分数。经过微调的生成式视觉语言模型(generative VLM)擅长识别幻觉文本片段,但存在过度自信和推理延迟高的问题。判别式序列标注器(discriminative sequence tagger)具备确定性的处理速度和优越的校准能力,但其片段召回较为保守。我们提出了 SpanCalib-VLM,这是一个用于 SHROOM-Visions 共享任务的混合双系统,它结合了一个多模态序列标注器(由 XLM-RoBERTa-Large 与 SigLIP 视觉编码器通过交叉注意力机制融合而成)和我们微调过的生成式视觉语言模型(Qwen3.5-4B-SHROOM-SFT)。通过采用联合校准融合(Union-Calibrated Fusion)策略,来自生成模型的候选片段会利用序列标注器输出的校准概率进行重新评分。在 SHROOM-Visions 英语评估集上,我们的集成模型达到了 0.41 的皮尔逊校准相关系数(Pearson calibration correlation),整体交并比(IoU)为 0.39,其中干净响应的交并比高达 0.91,总体检测准确率为 70.7%。我们已公开模型权重和代码。

查看 arXiv 页面 (https://arxiv.org/abs/2608.29974)查看 PDF (https://arxiv.org/pdf/2608.29974)GitHub0 (https://github.com/Aman-byte1/Hallucination-Detection-in-LVLMs)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.29974)

在您的智能体中获取此论文:

hf papers read 2608.29974

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.29974 即可将此论文关联到该模型。

引用本文的数据集 0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.29974 即可将此论文关联到该数据集。

引用本文的 Spaces 0

没有 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.29974 即可将此论文关联到该 Space。

包含本文的集合 0

没有集合包含此论文

将此论文添加到一个集合 (https://huggingface.co/new-collection)即可将此论文关联到该集合。

相似文章

从大型语言模型的序列内部离散中学习不确定性

arXiv cs.CL

本文介绍了SIVR(序列内部方差表示),一个有监督框架,通过分析隐层状态中的逐token和逐层方差模式来检测LLM中的幻觉现象,无需依赖严格的架构假设。该方法聚合完整序列方差特征来学习事实错误的时间模式,并在较小训练集上表现出更好的泛化能力。

基于输入端证据对齐的幻觉片段检测

arXiv cs.CL

本文介绍了一个在LLMs中通过将输出token与输入证据对齐来检测幻觉片段的任务,提出了一种基于编码器的模型,该模型使用预测置信度来检测幻觉,无需人工对齐。

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

arXiv cs.CL

本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。

用于词元级幻觉检测的时序多信号融合方法

Hugging Face Daily Papers

本文介绍了一种时序多信号融合方法,用于通过融合特征上的序列标注检测语言模型中的词元级幻觉,在不访问模型内部信息的情况下实现了改进的跨模型性能。