HalluPrism:当多模态不确定性应进行诊断而非决策时

arXiv cs.LG 论文

摘要

本文介绍了HalluPrism,这是一种针对多模态大语言模型的行为诊断方法,它使用视觉扰动探针来识别幻觉故障模式,改进了仅基于置信度的故障类别分类方法。

arXiv:2608.29193v1 公告类型:新 摘要:多模态大语言模型 (MLLMs) 可能为因不同原因失败的答案分配相似的置信度。我们提出HalluPrism,这是一种行为诊断方法,在视觉退化、空白图像替换以及接地或关系检查后重新运行答案。这些针对性的探针生成一个基于视觉扰动敏感性 (V)、图像移除置信度保持 (L) 和接地/关系探针不稳定性 (A) 的签名。跨越来自四个基准和四个MLLMs的58K+样本,图像移除置信度保持最为普遍,而接地/关系探针不稳定性更能区分故障类别。只有18个源-目标检查是对角线对齐的,因此坐标应被联合解释,而非作为独立的因果源。在固定数据集下,联合签名将故障类别AUROC从HallusionBench上的0.634提高到0.769,从VizWiz上的0.707提高到0.817,在POPE和VSR上增益较小。在综合XGBoost分析中,AUROC从标量置信度的0.78上升到(V, L, A)的0.95,当添加置信度时达到0.97。相同的签名并不自动改善正确性排名。测试的三个直接标量化可能有害。这些结果将故障诊断与弃权评分分离:多模态不确定性应在用于决定是否弃权或纠正之前,表征故障结构。
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:10

# 1 引言  
来源:https://arxiv.org/html/2608.29193 \\papertitle HalluPrism:多模态不确定性应用于诊断而非决策\\papershorttitle HalluPrism\\papershortauthors A\. Prakash, S\. Dasgupta, and T\. Chakraborty\\paperauthors Aman Prakash1Sourish Dasgupta2Tanmoy Chakraborty1\\paperaffil1 LCS2 Lab, Indian Institute of Technology Delhi, New Delhi, India 2KDM Lab, Dhirubhai Ambani University, Gujarat, India\\paperemailsamanprakash\.connect@gmail\.com, sourish\_dasgupta@dau\.ac\.in, tanchak@iitd\.ac\.in\\paperkeywords 多模态大型语言模型,多模态不确定性,幻觉诊断,行为探测,跨模态对齐,选择性预测\\paperabstract 多模态大型语言模型(MLLM)可能为不同原因导致失败的答案赋予相似的置信度。我们提出 HalluPrism,这是一种行为诊断方法,它在视觉退化、空白图像替换以及对齐或关系检查后重新运行答案。这些针对性探测产生了视觉扰动敏感度 \(V\)、图像移除置信度保留 \(L\) 和对齐/关系探测不稳定性 \(A\) 的特征。在来自四个基准测试和四个 MLLM 的 58K+ 个样本中,图像移置置信度保留最为普遍,而对齐/关系探测不稳定性更能区分失败类型。在 48 个源-目标检查中,只有 18 个是对角线对齐的,因此应联合解释这些坐标,而非将其视为独立的因果来源。在固定数据集的情况下,联合特征将 HallusionBench 上的失败族 AUROC 从 0.634 提高到 0.769,VizWiz 上从 0.707 提高到 0.817,在 POPE 和 VSR 上的提升较小。在合并的 XGBoost 分析中,AUROC 从标量置信度的 0.78 提升至 \(V, L, A\) 的 0.95,并在加入置信度后达到 0.97。该特征并不能自动改进正确性排序。所测试的三种直接标量化方法可能损害其性能。这些结果将失败诊断与放弃评分区分开来:在用于决定是否放弃或修正之前,多模态不确定性应首先表征失败结构。\\appendixtocon\\appendixtocname 附录内容\\makelabtitle

## 1 引言  
即使多模态大型语言模型(MLLM)对某个基于视觉的回答赋予高置信度,该回答也可能是不安全的。考虑一个街景图像,其中交通锥位于一辆停放汽车的右侧,用户问:“交通锥在汽车的左边吗?” 模型可能以高置信度回答“是”。这个单一的自信回答可能隐藏着不同的风险。锥体可能很小、模糊或部分被遮挡,表明视觉证据薄弱。图像替换为空白画布后,模型可能仍会回答“是”,显示回答在没有图像的情况下依然存在,这可能与仅依赖问题本身的语言先验一致。它可能还能识别锥体和汽车,但颠倒了左右关系,表明存在跨模态绑定失败。在这种情况下,标量不确定性可以帮助决定模型是否应放弃,但无法解释失败来源。现有的幻觉基准测试已经表明,多模态错误是异构的,包括物体幻觉、视觉错觉、属性错误、空间错误和可回答性失败 \[29, 16, 40, 32\]。置信度、校准和选择性预测方法通常用于排序可能的正确性或决定模型是否应放弃 \[4, 22, 25, 12\],而最近的 MLLM 不确定性研究通过证据冲突、隐藏状态可靠性和不确定的视觉标记更接近幻觉检测 \[20, 34, 38\]。然而,标量放弃并非内部模型保证,而是一种部署护栏,其有效性取决于设计师选择的分数、阈值、验证集和风险假设,这些对于新的开放世界实例可能会失败。因此,我们认为诊断应成为多模态不确定性的核心对象——在回答或修正之前,系统应表征行为是否与视觉敏感性、图像移除置信度保留或跨模态绑定不稳定性一致。

参见图 1:HalluPrism 扰动-响应协议概述。这里 \(L\) 表示图像移除置信度保留;语言先验依赖只是这种响应的一种可能解释。分数是行为探测,而非因果分解。完整的提示模板和探测参数见附录 9。

我们提出 HalluPrism,这是一种用于 MLLM 不确定性的扰动-响应诊断方法。给定一张图像、一个提示和一个生成的答案,HalluPrism 计算标量置信度 \(c\) 和扰动-响应特征 \(s(x)=(V, L, A)\),其中 \(V\) 为视觉扰动敏感度,\(L\) 为图像移除置信度保留,\(A\) 为对齐/关系探测不稳定性。在交通锥示例中,当模糊、裁剪、变暗或噪点改变答案或其置信度时,\(V\) 增加;当空白图像替换后置信度相对于干净图像预测得以保留时,\(L\) 增加;当对齐或关系扰动暴露左右绑定不稳定性时,\(A\) 增加。我们还使用了一个更严格的图像移除控制,要求原始答案本身在图像移除后仍然存在。特征 \(s(x)\) 是一个扰动-响应概况,而非隐藏机制的分解。因此,高 \(L\) 并不能证明模型从未使用过图像,而高 \(V\) 或 \(A\) 记录的是敏感性,而非孤立的内部原因。我们使用 HalluPrism 作为用于诊断和修正路径选择的联合行为特征。它首先作为失败族预测的诊断特征。然后,它为风险预测选择修正路径:高视觉扰动敏感度选择对锥体和汽车进行视觉重新对齐;高图像移除置信度保留选择反先验提示,要求模型检查图像而非仅依赖问题本身的合理性;高对齐/关系探测不稳定性选择对锥体在汽车左侧还是右侧进行关系检查。我们称这种基于特征选择修正提示的方式为干预路由。

在来自 Gemma 4、LLaVA-Mistral/Vicuna 和 Qwen3-VL 在 HallusionBench、POPE、VSR 和 VizWiz-VQA 上的 58,440 个样本中,我们发现了四种模式。首先,原始流行度不具有诊断价值。尽管 \(L\) 占样本的 99.7%,但 \(A\) 被发现是失败族预测中最强的基于树的特征。其次,这些分数不是独立的标签。如果 \(V, L\) 和 \(A\) 确实是特定来源的,那么视觉、语言和对齐破坏的输入应主要移动相应的匹配坐标。然而,在 4×4×3 个破坏条件检查中,只有 18/48 个此类事件通过。视觉输入在 11/16 种设置中通过,而语言和对齐输入分别在 2/16 和 5/16 中通过。因此,\((V, L, A)\) 是一个联合扰动-响应特征,而非独立的原因。第三,该联合特征仍然具有高度诊断性。在固定数据集的情况下,\((V, L, A)\) 将 HallusionBench 上的 AUROC 从标量置信度的 0.634 提高到 0.769,VizWiz 上从 0.707 提高到 0.817,在 POPE 和 VSR 上的提升较小。在合并的 XGBoost 分析中,AUROC 从标量置信度的 0.78 提升至 \((V, L, A)\) 的 0.95,并在加入置信度后达到 0.97。第四,作为次要应用,该特征指导更安全的修正。匹配路由选择视觉重新对齐、反先验提示或关系检查,而不是对所有示例使用一个通用提示。在 Qwen3-VL/VSR 上,通用提示将准确率从 87.4% 降至 76.2%,并破坏了 15.5% 的正确答案。匹配路由保持 87.6% 的准确率,并将破坏率降至 2.7%。

贡献:(i) 我们认为扰动-响应诊断应成为多模态不确定性的核心。(ii) 我们提出 HalluPrism,这是一种基于视觉扰动敏感度、图像移除置信度保留和对齐/关系探测不稳定的扰动-响应特征。(iii) 我们表明,受控探测揭示了干预纠缠,而非清晰的源可分性。(iv) 我们表明,这种纠缠特征改进了失败族诊断,而简单的标量化可能损害放弃排序。[1] 源代码可在 https://github.com/gitgoap/HalluPrism 获取。

## 2 相关工作  
**幻觉评估。** 视觉-语言幻觉研究表明多模态错误是异构的。图像描述和视觉问答将物体幻觉和视觉错误推理与语言先验和弱对齐联系起来 \[36, 15\]。POPE、HallusionBench、AMBER、MME 和 MMBench 等基准测试在物体存在、视觉错觉、属性、关系、感知、推理和指令遵循方面明确展示了这一点 \[29, 16, 40, 8, 32\]。HalluPrism 则测量基于视觉扰动敏感度、图像移除置信度保留和对齐/关系探测不稳定的行为扰动-响应特征。

##### 不确定性与放弃。拒绝选项和选择性分类工作将不确定性视为决策对象。模型在风险低时回答,否则放弃 \[4, 10, 11\]。校准询问置信度是否与经验正确性匹配 \[17\]。语言模型不确定性使用自我估计、标记概率、语义等价性和样本不一致性作为可靠性信号 \[22, 25, 12, 33\]。多模态不确定性增加了视觉放弃、证据冲突、隐藏状态可靠性和视觉标记不确定性 \[5, 39, 20, 34, 38\]。我们的批评范围更窄。放弃在其假设下具有统计价值。然而,阈值分数的合理性取决于验证的转移性,不一定需要在新的开放世界实例中诊断风险。

##### 探测与归因。行为测试通过受控输入更改研究模型行为。CheckList、对比集和反事实增强数据通过小编辑暴露局部失败 \[35, 9, 23\]。归因方法则使用视觉区域定位、注意力流或图像标记注意力分析 \[37, 21, 1, 13\]。HalluPrism 遵循行为测试的观点。它询问输出在视觉证据、仅问题先验或跨模态绑定的压力下如何变化。

##### 缓解与路由。幻觉缓解通常在解码或生成后应用固定的修正规则。视觉对比解码、OPERA、M3ID、Woodpecker 和 Volcano 通过视觉对比、解码惩罚、基于图像的放大或事后修正减少幻觉 \[27, 19, 6, 41, 26\]。最近的推理时方法通过跨模态校准、注意力校准和视觉感知稀疏化改进了这个方向 \[28, 7, 42\]。HalluPrism 是诊断优先的。它分析风险预测的概况,然后选择匹配的基于提示的修正。

## 3 方法论  
我们将多模态不确定性作为**决策前诊断对象**进行研究。目标不是构建更好的标量放弃分数。相反,我们测试一个预测是否携带行为扰动-响应特征,该特征可以诊断失败族并路由修正,而无需假设清晰的因果可分性。因此,该设计将通常混淆的三个对象分离:正确性排序、失败来源诊断和修正路径选择。这种分离很重要,因为相同的扰动-响应特征可能用于解释失败,在本文测试的直接标量化下可能有害,而在选择更安全的修正路径时再次有用。诊断表示因此可以改进失败类型划分,而不必改进答案与放弃的评分。所有引用的形式化结果见附录 7。

##### 预测与扰动-响应特征。考虑一张图像 \(I\),其中交通锥位于一辆停放汽车的右侧,提示 \(q\) 询问锥体是否在汽车的左边。如果 MLLM \(M\) 对 \(x=(I,q)\) 回答“是”,而参考答案 \(y\) 是“否”,则输出不正确。我们通过比较前将“是”、“是。”、“是,它是”等表面变体映射到同一规范任务标签,然后进行比较。我们将正确性写为 \(z(x,M)=\mathbf{1}[\mathrm{norm}(\hat{y})=\mathrm{norm}(y)]\)。不正确的输出获得一个粗略的失败族标签 \(f(x,M) \in \mathcal{F}\),例如**物体幻觉**、**空间/关系错误**、**属性错误**或**可回答性失败**。标量置信度估计器将输入-输出实例映射到 \(c(x,M) \in [0,1]\)。对于标记化的答案 \(\hat{y}=(t_1,\ldots,t_N)\),我们使用长度归一化的置信概率:\(c(\hat{y}|I,q)=\exp\left(\frac{1}{N}\sum_{i=1}^N \log p(t_i | t_{<i}, I, q)\right)\)。特征 \(s(x) = (V, L, A)\) 捕获扰动-响应行为。对于输入 \(x=(I,q)\) 和模型 \(M\):

1. **视觉扰动敏感度 (\(V\))**:我们对 \(I\) 应用一组视觉变换(如模糊、裁剪、变暗、加噪),得到 \(I'\)。如果模型在 \((I', q)\) 上的答案或其置信度与 \((I, q)\) 上的相比发生变化,则 \(V\) 增加。\(V\) 衡量答案对图像修改的敏感性。

2. **图像移除置信度保留 (\(L\))**:我们将 \(I\) 替换为空白图像 \(I_{\emptyset}\)。\(L\) 是模型在 \((I_{\emptyset}, q)\) 上的置信度相对于 \((I, q)\) 上的保留程度。我们使用更严格的控制,要求原始答案本身在 \((I_{\emptyset}, q)\) 上仍然存在。高 \(L\) 可能表明依赖语言先验而非视觉证据。

3. **对齐/关系探测不稳定性 (\(A\))**:我们施加专注于对齐或关系的扰动。例如,对于交通锥场景,我们可能生成一个关系检查提示(如“锥体是在汽车的左边还是右边?”)或使用对齐扰动(如交换对象)。\(A\) 捕获模型对这类特定探测的敏感性。高 \(A\) 可能表明跨模态绑定失败。

这些探测旨在揭示不同的失败模式。重要的是,\(s(x)\) 是一个**联合扰动-响应特征**,而不是对因果来源的分解。因此,高 \(L\) 不能单独证明模型“忽略了图像”,高 \(V\) 或 \(A\) 也是如此;它们是行为指示器。

##### 失败族诊断。我们使用特征 \(s(x)\)(有时与原始置信度 \(c\) 结合)来预测失败族标签 \(f(x,M)\)。这是一个分类任务,其中输入是 \((V, L, A, c)\),输出是 \(\mathcal{F}\) 中的类别。我们评估该诊断任务的 AUROC(通常为一对多)。

##### 修正路由。对于检测到的每个失败类型,我们可以选择一个特定的修正提示:

- **高 \(V\)(视觉敏感)**:使用“视觉重新对齐”提示,要求模型仔细重新检查图像的特定部分。
- **高 \(L\)(图像移除保留)**:使用“反先验”提示,明确指示模型忽略问题本身的合理性,严格关注图像证据。
- **高 \(A\)(对齐/关系不稳定)**:使用“关系检查”提示,要求模型明确陈述或推理对象之间的空间/关系信息。

这种基于特征选择修正提示的方式称为**干预路由**。它与对所有失败示例使用单一通用提示形成对比。

##### 分析与评估。我们使用来自四个基准测试(HallusionBench、POPE、VSR、VizWiz)和多个 MLLM(Gemma、LLaVA 变体、Qwen3-VL)的约 58K 个样本。主要评估指标是失败族预测的 AUROC。我们还评估了修正路由对答案准确性和“破坏”率(即修正过程破坏原始正确答案的情况)的影响。

相似文章

多模态大语言模型的统一幻觉模糊测试

arXiv cs.CL

本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。

PRISM:探究大语言模型幻觉中的推理、指令与源记忆

arXiv cs.CL

研究人员提出了 PRISM 诊断基准,该基准将大语言模型(LLM)的幻觉拆解为四个维度(知识缺失/错误、推理错误、指令遵循错误),涵盖三个生成阶段(记忆、指令、推理),并通过评估 24 款大语言模型,揭示了各类缓解策略之间存在的权衡关系。