多模态大语言模型的统一幻觉模糊测试
摘要
本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。
查看缓存全文
缓存时间: 2026/08/11 08:05
# 多模态大语言模型的统一幻觉模糊测试
来源:https://arxiv.org/html/2608.07525
周鹏飞1,2∗贾俊松3∗唐志伟2,4,5马逸星6彭晓鹏7司东辉3徐宇航3宋慧琪3苗一远3钱逸辰2,5陈伟华2,5赵王波8‡庄博涵4唐家声2,5‡尤洋1‡
1新加坡国立大学
2阿里巴巴达摩院
3中国人民大学
4浙江大学
5湖畔实验室
6加州大学伯克利分校
7罗切斯特理工学院
8香港科技大学
###### 摘要
幻觉仍然是多模态大语言模型(MLLMs)面临的持续挑战,严重限制了其在高风险应用中的可靠性。现有评估主要基于静态基准,存在分类覆盖范围狭窄和性能快速饱和的问题,无法反映模型在不断演变的真实场景中的鲁棒性。为弥补这一差距,我们提出了一套系统化的评估框架,将全面基准与自我进化压力测试相结合。首先,我们引入了 **UniHall**,一个基于统一分类法的细粒度数据集,涵盖对象、指令和知识三个维度。其次,为解决基准饱和问题,我们提出了 **自适应多模态模糊测试(SAMF)**,一种采用进化变异策略来探索模型幻觉边界的自适应框架。关键在于,为确保动态输入评估的可靠性,SAMF 整合了一套由多模态预言机集成驱动的结构化指标套件。我们的广泛实验表明,最先进的 MLLMs 在模糊测试下相比传统设置表现出显著的性能下降,揭示了推理能力与事实依据之间的脱节。此外,我们发现了一种 ** helpfulness-幻觉权衡**,即通过强化学习进行的对齐无意中加剧了指令遵循任务中的谄媚行为。框架、代码和基准可在 https://github.com/LanceZPF/EvalHall 获取。
## 1 引言
以 GPT-5、Gemini 和 Qwen-VL 为代表的多模态大语言模型(MLLMs)在生成式推理和视觉理解方面展现了卓越的能力 [gpt5, team2023gemini, bai2025qwen2]。尽管取得了这些进展,幻觉仍然是其可信部署的持续瓶颈 [huang2025survey, li2023]。模型经常生成语言连贯但与视觉输入或既有知识在事实上不一致的响应 [bai2024hallucination, ji2023survey, liu2024survey, zhang2023]。这种不可靠性在医疗保健、法律咨询和自动驾驶系统等高风险领域构成严重风险,在这些领域,幻觉输出可能误导决策并引发灾难性的现实后果 [ji2023survey, liu2025application, pandit2025medhallu]。
图 1:UniHall 将多模态幻觉组织为对象、指令和知识三个维度,每个维度包含三个子类型,用于系统化评估。
尽管已有大量基准被提出用于量化这一现象 [li2023halueval, ye2024beaf, tu2025ode],由于覆盖范围限制和性能饱和,当前评估范式已显不足。以往的工作主要依赖于具有固定输入和预定答案的静态数据集 [guan2024hallusionbench, wang2023amber, chen2024detecting]。随着模型的发展,它们在这些基准上迅速饱和,实际上是在记忆考题而非获得真正的鲁棒性 [pan2025beyond, zhai2023halle, rohrbach2018object]。此类评估也无法捕捉真实世界幻觉的巨大长尾分布,且无法系统性地探测模型在对抗性或复杂指令变异下的漏洞。因此,高基准分数往往掩盖了潜在的脆弱性,造成一种虚假的安全感,这要求评估范式从静态测量转向动态、对抗性的压力测试。
为解决覆盖范围有限的问题,我们首先提出了一种全面的分类法,将幻觉分为三个不同维度:**对象级**(如虚构存在、属性)、**指令级**(如拒绝失败、谄媚)和**知识级**(如虚构事实)。基于这一分类法,我们构建了 **UniHall**(图 1),一个整合了多种开放域和领域特定数据 [MSCOCO, MedFrameQA] 的大规模基准。与以往主要关注单一对象相关错误的工作不同,UniHall 支持更深入的分析,使我们能够精确定位不同认知任务中的具体失败模式,并为系统化压力测试提供更细粒度。
在此基础之上,我们引入了**自适应多模态模糊测试(SAMF)**,一种旨在克服基准饱和的自适应评估框架。受软件模糊测试 [miller1990empirical] 的启发,SAMF 作为自动化红队机制运作,采用包括强化学习在内的进化策略来生成语义保持但具有对抗性的变异。为实现对这些动态输入的可扩展且可靠的评估,SAMF 整合了一种由互补预言机驱动的结构化幻觉指标(图 4),结合符号规则、检测器和 LLM 验证器,形成从粗到细的流水线。除了二元正确性之外,我们的指标还提供关于幻觉严重程度和根源的细粒度解释,从而构建一个无需人工干预的闭环评估系统。
我们对最先进 MLLMs 的大量实验揭示了在模糊测试下相比静态设置的显著性能下降,暴露了推理能力与事实依据之间的脱节。此外,我们识别出一个关键的 **helpfulness-幻觉权衡**:通过强化学习大力对齐以提升用户帮助性的模型往往表现出加剧的谄媚行为,倾向于编造信息以满足误导性指令,而非承认自身的无知。
##### 相关工作。
先前的基准如 POPE [li2023evaluating] 和 HallusionBench [guan2024hallusionbench] 为诊断 MLLMs 中的幻觉提供了有价值的静态基准,而近期的努力已开始探索针对视觉-语言系统的模糊测试启发式评估(例如,ROME [yu2023rome])。我们的工作通过将细粒度分类法与自适图像和提示模糊测试以及结构化预言机验证相统一,对这些工作形成补充。更广泛的相关工作讨论见附录 A。
表 1:UniHall 与现有模态幻觉基准的比较。*任务*:Disc.:判别式;Gen.:生成式;G&D:生成式+判别式。*幻觉分类法*:对象/指令/知识。UniHall 在幻觉类型上提供了显著更广泛的覆盖,并包含结构化预言机、自适应模糊测试和风险等级标注作为鲁棒评估的新特性。
表 2:UniHall 的关键统计信息。|G| 和 |N| 分别表示每个实例的可接受答案数和负样本答案数。提示长度以最小值、最大值和平均值(Min/Max/Avg)报告。
总体而言,我们的贡献总结如下:
- • 我们引入了 **UniHall**,一个基于统一的对象-指令-知识幻觉分类法的风险感知基准。
- • 我们提出了 **SAMF**,首个具有自适应进化和结构化预言机验证的变异驱动的 MLLM 模糊测试框架。
- • 我们通过系统化压力测试揭示了一种对齐代价,表明以 helpfulness 为导向的 RL 会降低指令级忠实度。
## 2 种子数据集构建
我们通过重新利用开放域和领域特定的多模态基准数据,并在标准化标注协议下进行人工规范化,构建了一个统一的种子数据集,以支持可扩展的变异和基于预言机的评估。
### 2.1 数据来源与覆盖范围
该数据集整合了广泛使用的开放域基准(如 Hallu-PI [ding2024hallu] 和 BEAF [ye2024beaf])以及领域特定资源。每个实例被映射到特定的幻觉类别(对象级、指令级、知识级),以确保全面覆盖。对象级类别包含超过 1,000 个代表性实例,涵盖存在性、属性和关系,而指令级和知识级幻觉同样包含多样化的案例(详见附录 B)。统计数据见表 2;请注意,我们的测试时数据可以通过测试时自适应模糊测试生成任意数量的变体,从而实现扩展。
### 2.2 标注与整理流程
数据集通过以下流程进行整理:
1. 1. **来源分配**:3 位元评审员将相关的原始源数据(按每个类别目标量的 5-10 倍超额配置)分配给 10 位标注员,每位标注员专注于特定的幻觉子类型。
2. 2. **ID 与分类法分配**:标注员将每个实例映射到标准化的 `instance_id`,并严格遵循所提出的分类法和风险评估标注元数据字段。
3. 3. **种子数据准备**:每个实例被分类为是/否(YON)或开放式 VQA。我们标注问题、真实答案(GT)以及替代性或负样本答案。YON 实例严格使用是/否作为 GT,而 VQA 实例允许自由形式的回答。每个对应的图像都与文本实例配对。可进行可选的人工图像编辑,以提高某些实例的挑战性。
4. 4. **质量控制**:标注员交叉检查图像-文本对齐、分类法一致性和视觉清晰度。模糊、低质量或不匹配的实例会被过滤,所有剩余实例由元评审员进行双重检查。
### 2.3 类别与数量要求
如图 1 所示,种子数据集的构建旨在全面覆盖我们分类法下的主要幻觉类别,借鉴了最先进基准和专家建议。每个类别都指导了针对性模糊测试算子及相应基于预言机的评判器的设计。进一步的分类法定义和子类型细分见附录 B.2。
图 2:SAMF 架构。SAMF 使用智能体驱动的模糊测试来生成自适应多模态测试样本,以评估被测模型的鲁棒性。
## 3 提议方法
基于我们的幻觉分类法,我们开发了一个统一的评估框架,将标准评估扩展到基于模糊测试的压力测试(图 2)。我们的目标是通过对文本和视觉输入进行*语义保持但认知对抗性*的变异来积极探测幻觉,并具有明确的难度控制。
### 3.1 统一幻觉评估框架
我们构建了一个基础框架 **EvalHall**,一个标准化且可扩展的流水线,支持在可复现设置下进行静态和动态测试。从种子数据的标准评估开始,EvalHall 应用受控变换来生成认知难度递增的扰动输入。每个变异实例都标注了难度阶段(简单、中等、困难),用于下游分析。如图 4 所示,输出由互补预言机评估,包括视觉对象检测器、跨模态对齐模型、符号规则检查器、接地和引用验证器,以及用于模糊案例的 LLM 评判器。
### 3.2 动态变异算子
我们设计了一套模态感知的变异套件,在保持任务语义的同时引入*认知对抗性*干扰,按照幻觉诱导原则组织,并标注难度标签(简单/常见/中等/困难/极限),用于分阶段鲁棒性分析。附录 C.1 详细说明了这些变异算子的实现。
##### 文本变异。
针对认知鲁棒性和推理稳定性,通过 (i) **冗余/干扰控制**(如不相关上下文扩展、约束堆叠),(ii) **复杂性陷阱**(如句法复杂化、显式否定干扰项),以及 (iii) **知识冲突诱导**(如权威偏见注入)。
##### 视觉变异。
通过 (i) **背景干扰注入** 施压注意力控制和选择性接地,(ii) 具有受控图像质量下降的**冗余多视图副本**,以及 (iii) 具有选择性接地约束的**多图像过载**。这些测试时变换借鉴了图像编辑和样本感知数据增强的最新进展 [zhou2026neural, yang2025fly];与训练时增强不同,SAMF 使用受控变异来暴露评估过程中的失败。
### 3.3 自适应模糊测试
在此基础之上,我们引入了模糊测试框架 **SAMF**(自适应多模态模糊测试)。SAMF 利用所有变异算子进行广泛且细粒度的鲁棒性评估。对于策略发现,我们使用基准的 20% 试点子集;在该动态试点集上,我们的基础实现通过启发式算法进行算子搜索,以平衡搜索效率与幻觉覆盖率提升。除了启发式搜索,我们进一步探索了*基于强化学习的模糊测试*,以导航大型算子/参数空间。RL 智能体学习自适应策略,根据预言机反馈优化算子选择和变异强度;与启发式策略相比,基于 RL 的模糊测试在长视界探索和模型特定弱点发现的并行训练效率方面具有更好的表现。经验上,两者都有效,但 RL 实现了更高的幻觉发现效率和更稳定的跨模型覆盖率。技术细节见附录 C。
## 4 实验
表 3:不同 MLLMs 在标准评估下的总体幻觉率(GHR)↓ 性能比较。
### 4.1 评估指标
现有指标常常混淆合理性与正确性,且提供的解释有限。因此,我们提出一个多层指标套件,包含 (i) 多阶段确定性逻辑,(ii) 声明级结构分解,以及 (iii) 基于证据集的预言机验证。
##### 符号表示。
令 x=(I,q) 为图像-问题对,y 为响应,G 为真实答案,N 为标注的负样本(反事实)集合。令 r∈{1,...,5} 表示实例级风险。所有指标均归一化到 [0,1],数值越高表示幻觉越严重。
##### 通用幻觉率(GHR)
GHR 通过采用不对称决策逻辑来检测无依据但流畅的响应,解决了表面匹配的失败问题。我们定义二元决策函数 h_GHR(y)∈{0,1},其中 1 表示幻觉:
h_GHR(y) = { 1, 如果 Sim_NLP(y,N) ≥ τ₁,
1, 如果 Judge_GPT(y,N) = TRUE,
0, 如果 Sim_tok(y,G) ≥ τ₃,
0, 如果 Sim_NLP(y,G) ≥ τ₂,
0, 其他情况 }相似文章
MeasHalu:通过增强推理缓解大语言模型的科学测量幻觉
# MeasHalu:通过增强推理缓解大语言模型的科学测量幻觉 来源:[https://arxiv.org/html/2604.16929](https://arxiv.org/html/2604.16929) Ruijun Huang1,Zhiqiao Kang1,Yuxuan Zhu1,Junxiong Li1,Jiahao Zhao1, Minghuan Tan1,Feng Jiang211footnotemark:1,Min Yang1 1 中国科学院深圳先进技术研究院高性能数据挖掘深圳市重点实验室 2 深圳大学人工智能研究院
HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉
北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。
HalluWorld:基于参考世界模型的可控幻觉基准
HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。
OpenHalDet:一种针对多样生成场景下幻觉检测的统一基准
OpenHalDet 是一个用于大语言模型幻觉检测的统一基准,它标准化了跨不同生成场景的评估,并支持黑盒、灰盒和白盒检测方法。
ClinHallu:用于诊断医疗多模态大语言模型推理中阶段性幻觉的基准
ClinHallu是一个基准,通过将推理分解为视觉识别、知识回忆和推理整合阶段,并使用轨迹监督微调来减少错误,从而诊断和缓解医疗多模态大语言模型中的幻觉。