OmniHallu:用于多模态大语言模型中跨模态理解与生成的统一幻觉检测

arXiv cs.CL 论文

摘要

OmniHallu引入了一个统一的幻觉检测框架,适用于多模态大语言模型,涵盖图像、视频和音频模态的理解与生成任务,并包括一个基准测试和多智能体架构。

arXiv:2609.11244v1 公告类型:新 摘要:尽管多模态大语言模型(MLLMs)在多种任务上取得了显著进展,但它们存在幻觉问题,即生成的输出与输入语义相矛盾或误导。现有研究通常局限于单一模态或任务类型中的幻觉检测,限制了泛化能力。我们引入OmniHallu,一个统一的幻觉检测框架,涵盖图像、视频和音频模态的理解与生成任务。我们贡献了OmniHallu-Bench,一个包含10,000个样本的基准测试,带有声明级的人工标注,覆盖六种跨模态任务:图像到文本(I2T)、视频到文本(V2T)、音频到文本(A2T)、文本到图像(T2I)、文本到视频(T2V)和文本到音频(T2A)。我们的多智能体架构将模型输出分解为原子声明,通过特定模态的专家进行验证,并通过结构化推理聚合证据。我们进一步提出了一个偏好优化的可训练验证器,它近似于多智能体决策边界,在性能损失最小的情况下减少了66%的专家调用。大量实验揭示了一致的模态依赖性能梯度,并提供了对跨模态幻觉模式的细粒度洞察。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:26

# 面向多模态大语言模型跨模态理解与生成的统一幻觉检测
来源:https://arxiv.org/html/2609.11244
作者:裴恒(香港大学)、许山青(华中科技大学)、钱梦晨(华中科技大学)、张璐(上海教育科学研究院)、罗盟(通讯作者:罗盟 \(mluo@u\.nus\.edu\),新加坡国立大学)

###### 摘要

多模态大语言模型(MLLMs)在各项任务中取得了显著进展,但常出现幻觉问题,即生成的输出与输入语义相矛盾或产生误导。现有研究通常局限于单一模态或任务类型的幻觉检测,限制了其泛化能力。我们提出了OmniHallu,一个涵盖图像、视频和音频模态下理解与生成任务的统一幻觉检测框架。我们构建了OmniHallu-Bench,这是一个包含10,000个样本、具有声明级人工标注的基准测试集,覆盖六种跨模态任务:图像到文本(I2T)、视频到文本(V2T)、音频到文本(A2T)、文本到图像(T2I)、文本到视频(T2V)和文本到音频(T2A)。我们的多智能体架构将模型输出分解为原子声明,通过模态特定的专家进行验证,并通过结构化推理聚合证据。我们进一步提出一个偏好优化的可训练验证器,它近似于多智能体的决策边界,在性能损失极小的情况下,将专家调用次数减少了66%。大量实验揭示了一致的依赖于模态的性能梯度,并提供了对跨模觉模式的细致洞察。

## 1 引言

参考标题 图1:MLLMs在理解与生成中,跨模态产生涉及对象、属性、关系和事件幻觉类型。
多模态大语言模型(MLLMs)(Li et al., 2024; Chen et al., 2025; Li et al., 2025b; Li et al., 2026; Luo et al., 2024)在视觉、音频和语言任务中取得了显著进展。然而,这些模型经常产生幻觉:生成与输入相矛盾或产生误导的输出(Bai et al., 2024; Huang et al., 2025b; Lin et al., 2025; Luo et al., 2026a; Luo et al., 2026b)。幻觉是将MLLMs部署到安全关键应用中的根本障碍。

现有的幻觉检测方法主要针对单一模态或任务类型。面向图像的基准测试(Li et al., 2023b; Wang et al., 2024a)不涵盖视频或音频;面向视频(Liu and Wan, 2023; Wang et al., 2024b)和音频(Nishimura et al., 2024)的评估同样独立进行。此外,大多数工作只关注理解任务,而忽略了生成任务,尽管两者都存在源于感知和推理不足的共同幻觉模式。

我们研究了一种统一的声明级检测协议,它支持跨模态和任务方向的并行比较,同时揭示了哪些组件可以迁移,以及哪些地方仍需模态特定的验证。

为此,我们介绍了OmniHallu,一个统一的幻觉检测框架,以及OmniHallu-Bench,一个包含10,000个人工验证样本的基准测试集。我们采用成熟的分解-验证-聚合范式(Chen et al., 2024a),将其应用于六种双向任务:视频验证强调时序和因果证据,而音频验证则依赖于声学线索和相对不成熟的工具生态系统。我们的贡献包括:

- • OmniHallu-Bench:一个包含10,000个样本、具有声明级人工标注的基准测试集,涵盖四个模态的六种跨模态任务(I2T, V2T, A2T, T2I, T2V, T2A)。
- • 跨模态系统化:一种模态感知的声明分解、专业验证和证据聚合实现,以及对组件贡献、性能变化和失败模式的对照分析。
- • 偏好优化验证器:一个通过GRPO对齐的紧凑型可训练验证器,在性能损失极小的情况下,将昂贵的专家调用次数减少了66%。

表1:幻觉基准比较。“功能”表示该基准支持事实核查还是幻觉检测。“粒度”表示评估级别是响应级、片段级还是声明级。“原理”表示该基准是否提供解释性理由。
## 2 相关工作

#### MLLMs中的幻觉。

幻觉出现在所有MLLM模态中。在视觉-语言模型中,生成的描述可能提到图像中不存在的对象(Li et al., 2023b)。视频-语言模型表现出内在和外在幻觉(Wang et al., 2024b; Huang et al., 2026),而音频-视频-语言模型可能忽略音频内容,主要基于视觉证据描述音频(Nishimura et al., 2024)。在生成任务中,文本到图像模型常无法对齐组合式提示(Bakr et al., 2023; Huang et al., 2025a),而文本到视频模型缺乏时间连贯性(Chu et al., 2024b; Rawte et al., 2025)。尽管模态特定的研究范围广泛,但大多数先前研究独立地研究每种模态和任务类型,限制了对跨模态规律性的洞察。

#### 幻觉检测与评估。

检测方法已从简单的自洽性检查(Manakul et al., 2023; Miao et al., 2024)演进到结构化的多步骤流程。UNIHD(Chen et al., 2024a)为图像-文本任务引入了声明分解和验证,而FactVC(Liu and Wan, 2023)为视频描述提出了事实性指标。CrossCheckGPT(Sun et al., 2024)通过无参考的跨系统一致性对文本、图像和视听领域的系统进行排名,video-SALMONN 2(Tang et al., 2025)使用偏好优化来减少视听描述中的错误。这些方法针对系统排名、声明级评估或幻觉缓解,而如POPE(Li et al., 2023b)、AMBER(Wang et al., 2024a)和MHaluBench(Chen et al., 2024a)等基准测试仍局限于单一模态或模态对。我们的工作研究跨六种双向任务的声明级检测;表1总结了相应的基准覆盖范围。

#### 工具增强与多智能体LLM系统。

Toolformer(Schick et al., 2023)训练语言模型决定调用哪些外部工具以及如何整合其输出。Grounding DINO(Ren et al., 2024)实现了零样本对象验证,DoraemonGPT(Yang et al., 2024)将视频理解重构为工具调用。我们的框架将此范式扩展到跨模态的幻觉检测,并采用基于推理的统一聚合。

## 3 任务定义与幻觉分类

#### 统一定义。

设\\(\mathcal{T}, \mathcal{I}, \mathcal{V}, \mathcal{A}\\) 分别表示文本、图像、视频和音频数据。MLLM将输入映射为输出\\(\mathbf{x} \in \{\mathcal{T}, \mathcal{I}, \mathcal{V}, \mathcal{A}\} \to \hat{y} \in \{\mathcal{T}, \mathcal{I}, \mathcal{V}, \mathcal{A}\}\\)。我们关注*理解*任务(\\(\mathbf{x} \in \{\mathcal{I}, \mathcal{V}, \mathcal{A}\} \to \hat{y} \in \mathcal{T}\\))和*生成*任务(\\(\mathbf{x} \in \mathcal{T} \to \hat{y} \in \{\mathcal{I}, \mathcal{V}, \mathcal{A}\}\\))。理解幻觉存在于生成的文本中,而生成幻觉则表现为生成的媒体与提示之间的语义差异。

#### 定义。

如果输出\\(\hat{y}\\)包含任何不受输入\\(\mathbf{x}\\)支持或与之矛盾的语义声明,则称其为幻觉。形式上,设\\(\mathcal{G}\\)表示从\\(\mathbf{x}\\)可推导的真值语义元素集合:
\[
\operatorname{Hallucinate}(\hat{y} \mid \mathbf{x}) = \begin{cases} 1 & \text{if } \exists\; \phi(\hat{y}) \notin \mathcal{G} \\ 0 & \text{otherwise}, \end{cases}
\]
其中\\(\phi(\hat{y})\\)表示可从\\(\hat{y}\\)提取的任意语义声明。

#### 幻觉分类。

我们定义四种适用于所有模态的类型:(1) 对象:引入不存在的实体;(2) 属性:错误描述颜色、大小或音高等属性;(3) 关系:错误陈述空间、时间或因果关系;(4) 事件:错误描述事件级别细节,包括时序错误或虚构的动作。每种类型均体现在所有六种任务中,支持直接的跨模态比较(§6)。

## 4 OmniHallu-Bench

图2:OmniHallu-Bench统计数据:模态、任务和幻觉类型分布。#### 设计原则。

OmniHallu-Bench包含10,000个样本,按模态和任务分层覆盖。理解任务占60%,生成任务占40%。图像、视频和音频样本比例为5:3:2。幻觉类型分布为:对象(35%)、属性(25%)、事件(25%)和关系(15%)。

#### 理解任务。

对于I2T,我们从COCO Captions、Nocaps和Flickr30k中抽取数据,模型输出由InternVL2.5-78B、Qwen2.5-VL-72B、GPT-4.1和Gemini-2.5-Pro生成。对于V2T,我们从MSVD、MSRVTT和VATEX中采样,使用InternVL2.5-78B、Qwen2.5-VL-72B、VideoLLaMA3和LLaVA-OneVision。对于A2T,我们使用AudioCaps、ClothoV2和AudioSetCaps,输出来自Qwen2-Audio-7B-Instruct、GAMA、Pengi和SALMONN。

#### 生成任务。

对于T2I,使用T2I-CompBench++和HRS-Bench的提示,通过DALL-E 3、Stable Diffusion 3.5 Large和Midjourney v6生成图像。对于T2V,T2V-CompBench和FETV的提示驱动Open-Sora 1.2和CogVideoX-5B生成视频。对于T2A,WavText5K、FSD50K和SoundDescs的提示通过Make-an-Audio、AudioGPT和AudioLCM生成音频。每个任务使用多个生成器以减少对模型特定伪影的依赖。

#### 标注与质量控制。

样本通过基于思维链提示的结构化原子声明分解进行处理,并带有自反思维验证。三名训练有素的标注员独立审核每个样本;仅当完全达成共识时才保留样本。标注员首先验证分解的声明的语义保真度,然后将每个声明分类为幻觉或非幻觉。由于分歧,约24.3%的初始样本被移除。在共识过滤前,Fleiss’ κ值为0.89(图像)、0.86(视频)和0.83(音频)。最终数据集包含4,000个人工整理和6,000个模型生成(经过人工审核)的样本。

#### 数据集统计。

每个样本的平均原子声明数为:4.2(I2T)、3.8(T2I)、5.6(V2T)、4.1(T2V)、3.5(A2T)和3.1(T2A)。总体幻觉率为42.8%,而生成任务为48.1%,理解任务为39.2%。

## 5 多智能体幻觉检测

我们的框架包括三个阶段:原子声明分解、模态感知的专家验证和基于推理的聚合(图3)。

参考标题 图3:OmniHallu多智能体框架概览。模型输出被分解为原子声明,由模态特定的专家进行验证,并通过基于推理的决策进行聚合。#### 原子声明分解(ACD)。

我们将目标文本(

相似文章

多模态大语言模型的统一幻觉模糊测试

arXiv cs.CL

本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。

Hallo4D: 多模态幻觉缓解实现一致时空生成

Hugging Face Daily Papers

Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。

HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉

arXiv cs.CL

北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。