缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
摘要
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。
arXiv:2606.09859v1 公告类型:新论文
摘要:多模态大语言模型(MLLM)经常产生与视觉输入不一致的幻觉对象。这一问题通常归因于过度依赖语言先验,语言先验可能覆盖视觉上下文。近期一些无需训练的解码策略通过惩罚语言先验来解决这一问题。然而,这些方法忽略了语言先验的双重性质——根据与视觉证据的对齐程度,语言先验既可能有益也可能有害。具体而言,盲目压制语言先验往往会破坏模型的语义流形,导致性能下降,我们将这一现象称为“流形偏离”。为解决这一问题,我们提出了流形引导自适应投影(MGAP),一种几何感知、无需训练的解码方法,能够在抑制幻觉的同时保持表征结构。MGAP首先通过SVD从盲隐状态构建语言先验子空间。在解码过程中,MGAP将每个多模态隐状态投影到该子空间上,并应用一致性感知门控来自适应地仅衰减投影后的先验成分,从而实现子空间选择性更新,基本保留正交的语义成分。在POPE和CHAIR上的大量实验表明,MGAP优于先前的解码基线方法,在保持连贯性的同时实现了更强的幻觉抑制效果。
查看缓存全文
缓存时间: 2026/06/10 06:13
# 不确定性感知子空间修正:可信的多模态大语言模型解码
来源: https://arxiv.org/html/2606.09859
## 缓解流形偏离:用于可信 MLLM 解码的不确定性感知子空间修正
Jingxiao Yang, Miao Pan, Cheng Tan, Yuxiang Cai, Siwei Tan, Chen Zhi, Xuhong Zhang, Jianwei Yin, Jintao Chen
###### 摘要
MLLM 经常产生与视觉输入不一致的物体幻觉。这个问题通常归因于对语言先验的过度依赖,这可能会覆盖视觉上下文。最近的免训练解码策略通过惩罚语言先验来解决这个问题。然而,这些方法忽略了语言先验的双重性质——根据与视觉证据的对齐情况,语言先验既可能有益也可能有害。特别是,盲目抑制语言先验往往会破坏模型的语义流形,导致性能下降,我们将这种现象称为“流形偏离”。为了解决这个问题,我们提出了 **流形引导自适应投影(MGAP)**,这是一种几何感知、免训练的解码方法,可以在保持表示结构的同时减轻幻觉。MGAP 首先通过 SVD 从盲隐藏状态构建一个语言先验子空间。在解码过程中,MGAP 将每个多模态隐藏状态投影到这个子空间上,并应用一个一致性感知的门控来自适应地仅衰减投影的先验分量,从而产生一个子空间选择性更新,在很大程度上保留正交的语义分量。在 POPE 和 CHAIR 上的大量实验表明,MGAP 优于先前的解码基线,在实现更强幻觉抑制的同时,不牺牲连贯性。
多模态大语言模型,机器学习,ICML,幻觉,MLLM,流形学习
## 1 引言

图 1:MLLM 解码中语言先验的双重作用。当视觉证据与先验对齐时(黄色香蕉),先验会锐化并稳定生成过程。当它们冲突时(蓝色香蕉),先验可能会覆盖图像并引发幻觉。
近年来,多模态大语言模型(MLLMs)(Wang et al., 2024b; Chen et al., 2024b; Deitke et al., 2024) 已成为视觉和语言的强大通用接口,能够在各种基准测试上进行多模态推理和生成 (Yue et al., 2024; Liu et al., 2024b; Hu et al., 2025)。尽管取得了这些进展,它们仍然容易产生物体幻觉 (Li et al., 2023b; Bai et al., 2024; Rohrbach et al., 2018):模型生成流畅、看似合理但图像不支持的内容。这种失败通常归因于模型在预训练期间学到的语言先验,这些先验可能会压倒微弱或模糊的视觉证据 (Leng et al., 2024; Huang et al., 2024; Li et al., 2023a; Tong et al., 2024)。受此启发,越来越多的免训练解码方法 (Leng et al., 2024; Favero et al., 2024; Chen et al., 2024a; Wang et al., 2024c; Park et al., 2025) 试图通过从解码 logits 中减去一个偏差项(例如,无条件分支或对比上下文)来减轻幻觉。然而,核心困难在于语言先验并非总是有害的。如图 1 所示,先验起着双重作用:它们在视觉-语言冲突下可能触发幻觉(蓝色香蕉),但在与图像对齐时(黄色香蕉)可以作为信心锚点,锐化并稳定生成过程。这使得不加区分的先验抑制成为一种钝器:它可能会恰好移除那些在正常、视觉一致的情况下有帮助的结构。我们进一步表明,这种非预期的退化具有几何特征。在表示空间中,有效的解码轨迹集中在结构化的高密度区域 (Bengio et al., 2013a; Verma et al., 2019; Stutz et al., 2019; Khoury and Hadfield-Menell, 2018)。线性抑制方法应用全局的、与结构无关的偏移,这可能会将隐藏状态推向低密度区域并破坏解码稳定性。我们将这种故障模式称为 **流形偏离**,并在第 3.3 节(图 3)中进行分析。
为了解决这一矛盾,我们提出了 **流形引导自适应投影(MGAP)**,这是一个几何感知、免训练的解码框架。MGAP 明确地将语言先验建模为通过 SVD 从盲隐藏状态估计的低秩先验子空间,并在解码过程中执行选择性干预:每个隐藏状态被投影到先验子空间上,并且仅当检测到视觉-语言冲突时,才自适应地衰减这个投影分量。总之,我们的主要贡献是:
- • 我们确定了流形偏离是线性、免训练先验抑制的一种几何故障模式,解释了即使先验与视觉对齐时,此类方法也可能降低性能的原因。
- • 我们提出了 MGAP,它从盲状态学习一个语言先验子空间,并应用 **自适应、子空间选择性投影** 来抑制幻觉,而不会干扰正交的语义。
- • 在 POPE (Li et al., 2023b) 和 CHAIR (Rohrbach et al., 2018) 上的实验表明,与先前的免训练解码基线相比,MGAP 在幻觉缓解和描述保真度之间实现了更强的权衡。
## 2 相关工作
#### MLLM 中的幻觉
物体幻觉是视觉-语言生成中长期存在的问题,并在现代 MLLM 中被放大。综述总结了其现象和分类法 (Bai et al., 2024),而基准/协议量化了物体级的无根据内容 (Li et al., 2023b, c)。类似的失败也在其他生成设置中进行了研究,例如神经机器翻译 (Guerreiro et al., 2023)。训练时的缓解方法(例如,鲁棒指令微调、事实对齐、偏好优化)可以减少幻觉,但需要额外的监督或优化 (Liu et al., 2024a; Sun et al., 2023; Zhao et al., 2023; Jiang et al., 2024)。我们转而研究免训练的解码时控制。
#### 推理时干预
解码时方法无需参数更新即可减轻幻觉。VCD 通过将多模态解码与一个有偏/无条件分支进行对比来抑制语言先验 (Leng et al., 2024)。这个想法与文本生成中的对比解码密切相关 (Li et al., 2023a),并在后续的 VCD 风格分析中得到了进一步探索 (Lee et al., 2024)。OPERA 通过惩罚和回溯注意力分配来调节过度信任 (Huang et al., 2024)。其他方法包括指令对比解码 (Wang et al., 2024c)、自适应焦点对比解码 (Chen et al., 2024a) 以及内省/集成解码 (Huo et al., 2025; Cho et al., 2025; Park et al., 2025)。许多方法可以被视为表示/logit 空间中的全局、与结构无关的线性操作,即使先验与视觉对齐也可能损害输出。我们的方法则建模一个先验子空间,并以几何感知的方式进行选择性干预。我们还将 MGAP 与最近的解码时方法(包括 DeCo (Wang et al., 2024a) 和 MoD (Su et al., 2025))进行了比较。MGAP 在两个主干网上始终在幻觉缓解和生成保真度之间取得了最佳的整体权衡。
#### 潜在表示的流形结构
表示几何被广泛用于通过低维结构、主导子空间以及由训练分布诱导的、靠近数据流形的集中性来解释和控制模型行为。遵循表示学习中常见的流形假设,高维观测通常被认为位于或靠近一个光滑的低维流形 (Roweis and Saul, 2000; Tenenbaum et al., 2000; Bengio et al., 2013b)。在视觉中,大规模预训练下的 Transformer 表示表现出强烈的几何规律性 (Dosovitskiy et al., 2020; He et al., 2022; Beyer et al., 2023)。相关工作使用 SVCCA/CKA 类型的诊断方法来测量跨层/模型对齐 (Raghu et al., 2017; Kornblith et al., 2019; Morcos et al., 2018; Li et al., 2018)。语言生成中的解码时行为也与表示级别的目标和对比方向相关联 (Li et al., 2023a)。基于此观点,我们对 MLLM 隐藏状态采用相同的几何视角:我们从盲隐藏状态估计一个低秩语言先验子空间,并应用有界的选择性投影来减轻幻觉,同时保持靠近数据流形。
## 3 预备知识
在本节中,我们介绍多模态解码的符号,并总结统一形式下的免训练线性抑制。然后,我们阐明激发几何感知解码干预的流形观点。
### 3.1 免训练解码的表示级视角
给定一张图片 $v$ 和一个文本查询 $x$,多模态大语言模型自回归地生成 token。在解码步骤 $t$ 处,下一个 token 的分布由 $P(y_t \mid y_{<t}, v, x)$ 给出,其中 $y_{<t}$ 是已生成的序列。免训练解码方法通过修改 logits $\mathbf{l}_t$ 或隐藏状态 $\mathbf{h}_t$ 来干预这个分布,无需参数更新。许多方法,包括视觉对比解码(VCD),可以统一表述为:
$$
\tilde{\mathbf{h}}_t = \mathbf{h}_t - \alpha_t \mathbf{b}_t
$$
其中 $\tilde{\mathbf{h}}_t$ 是校正后的隐藏状态,$\mathbf{b}_t$ 是一个偏差项(例如,VCD 中的无条件分支),$\alpha_t$ 是一个标量或门控强度。虽然这些方法在目标和对齐机制上有所不同,但它们共享一个共性:它们应用线性操作,这些操作与表示几何无关,并对所有隐藏状态维度或方向应用统一的偏移。
### 3.2 语义流形与流形偏离
为了避免盲目的线性抑制,我们通过分析隐藏状态的几何结构来理解解码。假设隐藏状态在输入-输出任务中来自“正常”解码的轨迹,主要位于一个低维的结构化区域,我们称之为**语义流形** $\mathcal{M}$。
**定义 3.1(语义流形)**。令 $\mathcal{X} \times \mathcal{Y}$ 为输入-输出空间,令 $P_0$ 为正常解码的隐藏状态分布,由模型在无干预的分布内生成。存在一个称为**语义流形**的 $\varepsilon$-可测子集 $\mathcal{M} \subset \mathbb{R}^d$,以及小参数 $\varepsilon > 0$ 和 $\delta \in (0,1)$,使得:
$$
\Pr_{h \sim P_0} [\, \operatorname{dist}(h, \mathcal{M}) \leq \varepsilon \,] \geq 1-\delta.
$$
这里 $\Pr_{h \sim P_0}[\cdot]$ 表示当 $h$ 从 $P_0$ 采样时的概率。式 (3) 意味着至少 $(1-\delta)$ 的正常解码状态位于 $\mathcal{M}$ 的 $\varepsilon$-邻域(一个“$\varepsilon$-管道”)内。我们定义到流形的欧氏距离为:
$$
\operatorname{dist}(h, \mathcal{M}) \triangleq \inf_{m \in \mathcal{M}} \|h - m\|_2.
$$
我们将 $\mathcal{M}$ 称为正常解码的**语义流形**。
#### 一个可计算的代理
由于 $\mathcal{M}$ 和 $\operatorname{dist}(h, \mathcal{M})$ 不能直接计算,我们使用从正常解码收集的隐藏状态参考库 $\mathcal{S} = \{h^{(i)}\}_{i=1}^N$(图3中的灰点)来近似它们。对于任意查询状态 $h \in \mathbb{R}^d$,令 $\operatorname{NN}_k(h; \mathcal{S}) \subset \mathcal{S}$ 表示其在 $\mathcal{S}$ 中在选定度量(默认:欧氏距离)下的 $k$ 个最近邻居的集合。我们通过平均 $k$NN 距离定义一个离流形分数:
$$
d_k(h; \mathcal{S}) \triangleq \frac{1}{k} \sum_{s \in \operatorname{NN}_k(h; \mathcal{S})} \|h - s\|_2.
$$
(在高维中,也可以选择在 $\ell_2$ 归一化后使用余弦距离。)
**定义 3.2(流形偏离)**。考虑在步骤 $t$ 处应用一个将 $h_t$ 映射到 $\tilde{h}_t = T(h_t)$ 的干预 $T$。如果对于阈值 $\tau$(其中 $\tau$ 设置为参考分数 $\{d_k(s; \mathcal{S})\}_{s \in \mathcal{S}}$ 的 $(1-\delta)$ 分位数,即在此标准下,只有 $\delta$ 比例的正常解码状态会被标记为离流形),有:
$$
d_k(\tilde{h}_t; \mathcal{S}) > \tau,
$$
则称 $T$ 在步骤 $t$ 处诱导了**流形偏离**。
### 3.3 先验抑制导致的流形偏离
我们确定了在许多免训练线性解码干预背后存在一致的 **故障机制**:对语言先验分量的 **不加区分** 的抑制可能将隐藏状态推离正常解码的语义流形(定义3.1),从而在语言先验在语义上有帮助时也会降低生成质量。
#### 经验观察

图 2:统一的线性先验抑制可能有害。VCD(与普通解码相比)在 POPE 的所有划分上均表现出一致的性能下降,包括先验与视觉证据对齐的标准情况。
我们使用 LLaVA v1.5-7B 在 POPE 基准上比较了普通解码和视觉对比解码(VCD)(Leng et al., 2024)。如图 2 所示,VCD 在所有评估划分上均一致地降低了性能。值得注意的是,这种下降也发生在视觉证据和语言先验自然对齐的标准情况下,这表明无论上下文如何都应用相同的线性抑制存在系统性局限。
#### 几何机制
为了理解这种退化发生的原因,我们通过第 3.2 节定义的语义流形视角来分析隐藏表示。我们关注最后一层隐藏状态 $h_t \in \mathbb{R}^D$ 及其在解码时干预下的演变。我们提取 COCO 数据集上正常解码轨迹的隐藏状态,并使用主成分分析(PCA)可视化其分布。如图 3 所示,对应有效生成的隐藏状态集中在表示空间中一个结构化的低维区域内,我们将其解释为正常解码的语义流形(定义3.1)。沿 VCD 方向的线性外推...相似文章
DEEPO: 针对多模态大语言模型幻觉的双熵增强策略优化
本文提出DEEPO,一种双阶段强化学习优化方法,通过解决从奖励到参数更新的纠正链中的弱点,以减少多模态大语言模型中的幻觉。
使用分流解码的大语言模型幻觉检测
本文提出分流解码(diversion decoding)方法,通过在解码阶段主动挑战模型响应来提取特征,训练不确定性启发式模型,从而检测大语言模型中的幻觉,实现了更优的性能和更低的计算复杂度。
MLLMs 在信息分布偏离协同头时产生幻觉
本文提出了HEAL,一种通过因果干预和反事实分析来分析和校准协同头中信息分布的方法,以减轻多模态大型语言模型中的幻觉。
更深并不总是更好:通过置信层解码缓解对齐损失
本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。
拆解病态捷径:用于忠实LVLM解码的因果框架
本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。