注意力引导的大语言模型对比解码层选择策略
摘要
提出了三种注意力引导的大语言模型对比解码层选择策略,在TruthfulQA上相比DoLa基线提高了事实准确性。
arXiv:2607.23067v1 公告类型:新论文
摘要:对比解码方法(如DoLa)通过对比成熟层与未成熟层的输出分布来提高大语言模型(LLM)的事实准确性。然而,DoLa的动态层选择仅依赖于输出词汇分布的差异。本文提出了三种注意力引导策略:Attention-JSD、Attention-Entropy-Max和Attention-Entropy-Min,这些策略利用内部自注意力机制携带的结构信息作为层选择的信号。在TruthfulQA上的实验结果表明,我们的策略(特别是Attention-JSD和Attention-Entropy-Min)持续优于原始DoLa。我们观察到在多答案指标(MC2和MC3)上有显著提升,这表明注意力分布比输出词汇分布能提供更敏感的信号来解析事实知识。
查看缓存全文
缓存时间: 2026/07/28 06:27
# 面向大型语言模型对比解码的注意力引导层选择
来源: https://arxiv.org/html/2607.23067
Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai 日本高级科学技术研究所 \{yusuke\.sakai,natt,kshirai\}@jaist\.ac\.jp
###### 摘要
DoLa 等对比解码方法通过对比成熟层和未成熟层的输出分布来提高大型语言模型 (LLM) 的事实正确性。然而,DoLa 的动态层选择仅依赖于输出词汇分布的差异。在这项工作中,我们提出了三种注意力引导策略——Attention-JSD、Attention-Entropy-Max 和 Attention-Entropy-Min——利用内部自注意力机制携带的结构化信息作为层选择的信号。在 TruthfulQA 上的实验结果表明,我们的策略,特别是 Attention-JSD 和 Attention-Entropy-Min,持续优于原始 DoLa。我们观察到在多答案指标(MC2 和 MC3)上取得了显著提升,表明注意力分布比输出词汇分布能提供更敏感的、用于解决事实知识的信号。
面向大型语言模型对比解码的注意力引导层选择
Yusuke Sakai, Natthawut Kertkeidkachorn, Kiyoaki Shirai
日本高级科学技术研究所
\{yusuke\.sakai,natt,kshirai\}@jaist\.ac\.jp
## 1 引言
大型语言模型 (LLM) 在广泛的自然语言处理任务中取得了强劲的表现,但它们仍然容易出现幻觉,即生成看似合理但事实错误的内容 (Huang et al., 2025 (https://arxiv.org/html/2607.23067#bib.bib6))。这个问题在开放域问答和长文本生成等任务中尤其突出,因为生成训练数据中不存在的、无根据的主张对实际部署构成了主要障碍。
一种缓解此问题的推理时方法是对比解码 (Li et al., 2023b (https://arxiv.org/html/2607.23067#bib.bib12))。对比解码是一种框架,不单独依赖单个模型的输出分布;相反,它对比多个分布以相对抑制不良的生成倾向,并偏好更理想的候选。例如,Li 等人 (Li et al., 2023b (https://arxiv.org/html/2607.23067#bib.bib12)) 定义了一个基于大型模型(专家)和小型模型(业余者)的对数概率差的目标,并引入了一个基于专家模型置信度的合理性约束,旨在减少开放生成中的退化现象,如重复和主题漂移,同时保持流畅性和连贯性。
DoLa(通过对比层进行解码)(Chuang et al., 2024b (https://arxiv.org/html/2607.23067#bib.bib2)) 将这种对比思想扩展到单个模型内部,通过对比最终(成熟)层和早期(未成熟)层的 logits 来改进事实正确性,而无需额外训练。给定一组候选未成熟层,DoLa 在每个 token 处动态选择与最终层杰森-香农散度 (JSD) 最大的层,并在诸如 TruthfulQA (Lin et al., 2022 (https://arxiv.org/html/2607.23067#bib.bib13)) 和 FACTOR (Muhlgay et al., 2024 (https://arxiv.org/html/2607.23067#bib.bib17)) 等基准测试上展示了有效性。此外,DoLa 是自包含在单个模型内的,既不需要辅助模型也不需要外部信号,这使其成为一种实用的、用于推理时采用的即插即用方法。然而,DoLa 的层选择是由输出分布 (logits) 的差异驱动的,并没有直接利用模型内部注意力机制携带的信息作为选择信号。
Transformer 提供超出输出分布的多样化内部信号,包括自注意力机制和中间表示。最近的工作探索了利用此类信号,例如,使用隐藏状态的跨层熵变 (Wu et al., 2025 (https://arxiv.org/html/2607.23067#bib.bib23)),基于上下文自适应调整检索增强生成中的对比强度 (Kim et al., 2024 (https://arxiv.org/html/2607.23067#bib.bib9); Shi et al., 2024 (https://arxiv.org/html/2607.23067#bib.bib19)),以及从注意力模式检测幻觉 (Chuang et al., 2024a (https://arxiv.org/html/2607.23067#bib.bib1))。尽管如此,对比解码方法仍然经常依赖于从 logits 或隐藏状态导出的标量统计量,而系统性地尝试使用注意力分布中的结构化信息作为 token 级层选择信号仍然有限。
在本研究中,我们假设注意力机制可以作为识别事实知识出现层的信号。具体来说,在保持 DoLa 框架不变的情况下,我们引入了三种基于内部注意力分布选择未成熟层的策略。
我们的贡献如下:
- • 我们提出了三种注意力引导策略——Attention-JSD、Attention-Entropy-Max 和 Attention-Entropy-Min——利用从自注意力机制导出的结构化信息作为层选择的动态信号,超越了传统对输出词汇分布的依赖。
- • TruthfulQA 评估表明,我们提出的方法(尤其是 Attention-JSD 和 Attention-Entropy-Min)优于现有方法,特别是在多个正确答案指标 (MC2/MC3) 上取得了显著提升。此外,在 FACTOR 上,我们的方法在许多设置下改进了基线,并取得了与 DoLa 相当,在某些情况下甚至更好的性能。
- • 通过对层选择模式和头部分析的可视化,我们识别出特定的注意力头携带有利于事实正确性辨别的独特信号,从而揭示了对比解码设计中进一步优化的潜在途径。
## 2 相关工作
##### 大型语言模型中的幻觉。
LLM 幻觉可以大致分为事实性幻觉(生成与可验证事实相矛盾的内容)和忠实度幻觉(偏离给定上下文或指令)。这两种形式在广泛的应用中都构成了严峻挑战,包括对话系统、检索增强生成 (RAG) 和智能体 (Ji et al., 2023 (https://arxiv.org/html/2607.23067#bib.bib8); Huang et al., 2025 (https://arxiv.org/html/2607.23067#bib.bib6))。为了缓解这个问题,研究人员提出了各种方法,例如基于人类反馈的强化学习 (RLHF) (Ouyang et al., 2022 (https://arxiv.org/html/2607.23067#bib.bib18))、推理时自一致性检查 (Wang et al., 2023 (https://arxiv.org/html/2607.23067#bib.bib22); Manakul et al., 2023 (https://arxiv.org/html/2607.23067#bib.bib14)) 和多智能体辩论 (Du et al., 2024 (https://arxiv.org/html/2607.23067#bib.bib4))。这些方法通常需要额外训练、访问外部知识 (Lewis et al., 2020 (https://arxiv.org/html/2607.23067#bib.bib10)) 或进行多次推理。相比之下,本研究专注于不修改现有模型参数且能通过单次前向计算实现的方法。
##### Transformer 中的逐层知识。
许多分析研究表明,基于 Transformer 的模型跨层层次化地编码信息 (Tenney et al., 2019 (https://arxiv.org/html/2607.23067#bib.bib20); Jawahar et al., 2019 (https://arxiv.org/html/2607.23067#bib.bib7))。例如,在 BERT 中,较低层倾向于捕获表面级特征和局部句法信息,而语义和上下文信息在从中层到高层时变得越来越显著 (Jawahar et al., 2019 (https://arxiv.org/html/2607.23067#bib.bib7))。还观察到,对应不同语言理解阶段的信息沿网络深度逐渐出现 (Tenney et al., 2019 (https://arxiv.org/html/2607.23067#bib.bib20))。基于这些观察,先前的工作提出了识别哪些内部计算介导事实关联的方法,并通过编辑这些局部计算来更新知识 (Meng et al., 2022 (https://arxiv.org/html/2607.23067#bib.bib15), 2023 (https://arxiv.org/html/2607.23067#bib.bib16))。此外,作为直接干预层和注意力机制中出现的内部表示以引发所需属性的推理时尝试,推理时干预 (ITI) 被提出,它通过操纵特定注意力头的激活来提高真实性 (Li et al., 2023a (https://arxiv.org/html/2607.23067#bib.bib11))。
##### 对比解码。
对比解码 (CD) (Li et al., 2023b (https://arxiv.org/html/2607.23067#bib.bib12)) 是一种解码方法,使用专家和业余者之间的对数概率差作为对比目标,同时利用基于专家置信度的合理性约束来限制候选集 V_head V_{\text{head}}; DoLa (Chuang et al., 2024b (https://arxiv.org/html/2607.23067#bib.bib2)) 将这种对比思想扩展到单个模型内的层间对比,通过对比最终(成熟)层和一个浅层(未成熟)层的分布,并在每个 token 处动态选择与最终层杰森-香农散度 (JSD) 最大的未成熟层。相关工作包括 END (Wu et al., 2025 (https://arxiv.org/html/2607.23067#bib.bib23)),它根据候选 token 预测概率的逐层变化计算 token 级跨层熵,并相应地对最终预测分布进行重新加权;以及 ACD (Kim et al., 2024 (https://arxiv.org/html/2607.23067#bib.bib9)),它在 RAG 中基于检索上下文降低不确定性(熵)的程度等因素自适应调整对比强度。相比之下,直接利用注意力分布的结构化模式作为动态信号的设计仍然有限。
##### 基于注意力的分析。
注意力机制在更新每个位置的表示时为参考 token 分配权重,并已被用作观察逐层和逐头行为的线索。先前的工作报告称,某些注意力头捕获句法依赖和共指关系 (Clark et al., 2019 (https://arxiv.org/html/2607.23067#bib.bib3); Voita et al., 2019 (https://arxiv.org/html/2607.23067#bib.bib21))。也有研究表明,一些头参与了事实知识回忆和属性提取 (Geva et al., 2023 (https://arxiv.org/html/2607.23067#bib.bib5)),并且注意力模式可用于在生成过程中检测幻觉 (Chuang et al., 2024a (https://arxiv.org/html/2607.23067#bib.bib1))。这些发现表明注意力分布可能作为层选择的信号。然而,据我们所知,直接使用注意力分布(或其摘要)进行动态解码中 token 级层选择的尝试尚未被研究。从 DoLa 框架出发,本研究的特点是系统评估基于注意力分布及其熵的层选择策略。
## 3 方法
在本节中,我们首先回顾 DoLa 的背景,然后介绍我们基于注意力的层选择策略。最后,我们描述头部级分析的设置。
### 3.1 背景:通过对比层进行解码
给定一个前缀 token 序列 x_{<t},基于 Transformer 的 LLM 从每一层 l 的输出诱导出一个下一个 token 的条件分布 q_l(x_t | x_{<t})。
DoLa (Chuang et al., 2024b (https://arxiv.org/html/2607.23067#bib.bib2)) 是一种推理时解码方法,通过在同一模型内对比一个浅层未成熟层和一个深层成熟层(最终层 L),在不进行额外训练的情况下提高事实正确性。它使用基于最终层分布和 token 级选择的未成熟层分布之比的分数 F(q_L(x_t), q_{l^*}(x_t)) 来定义 \hat{P}(x_t | x_{<t})。
\hat{P}(x_t | x_{<t}) = \mathrm{softmax}\!\big(F(q_L(x_t), q_{l^*}(x_t))\big). \tag{1}
F(q_L(x_t), q_{l^*}(x_t)) = \begin{cases} \log\frac{q_L(x_t)}{q_{l^*}(x_t)} & \text{for } x_t \in V_{\text{head}}(x_{<t}), \\ -\infty & \text{otherwise}. \end{cases} \tag{2}
为了确保在最终层下的合理性,候选被限制在 token 集 V_{\text{head}}(x_{<t}) 内。这里,V_{\text{head}}(x_{<t}) 定义如下,其中 w 遍历词汇表 \mathcal{V}:
V_{\text{head}}(x_{<t}) = \left\{ x_t : q_L(x_t) \geq \alpha \max_{w \in \mathcal{V}} q_L(w) \right\}. \tag{3}
然后,通过最大化候选集 \mathcal{C} 中与最终层的杰森-香农散度 (JSD),在每个 token 处动态选择未成熟层。这里,\mathcal{C} 表示用于对比的候选未成熟层集合;在 DoLa 中,层被划分为若干个桶(连续范围),通过验证选择一个桶,所选桶内的层(包括为了效率仅考虑偶数层的设置)构成 \mathcal{C}。
l^* = \operatorname*{arg\,max}_{l \in \mathcal{C}} \operatorname{JSD}\left(q_L(\cdot \mid x_{<t}), q_l(\cdot \mid x_{<t})\right). \tag{4}
### 3.2 注意力引导的层选择
DoLa 基于 token (词汇) 分布的差异选择未成熟层,但这个标准没有直接捕捉到底层的参考结构(即模型在预测时关注哪里)。为了解决这个限制,我们使用注意力分布作为层选择信号,它反映了模型关注程度的逐层差异,并在保留 DoLa 框架的同时引入了三种注意力引导的层选择策略。
令 A^l \in \mathbb{R}^{H \times T \times T} 表示层 l 的自注意力张量,其中 A^l_{h,t,i} 是头 h 在查询位置 t 处分配给位置 i(一个过去的 token)的注意力权重。对于查询位置 t,我们将在过去 token 1:t 上的头平均注意力行定义为 a^l_t \in \mathbb{R}^t:
a^l_t(i) = \frac{1}{H} \sum_{h=1}^{H} A^l_{h,t,i}, \quad i \in \{1, \ldots, t\}, \tag{5}
a^l_t(i) \geq 0, \qquad \sum_{i=1}^{t} a^l_t(i) = 1.
#### 3.2.1 Attention-JSD
由于注意力分布可以反映每个层在做出预测时关注哪里,注意力模式与最终层显著不同的层可能对应计算的不同阶段。在此假设下,Attention-JSD 选择其注意力分布与最终层差异最大的层:
l^*_{\mathrm{attn\text{-}jsd}} = \operatorname*{arg\,max}_{l \in \mathcal{C}} \operatorname{JSD}\left( a^L_t, a^l_t \right).相似文章
GQLA: 面向硬件自适应大语言模型解码的分组查询潜在注意力
GQLA 提出了对多头潜在注意力(MLA)的极小修改,在相同训练权重上同时暴露 MQA 吸收路径和 GQA 路径,从而无需重新训练即可实现硬件自适应解码。该方法压缩 KV 缓存并支持张量并行性,通过将 LLaMA-3-8B 从 GQA 转换为 GQLA 得到验证。
更深并不总是更好:通过置信层解码缓解对齐损失
本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。
无需训练的滑动窗口适配中NLL引导的全注意力层选择
提出了一种无需训练的NLL引导方法,用于在混合注意力模型中选择保留全注意力的层,在长上下文任务中,使用1/4全注意力层即可达到与1/2周期性基线相当的准确率。
面向大型语言模型的可部署逐实例多层激活引导
本文介绍了一种可部署的逐实例多层激活引导技术,用于大型语言模型,表明最优层选择随输入变化,并且可以在推理时仅从提示嵌入中预测,而不需要金标准标签。
层级、汇聚与缩放:多模态大语言模型的自适应证据选择
本文提出AREA,一种无需训练的推理时方法,自适应分配多模态大语言模型中的证据高亮,提升在基于知识的视觉问答和标准多模态基准测试上的性能。