当注意力关闭:LLMs如何在多轮交互中迷失线索

arXiv cs.AI 论文

摘要

本文从机制上解释了为什么LLMs在长时间的多轮交互中会丢失指令,引入了目标可访问性比率(GAR)指标和通道转换框架。通过消融研究和残差流探针,论文表明,对定义目标词元的注意力会在回合间关闭,而目标信息在残差表示中持续存在,并出现了架构特定的失败模式。

arXiv:2605.12922v1 公告类型:新 摘要:大型语言模型能够在单次交互中遵循复杂指令,但在长时间的多轮交互中,它们常常会丢失指令、角色设定和规则的线索。这种退化已在行为上被测量,但尚未从机制上解释。我们提出了一种通道转换解释:定义目标的词元通过注意力变得不那么可访问,而目标相关信息可能在残差表示中持续存在。我们引入了目标可访问性比率(GAR),用于衡量从生成词元到任务定义目标词元的注意力,并将其与滑动窗口消融和残差流探针结合。当对指令的注意力关闭时,幸存下来的内容揭示了架构。跨不同架构,这种转换产生了性质上不同的失败模式:一些模型在注意力消失时仍能保持目标条件行为,其他模型尽管有可解码的残差目标信息却失败,并且这种编码出现的层从2到27不等。一个模型内的因果消融实验强制关闭了Mistral中的注意力通道,使得在20个事实的记忆任务中召回率从近乎完美下降到11%,并在没有用户压力的情况下将角色约束违反率提升至高于对抗压力基线,两种效应都在可预测的转折回合出现。线性探针从残差表示中恢复了每轮次的召回结果,在所有四种主要架构中AUC高达0.99,而输入嵌入仍处于随机水平。跨架构和模型规模,注意力损失与残差可解码性之间的差距预测了目标条件行为是否能在通道关闭后幸存。我们贡献了GAR作为诊断工具,通道转换框架作为受控的机制解释,以及窗口注意力关闭下失败时间的参数化预测。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:14

# 当注意力关闭时:大语言模型如何在多轮交互中丢失线索  
来源:https://arxiv.org/html/2605.12922  

Vardhan Dongre¹, Joseph Hsieh², Viet Dac Lai², Seunghoon Yoon², Trung Bui², Dilek Hakkani-Tür¹  

¹ ![[未标注图片]](https://arxiv.org/html/2605.12922v1/icons/illinois.png) 伊利诺伊大学厄巴纳-香槟分校  
² ![[未标注图片]](https://arxiv.org/html/2605.12922v1/icons/adobe.png) Adobe 研究院  

###### 摘要  
大语言模型能在单轮交互中可靠地遵循复杂指令,但在长时间的多轮交互中,它们起初表现良好,随后逐渐丢失指令、人设和规则线索。这种退化已在行为层面被测量,但尚未得到机制性解释。我们为这种失败提供了一种“通道转换”解释:目标定义令牌通过注意力变得难以访问,但目标相关信息可能仍存在于残差表示中。我们引入目标可访问比(GAR),用于衡量从生成令牌到任务定义目标令牌的注意力,并结合滑动窗口消融和残差流探针。当对指令的注意力关闭时,存留的内容揭示了架构特征。在我们测试的多种架构中,这种转换产生了性质不同的失败模式:某些模型在注意力趋近于零时仍能保持大量的目标条件行为,另一些模型尽管残差流中携带着可解码的目标信息却仍然失败,而这一编码涌现的深度在不同架构间差异巨大(从第2层到第27层)。在Mistral模型上进行的一项内部因果消融——强制关闭注意力通道——将20个事实保留任务的召回率从近乎完美降至11%,同时人设约束违反次数超过对抗压力基线,且无需用户施压;这两种效应均在可预测的转折轮次出现。基于残差表示的线性探针在全部四种主架构(输入嵌入:随机水平)上可恢复每轮次召回结果,AUC高达0.99,证明目标相关结果信息可线性地从残差表示中恢复,且其可恢复的深度因架构而异。在多种模型架构和模型规模下,我们发现注意力损失与残差可解码性之间的差距与目标条件行为是否能在通道关闭下存活相关。我们将GAR作为一种诊断工具,将通道转换框架作为一种受控的机制解释,并提供了在窗口化注意力关闭下失败时间的参数化预测。  

## 1 引言  

大语言模型(LLM)越来越多地部署在多轮场景中,其行为需始终与系统提示中的指令保持一致。人设、格式要求、安全策略和引用事实通常只指定一次,并期望在会话剩余部分约束模型输出。在单轮评估中,LLM能可靠地遵循这些指令。在多轮部署中,遵循度会下降。近期工作已在多种模型、任务和对话长度上记录了这种行为退化(Laban et al., 2025 (https://arxiv.org/html/2605.12922#bib.bib1); He et al., 2024 (https://arxiv.org/html/2605.12922#bib.bib2); Jia et al., 2025 (https://arxiv.org/html/2605.12922#bib.bib12)),但将长交互与这些失败联系起来的内在机制仍不明确。目前尚不清楚在遵循指令的轮次与不遵循的轮次之间,模型内部发生了什么变化。

参见标题  
图1:双通道框架。(A) 从响应令牌 \(\mathcal{R}_\tau\) 到目标令牌 \(\mathcal{G}\) 的注意力通道 \(\mathcal{C}_{\mathrm{attn}}(\tau)\) 随 \(\tau\) 衰减;响应位置的残差通道 \(\mathcal{C}_{\mathrm{res}}(\tau)\) 通过各层向前传递目标信息。(B) GAR(\(\tau\)) 在 \(\tau_{\mathrm{cross}}\) 处跨越模型特定的阈值 \(\theta_M\);对于 \(\tau \geq \tau_{\mathrm{cross}}\),对 \(\mathcal{G}\) 的直接注意力被移除,因此幸存的目标相关信息必须间接携带(例如,通过残差表示或中间上下文)。滑动窗口掩码给出了确定性几何闭合准则 \(R_{\min}(\tau) - G_{\max} \geq W\)。

在本工作中,我们将这种失败追溯到两个信息通道(图1 (https://arxiv.org/html/2605.12922#S1.F1))之间的转换,目标条件任务状态通过这两个通道在轮次间传播。在每个生成步骤中,语言模型通过注意力条件作用于先前上下文,并通过残差流累积的内部表示进行条件作用。两条通路扮演着不对称的角色。通过注意力机制可以访问系统提示中的目标指定令牌,而残差流则携带早期层在处理过程中写入隐藏状态的信息。随着对话变长,生成的令牌离上下文开头的系统提示令牌越来越远,到达它们的注意力份额也随之下降。这种下降与旋转位置编码的位置衰减性质(Su et al., 2024 (https://arxiv.org/html/2605.12922#bib.bib4))以及当相关信息远离生成位置时观察到的检索失败(Liu et al., 2024 (https://arxiv.org/html/2605.12922#bib.bib3))相一致。当到达关键目标定义令牌的注意力份额低于每个模型特定的阈值时,对原始目标令牌的直接访问丢失,后续行为依赖于间接保存在残差表示或中间上下文中的信息。目标条件行为是否能在关闭后存活,与每个架构在该表示中保留了哪些信息相关,但该信息被使用的机制(如果有的话)仍是一个开放问题。

为测量第一个通道,我们引入了目标可访问比(GAR):从生成令牌到任务目标定义令牌的注意力质量,跨层和跨头平均。GAR作为一种架构感知的诊断工具,并非意图作为模型质量的通用标量。我们将GAR与滑动窗口消融(因果关闭注意力通道)以及线性残差流探针(Alain and Bengio, 2016 (https://arxiv.org/html/2605.12922#bib.bib6); Belinkov, 2022 (https://arxiv.org/html/2605.12922#bib.bib7))相结合,后者用于测试每轮次行为结果是否可从非注意力通路中恢复。

我们的实证发现表明,在我们测试的每个架构中,GAR单调下降(Mann-Kendall 检验 \(p<10^{-7}\) 每个架构),且通道进入其闭合状态的转折轮次可从窗口大小参数化预测(线性剂量反应,\(R^2 > 0.999\))。我们发现,基于残差表示的线性探针在所有四种主架构上可恢复每轮次召回结果,AUC高达0.99,而对输入嵌入的探针仅达随机水平,这证明了残差通道的存在。这种编码变得可恢复的深度在不同架构间差异显著,范围从第2层到第27层。在四种架构(Mistral、Qwen、LLaMA、Mixtral)中,通道转换产生了性质不同的失败模式:Mistral在注意力趋近于零时仍能保持大量目标条件行为,并随目标复杂度分级缩放;LLaMA和Qwen在所有复杂度层级上一致失败;Mixtral则表现出一种相变层轮廓,目标信息仅在网络深度中部急剧上升后才变得线性可解码。

我们的发现强调,多轮LLM行为可以理解为目标条件任务状态通过两个相互作用的通道传播:对目标令牌的直接注意力和残差流。我们引入目标可访问比(GAR)作为第一个通道的诊断工具,滑动窗口消融作为因果操作,线性残差流探针作为第二个通道的测量工具;这些工具共同提供了多轮指令遵循何时失败的参数化预测。在四个开源权重架构中,我们识别出残差通道可解码性作为一种架构属性,与目标条件行为是否能在通道转换中存活共变。

## 2 方法论  

本节形式化定义双通道框架,并介绍用于测量和操作它们的工具。考虑一个仅有解码器的Transformer语言模型,有 \(L\) 层、每层 \(H\) 个注意力头、隐藏维度 \(d\),处理一个长度为 \(T\) 的令牌序列。在每一层 \(\ell \in \{0,1,\ldots,L\}\) 和令牌位置 \(t \in \{1,\ldots,T\}\),模型产生一个残差流激活 \(\mathbf{r}_t^{(\ell)} \in \mathbb{R}^d\),其中 \(\ell=0\) 表示输入嵌入。每个注意力头 \(h\) 在层 \(\ell\) 产生一个注意力矩阵 \(A^{(\ell,h)} \in \mathbb{R}^{T \times T}\),其中 \(A_{i,j}^{(\ell,h)}\) 是从查询位置 \(i\) 到键位置 \(j\) 的注意力。对话由一个初始系统提示及随后的用户-模型轮次对组成,索引为 \(\tau \in \{1,2,\ldots\}\),\(T(\tau)\) 为截至轮次 \(\tau\) 的总令牌数。

### 2.1 通道转换框架  

###### 定义 2.1(目标令牌集合和响应令牌集合)。设 \(\mathcal{G} \subset \{1,\ldots,T\}\) 为系统提示中内容指定任务的令牌位置集合。设 \(\mathcal{R}_\tau \subset \{1,\ldots,T\}\) 为模型在轮次 \(\tau\) 的响应所对应的令牌位置集合。由构造可知,\(\max(\mathcal{G}) < \min(\mathcal{R}_\tau)\)。

**定义 2.2(目标可访问比,GAR)。** 在轮次 \(\tau\),模型对目标令牌集合 \(\mathcal{G}\) 的目标可访问比为:

\[\mathrm{GAR}(\tau) = \frac{1}{L} \sum_{\ell=1}^{L} \frac{1}{H} \sum_{h=1}^{H} \frac{1}{|\mathcal{R}_\tau|} \sum_{i \in \mathcal{R}_\tau} \sum_{j \in \mathcal{G}} A_{i,j}^{(\ell,h)}.\]

因此,GAR 测量从响应令牌到目标定义令牌的平均注意力质量,对层和头取平均。我们计算所有可用生成令牌上的 GAR(即每个 \(\tau\) 产生单个标量),但消融实验仅限于首个响应令牌之前的令牌在 \(f(\tau)\) 位置,出于因果性理由(指令在响应出现之前被读取)。有关后一选择的变体讨论见附录 C。

**定义 2.3(通道转换时刻)。** 给定阈值 \(\theta_M \in (0,1)\),理想情况下在每个架构的生成分布下稳健估计(例如,通过 GAR 分布的百分位数;见的注1 B.1节 (https://arxiv.org/html/2605.12922#A3.SS1) 关于校准),通道转换时刻 \(\tau_{\mathrm{cross}}\) 为首次满足 \(\mathrm{GAR}(\tau) \le \theta_M\) 的最小轮次 \(\tau\)。在 \(\tau_{\mathrm{cross}}\) 之后,我们称注意力通道对目标令牌已闭合。

在实践中,我们通过两种方式操作闭合:允许自回归注意力自然衰减,或显式移除对超出给定上下文窗口边界的位置的访问。

### 2.2 计算 GAR  

对于每个响应位置,我们提取查询到所选键位置的注意力权重。我们跨架构保持注意力提取一致:为处理数值精度差异,我们使用底层注意力 logits 的 softmax 版本,保留有限精度下的默认实现。对于本地滑动窗口模型(Mistral、Mixtral),我们仅对窗口内位置报告非零注意力;窗口外的位置隐式接收零权重。超出位置的键通过因果掩码处理,无论距离如何,均接收零注意力。我们提取解码时使用的精确注意力矩阵,保持与行为数据生成的因果关系。对于每个生成的响应令牌,我们对注意力权重求和,仅针对目标令牌集合中的键位置,然后跨所有层和头平均,并按响应长度归一化,得到单个标量 GAR(\(\tau\))。我们计算所有可用生成令牌上的 GAR(即每个 \(\tau\) 产生单个标量),但消融实验仅限于首个响应令牌之前的令牌位置,出于因果性理由。有关后一选择的变体讨论见附录 C。

### 2.3 滑动窗口消融  

为因果操作注意力通道,我们应用一个滑动窗口掩码,强制从 \(\mathcal{G}\) 到 \(\mathcal{R}_\tau\) 的注意力为零,模拟注意力通道闭合。该掩码通过设置一个窗口大小 \(W \in \mathbb{Z}_{>0}\),使得对于所有位置对 \((i,j)\) 满足 \(i - j > W\),注意力为零。由于 \(G_{\max} = \max(\mathcal{G})\) 且响应位置 \(i\) 随轮次增加而向右移动,当 \(i - G_{\max} > W\) 时,所有目标令牌变得不可访问。该消融是确定性的:对于每个轮次 \(\tau\),我们计算 \(R_{\min}(\tau) = \min(\mathcal{R}_\tau)\),则当 \(R_{\min}(\tau) - G_{\max} > W\) 时,目标令牌被掩蔽。我们称该轮次为窗口边缘轮次:在该点,注意力通道被强制闭合。

### 2.4 残差流探针  

对于第二个通道,我们训练线性二元分类器(探针),用于预测一个预定义的每轮次行为指标,该指标基于残差流激活 \(\mathbf{r}_{t^*}^{(\ell)}\),其中 \(t^*\) 是模型在轮次 \(\tau\) 生成首个响应令牌之前紧邻的位置。探针是一个线性决策规则,形式为 \(p_\tau^{(\ell)}(\mathbf{r}) = \mathbf{1}\!\left[\mathbf{w}^\top \mathbf{r} + b > 0\right]\),训练用于从残差流激活 \(\mathbf{r}_{t^*}^{(\ell)}\) 预测模型 \(M\) 在轮次 \(\tau\) 的每轮次行为结果,其中 \(t^* = \min(\mathcal{R}_\tau) - 1\) 紧邻模型在轮次 \(\tau\) 的首个响应令牌之前。结果标签为 1 表示模型响应符合目标,否则为 0。

探针目标是轮次 \(\tau\) 的每轮次行为结果:模型响应是否符合任务目标的指示器。我们在 PCA 降维的残差表示(50个主成分,每个交叉验证折重新拟合;对于小样本单元裁剪为 \(\min(50, n_{\mathrm{train}}-1, n_{\mathrm{features}})\))上训练线性判别分析(LDA)分类器,并通过留一法交叉验证在轮次水平评估。StandardScaler 每折重新拟合。通过基于轮次标签的200次随机排列零假设评估显著性。完整实现细节见附录 D (https://arxiv.org/html/2605.12922#A4)。我们在多个层 \(\ell \in \{0,1,\ldots,L\}\) 进行探针。在 \(\ell=0\)(输入嵌入)的探针作为方法论基线:在 \(\ell=0\) 时的随机水平准确率,加上下游层高于随机的准确率,表明目标条件信息是在处理过程中在残差流中构建的,而非从输入反映而来。因此,下游层的探针准确率提供了残差通道能力的操作性度量。实现细节、位置选择的动机以及所得结论的编码与因果使用范围见附录 D (https://arxiv.org/html/2605.12922#A4)。

## 3 实验设计  

为隔离 LLM 多轮退化的机制并测试我们的通道转换框架,我们将实验设计为一系列针对性测试和干预。根据我们的框架,多轮失败源于任务定义信息(在此操作化为初始提示中的目标定义令牌)通过直接注意力变得难以访问,而闭合后的行为取决于 LLM 是否已经形成了有用的目标内部表示。使用 GAR(§2.2 (https://arxiv.org/html/2605.12922#S2.SS2)),我们首先测量在默认注意力下,长时间多轮交互中直接访问是否下降。为测试这种下降是否因果驱动行为,我们应用滑动窗口干预 §2.3 (https://arxiv.org/html/2605.12922#S2.SS3) 强制这些初始目标令牌位于注意力窗口之外。如果对目标定义令牌的访问在行为上重要,则闭合该通道应在转折点后产生 LLM 行为的变化。因此,我们比较转折点前后的 GAR 和任务原生行为指标。随后,一项窗口大小扫描实验测试转折时间是否随上下文窗口大小可预测地缩放,并确认闭合由令牌可达到性决定。

可访问性本身并不能完全解释不同架构在转折后的行为。因此,我们使用残差流探针 §2.4 (https://arxiv.org/html/2605.12922#S2.SS4) 测试第二个内部通道。对于转折后的样本,我们在残差激活上训练线性探针,用于预测模型在相关行为探针上成功还是失败。最后,我们执行消融以测试这些表示可靠地保存目标信息的程度。我们运行了5,483个总轮次,覆盖四个任务 §3.1 (https://arxiv.org/html/2605.12922#S3.SS1),样本量介于50-200轮次之间,根据每项分析所需的精度进行缩放。我们评估了四种开源权重Transformer架构,涵盖两种注意力机制(全注意力 vs. 原生滑动窗口)、KV 比率(分组查询注意力下每个共享键值头的查询头数量)(Ainslie et al., 2023 (https://arxiv.org/html/2605.12922#bib.bib10))、RoPE 基频 \(\theta\)(旋转位置嵌入基频,控制位置衰减)(Su et al., 2024 (https://arxiv.org/html/2605.12922#bib.bib4)),以及一个参数缩放族。

![[未标注图片]](https://arxiv.org/html/2605.12922v1/icons/mistral.png) 的 Mistral-7B-Instruct 和 Mixtral-8x7B-Instruct(原生滑动窗口注意力),![[未标注图片]](https://arxiv.org/html/2605.12922v1/icons/llama.png) 的 LLaMA-3.1-8B-Instruct,以及 ![[未标注图片]](https://arxiv.org/html/2605.12922v1/icons/qwen.png) 的 Qwen-2.5-Instruct 家族(四个规模:3B、7B、14B、32B)。我们在这些架构上运行滑动窗口干预,以表征强制通道闭合下的行为。Mixtral 在原生的滑动窗口骨干上引入了稀疏专家混合路由,为通道转换框架是否推广到稠密Transformer之外提供了测试。Qwen 2.5 家族提供了家族内的规模轴,用于测试残差通道能力是否由参数数量预测。完整的架构规范、轮次数量、种子和复制结构见附录 F (https://arxiv.org/html/2605.12922#A6)。

### 3.1 任务套件与指标  

参见标题  
图2:四个任务概览:系统提示目标、对话时间表以及每轮次行为指标。  

我们在一个任务套件上评估通道转换框架,该套件包含...

相似文章

Found in Conversation: LLMs 自我学习以缩小多轮对话差距

arXiv cs.CL

本文介绍了 Found in Conversation (FiC),一个使用视图非对称自蒸馏(View-Asymmetric Self-Distillation)的训练框架,旨在缩小 LLMs 中的多轮对话性能差距。该方法教会模型从欠详细的多轮提示中恢复单轮能力,在多种模型系列和规模上实现了 92-100% 的恢复率。

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。