DecodeShare:追踪LLM解码时决策的共享子空间
摘要
DecodeShare提出了一种方法,用于识别LLM在解码时隐藏状态中跨任务一致共享的低维子空间,并表明干扰该子空间对决策性能的损害程度超过同等待遇下干扰随机或预填充派生的子空间,这对激活引导具有启示意义。
arXiv:2607.20469v1 公告类型:新
摘要:大型语言模型(LLM)用一组参数处理许多任务,但在KV缓存推理中,尚不清楚在解码时而非预填充时使用了何种任务通用结构(如果存在的话)。我们提出了DecodeShare协议,该协议在解码时隐藏状态中识别跨任务一致共享的低维子空间,然后通过在解码过程中仅移除该子空间来测试其因果作用。在我们的实验中,在相同的干预预算下,干扰所发现的共享子空间对决策性能的损害远大于干扰预填充派生的或随机子空间。我们进一步展示了这种解码共享子空间对激活引导具有实际意义:常见的引导方向可能与任务通用的解码通道重叠。剔除该共享子空间可以直接分离两个组件的功能角色,同时在解码时评估引导向量比基于预填充的代理更能为下游部署提供更可靠的信号。尽管紧凑,共享子空间可以在解码时作为高杠杆因果通道。代码可在以下地址获取:https://github.com/Zishan-Shao/decodeshare.git。
查看缓存全文
缓存时间: 2026/07/24 05:00
# DecodeShare: 追踪大语言模型解码阶段决策的共享子空间 来源:https://arxiv.org/html/2607.20469 Lixun Zhang, Kangning Cui, Yixiao Wang, Ting Jiang, Hancheng Ye, Qinsi Wang, Zhixu Du, Yuzhe Fu, Fan Yang, Danyang Zhuo, Yiran Chen, Hai Helen Li ###### 摘要 大型语言模型 \(LLMs\) 用一组参数处理多种任务,但在使用 KV 缓存推理时,尚不清楚在*解码阶段*(而非*预填充阶段*)是否存在某种任务通用的结构。我们提出 DecodeShare 协议,该协议识别出解码阶段隐藏状态中跨任务一致共享的低维子空间,并通过仅在解码时移除该子空间来测试其因果作用。在我们的实验中,与相同干预预算下干扰预填充衍生或随机子空间相比,干扰发现的共享子空间对决策性能的影响要大得多。我们进一步展示,这种解码共享子空间对激活引导具有实际影响:常见的引导方向可能重叠任务通用的解码通道。直接投影出该共享子空间可分离这两个组件的功能角色,同时在解码阶段评估引导向量,能为下游部署提供比基于预填充的代理更可靠的信号。尽管共享子空间很紧凑,但它可以在解码时充当一个高影响力的因果通道。代码可在以下网址获取:https://github.com/Zishan-Shao/decodeshare.git。 机器学习,ICML ## 1 引言 参见图注 图 1:DecodeShare 流程。\(1\) 我们从多个任务的提示中收集 KV 缓存*解码阶段隐藏状态*,并将其汇聚成一个矩阵。\(2\) 池化主成分分析得到一组正交方向 (\(V\) 矩阵的列);然后我们选择跨任务一致共享的子集 \(Q_{\ell}^{(s)}\),而不是简单取方差最大的成分。\(3\) 为测试因果关系,我们*仅在解码期间*通过从隐藏状态中移除所选成分进行干预,并与维度*和能量*匹配的对照进行比较,以排除单纯的高方差/能量混淆。
大型语言模型 \(LLMs\) 使用单一参数集在广泛任务上实现强性能。这种多任务通用性激发了计算重用的想法:多样化的行为可能由一组共同的内部特征而非完全任务特定的特征来中介。我们可以将此重用视为在模型决策时间表示中诱导出一个共享子空间——即一组跨任务和提示变体一致参与的方向。如果是这样,它将为跨任务和提示变体可迁移的分析和干预提供一个原则性目标。受此启发,越来越多的研究通过使用低维方向或子空间干预内部*激活*来研究和引导 LLM 行为(Zou 等,2023 (https://arxiv.org/html/2607.20469#bib.bib22);Turner 等,2023 (https://arxiv.org/html/2607.20469#bib.bib19);Rimsky 等,2024 (https://arxiv.org/html/2607.20469#bib.bib20))。然而在实践中,激活级干预通常很脆弱:在一种提示模板、任务设置或实现细节下表现强烈的效果,在微小扰动下可能会减弱、翻转或消失(Tan 等,2024 (https://arxiv.org/html/2607.20469#bib.bib26);Deng 等,2025 (https://arxiv.org/html/2607.20469#bib.bib27))。这种脆弱性限制了可重复性,并使负面结果难以解释。我们认为,脆弱性被放大是因为干预通常不与现代推理中驱动下一个词元决策的*状态*对齐。
首先,我们很少在决策时测量或保护任务通用结构。大多数激活引导方法在固定提示分布下为特定行为或属性估计一小组方向(Turner 等,2023 (https://arxiv.org/html/2607.20469#bib.bib19);Rimsky 等,2024 (https://arxiv.org/html/2607.20469#bib.bib20);Zou 等,2023 (https://arxiv.org/html/2607.20469#bib.bib22);Konen 等,2024 (https://arxiv.org/html/2607.20469#bib.bib21);Arditi 等,2024 (https://arxiv.org/html/2607.20469#bib.bib28);Todd 等,2024 (https://arxiv.org/html/2607.20469#bib.bib29))。这些方法通常不控制引导方向与任务通用计算方向之间的相互作用(Merullo 等,2024 (https://arxiv.org/html/2607.20469#bib.bib16);Kaushik 等,2025 (https://arxiv.org/html/2607.20469#bib.bib17))。如果下一个词元准确性依赖于一个共享的决策时间通道,那么扰动它可能导致大的失败和模板敏感性,这与观察到的提示或模板变化下的脆弱性一致(Tan 等,2024 (https://arxiv.org/html/2607.20469#bib.bib26);Deng 等,2025 (https://arxiv.org/html/2607.20469#bib.bib27))。其次,方向估计的位置与决策发生的位置之间存在错位。在常见的激活引导流程中,引导方向通常从对完整提示计算的*预填充*激活中估计(Turner 等,2023 (https://arxiv.org/html/2607.20469#bib.bib19);Rimsky 等,2024 (https://arxiv.org/html/2607.20469#bib.bib20);Zou 等,2023 (https://arxiv.org/html/2607.20469#bib.bib22);Konen 等,2024 (https://arxiv.org/html/2607.20469#bib.bib21);Arditi 等,2024 (https://arxiv.org/html/2607.20469#bib.bib28);Todd 等,2024 (https://arxiv.org/html/2607.20469#bib.bib29))。然而在使用 KV 缓存解码时,每个下一个词元决策是从单次词元*解码*传递计算得出的。如果解码阶段隐藏状态与预填充激活不同,那么预填充估计的方向可能与实际产生 logits 的状态不对齐。这种错位对引导选择很重要:基于预填充验证偏好的向量在保留的 KV 缓存解码下可能表现不佳。由于引导向量也可能重叠任务通用的解码结构,投影最好被视为一种干扰诊断,而非通用修复。
我们引入 DecodeShare 协议,该协议从解码阶段隐藏状态估计候选共享子空间,并通过*仅解码*投影移除来评估它们对解码决策的相关性。图 1 (https://arxiv.org/html/2607.20469#S1.F1) 预览了我们的 DecodeShare 流程:我们跨任务收集解码阶段隐藏状态,识别共享子空间,并通过仅解码消融测试其因果作用。因此,我们将 KV 缓存推理下的解码阶段隐藏状态分析为驱动下一个词元 logits 的表示。(我们在第 2.1 节 (https://arxiv.org/html/2607.20469#S2.SS1) 中引入正式符号和定义。) 假设:共享的解码阶段决策通道 在 KV 缓存解码下,下一个词元决策因果地依赖于解码阶段隐藏状态的一个*小*子空间 \(S\),该子空间跨任务共享。
#### 关键发现与启示。 跨模型和基准,移除识别的共享子空间导致的决策准确性下降远大于匹配的对照,支持决策时存在一个高影响力的因果通道。此效应很大程度上是*解码特定*的:在匹配预算下,从预填充估计的子空间通常无法重现解码阶段的因果影响。最后,我们将共享的解码阶段通道与引导可靠性联系起来。常见的引导向量会重叠此通道;投影出重叠部分会暴露出任务依赖的效用-鲁棒性权衡,而非通用修复,同时解码阶段评估能为保留的 KV 缓存解码效用提供比预填充代理更好的排序信号。总之,这将对引导脆弱性的理解部分归因于推理阶段的未对齐问题,而不仅仅是提示模板伪影。我们的主要贡献是: 1. 1. 我们提出 DecodeShare 协议,该协议*直接从 KV 缓存解码阶段隐藏状态*识别和量化跨任务共享子空间。 2. 2. 通过匹配预算下的仅解码干预,我们展示了共享的解码子空间对决策具有因果重要性,且预填充估计的基通常无法捕捉这些解码阶段的因果效应。 3. 3. 我们将解码共享子空间与引导可靠性联系起来;它重叠引导向量,且解码阶段评估能为保留的 KV 缓存解码效用提供比预填充代理更好的排序信号。我们将此工作定位为一种*协议和评估*贡献:在真实 KV 缓存解码下找出并因果测试决策相关共享子空间的实用方法。 ## 2 方法论 ### 2.1 预备知识 #### KV 缓存推理与解码阶段隐藏状态。 设 \(f_{\theta}\) 为具有 \(L\) 层和隐藏宽度 \(d\) 的仅解码器 Transformer。在 KV 缓存下,推理包括对整个提示的*预填充*传递,然后是迭代的*解码*步骤。每个解码步骤处理单个当前词元,同时重用先前词元的缓存键/值。固定单层 \(\ell\)。设 \(h_{\ell}^{(s)} \in \mathbb{R}^{d}\) 表示 KV 缓存解码下解码步骤 \(s\) 时当前词元的层 \(\ell\) 隐藏状态。我们称 \(h_{\ell}^{(s)}\) 为*解码阶段隐藏状态*。当强调它驱动下一个词元 logits(从而影响决策准确性)时,我们也称其为*解码阶段决策状态*。除非另有说明,我们运行最多 \(K\) 步的 KV 缓存解码,并跨步骤收集解码阶段隐藏状态(在池化时统一处理步骤)。 #### 预填充与解码状态。 我们区分在*预填充*传递中获得的隐藏状态(在完整提示上计算)与 KV 缓存解码期间获得的解码阶段隐藏状态。在所有实验中,预填充状态取在最后一个提示位置,以提供单词元参考点进行比较(正式定义见附录附加定义。(https://arxiv.org/html/2607.20469#A0.SS0.SSS0.Px1))。 #### 对齐原则。 本文中的所有因果干预仅在 KV 缓存解码步骤期间作用于 \(h_{\ell}^{(s)}\)(我们不修改预填充计算)。因此,我们从解码阶段隐藏状态估计候选子空间,并对相同的解码阶段状态进行干预,避免估计器与干预之间的不匹配。 ### 2.2 关键假设与证伪标准 我们不引入额外的独立主张,而是通过三个检验来测试核心假设:(i) H1 验证共享的解码阶段结构存在于随机之外,(ii) H2 测试共享子空间在解码时是否因果相关,(iii) H3 测试*预填充*估计的方向在匹配预算下是否能因果传递到解码阶段决策。 **H1 共享的解码阶段结构存在。** 从解码阶段隐藏状态,我们的共享性统计量(共享集大小 \(|S_{\ell}(\tau,m)|\))超过匹配零基线下的预期。 **H2 解码阶段因果相关性。** 从解码阶段隐藏状态 \(h_{\ell}^{(s)}\) 中*仅在 KV 缓存解码期间*移除估计的共享子空间,其性能下降比相同干预预算下的匹配非共享对照更大。 **H3 预填充到解码的因果传递常常失败。** 从预填充状态估计的基,无法在匹配预算下可重复地从解码阶段隐藏状态估计的基所产生的解码阶段因果效应。 #### 证伪标准。 如果共享性统计量未显著大于匹配零基线,则拒绝 H1。如果相应的解码阶段干预效应在相同预算下与匹配对照无法区分(对于 H3,如果预填充和解码估计的基产生可比的解码阶段效应),则拒绝 H2–H3。 ### 2.3 DecodeShare:构建解码对齐的共享子空间 #### 仅解码状态收集。 对于每个任务 \(t \in \mathcal{T}\),我们从分布 \(\mathcal{D}_t\) 采样 \(N\) 个校准提示 \(x\),并在策略 \(\pi\)(例如贪婪)下运行最多 \(K\) 步 KV 缓存解码。在每个解码步骤 \(s\)(单词元前向传递),记录层 \(\ell\) 隐藏状态 \(h_{\ell}^{(s)} \in \mathbb{R}^{d}\)。堆叠所有记录的状态得到 \(X_{\ell,t} \in \mathbb{R}^{n_{\ell,t} \times d}\)。为平衡任务,我们将每个子采样到 \(n_{\ell} = \min_t n_{\ell,t}\),得到 \(X_{\ell,t}' \in \mathbb{R}^{n_{\ell} \times d}\),并进行任务中心化: \[ \tilde{X}_{\ell,t} = X_{\ell,t}' - \mathbf{1}\mu_{\ell,t}^{\top},\quad \mu_{\ell,t} = \frac{1}{n_{\ell}}\sum_{j=1}^{n_{\ell}} X_{\ell,t}'[j,:]. \] 参见图注 (a) 层 44 (b) 层 1010 (c) 层 2424 图 2:跨层共享性热图。行是任务,列是池化主成分分析成分。颜色显示相对方差贡献 \(r_{\ell,t,i}\)。成分按具有 \(r_{\ell,t,i} \geq \tau\) 的任务数量排序;垂直线标记共享集 \(S_{\ell}(\tau,m)\) 的边界。 #### 池化主成分分析基(通过奇异值分解计算)。 我们池化(堆叠)所有任务中心化状态: \[ \tilde{X}_{\ell} = \mathrm{concat}_{t \in \mathcal{T}} \, \tilde{X}_{\ell,t} \in \mathbb{R}^{(|\mathcal{T}| n_{\ell}) \times d}. \] 我们通过在池化矩阵上运行*主成分分析*来定义池化主成分分析基,即取其经验协方差矩阵 \(C_{\ell} = \frac{1}{|\mathcal{T}| n_{\ell}} \tilde{X}_{\ell}^{\top} \tilde{X}_{\ell}\) 的顶部特征向量。实现中,我们通过对池化矩阵进行奇异值分解得到相同的主成分分析方向: \[ \tilde{X}_{\ell} = U \,\mathrm{diag}(\sigma_1, \ldots, \sigma_d) V^{\top}, \] 其中 \(\sigma_1 \geq \sigma_2 \geq \cdots \geq 0\) 是奇异值。对于中心化数据,主成分分析方向是 \(V\) 的列,第 \(i\) 个方向捕获的方差与 \(\sigma_i^2\) 成正比。我们选择最小的 \(k\),使得至少保留总方差的一部分 \(\rho\): \[ k = \min\left\{ m: \frac{\sum_{i=1}^{m} \sigma_i^2}{\sum_{i=1}^{d} \sigma_i^2} \geq \rho \right\},\qquad Q_{\ell} = V_{:,1:k} \in \mathbb{R}^{d \times k}. \] 此池化主成分分析基提供了单一的跨任务基集,避免了每任务主成分分析基的不对齐。经验上,恢复的共享核心在 \(\rho\) 的广泛范围内稳定(例如,\(\rho \in [0.9, 0.99]\);表 10 (a) (https://arxiv.org/html/2607.20469#A2.T10.st1))。 #### 通过使用分数和阈值识别共享方向。 对于每个任务 \(t \in \mathcal{T}\),我们量化其解码阶段状态沿每个池化主成分分析方向的变化强度。任务中心化后,投影到 \(Q_{\ell} \in \mathbb{R}^{d \times k}\): \[ Z_{\ell,t} = \tilde{X}_{\ell,t} Q_{\ell} \in \mathbb{R}^{n_{\ell} \times k}, \] 并计算每个方向上的方差 \(v_{\ell,t,i} = \mathrm{Var}\!\left(Z_{\ell,t}[:,i]\right)\),其中 \(i \in [k]\)。为比较跨任务的使用模式并去除整体尺度,我们在池化子空间内归一化,定义*相对方差贡献*: \[ r_{\ell,t,i} = \frac{v_{\ell,t,i}}{\sum_{j=1}^{k} v_{\ell,t,j}} \in [0,1],\quad \sum_{i=1}^{k} r_{\ell,t,i} = 1. \] 由于 \(r_{\ell,t,i} \geq 0\) 且 \(\sum_{i=1}^{k} r相似文章
PSD: 通过并行推测解码推动扩散大语言模型的帕累托前沿
本文介绍了一种无需训练的框架——并行推测解码(PSD),它通过同时提升空间和时间效率来加速扩散大语言模型的推理,每次前向传递最多可处理5.5×的token数,且质量与贪婪解码相当。
共享潜在结构实现LLMs中后门攻击的统一检测与缓解
本文识别了LLMs中不同后门行为之间的共享潜在机制,利用稀疏自编码器检测并因果抑制这些特征,从而在多种模型和攻击类型中实现统一的后门检测与缓解。
更深并不总是更好:通过置信层解码缓解对齐损失
本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。
$R^2$-dLLM:通过时空冗余削减加速扩散大语言模型
R²-dLLM 引入时空冗余削减技术,在保持生成质量的同时将扩散 LLM 的解码步数最多压缩 75%,直击部署瓶颈。
缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。