基于稀疏查询特征梯度优化的导向生成

arXiv cs.LG 论文

摘要

本文介绍了Prototype-Based Sparse Steering方法,该方法将稀疏自编码器应用于大语言模型的注意力查询激活,然后在推理过程中使用梯度优化来引导生成朝向目标行为。该方法在一个逻辑规划任务和一个风格化教育领域中得到了验证,展示了可解释且解耦的控制能力。

arXiv:2605.23040v1 Announce Type: new 摘要:潜在导向利用大语言模型的内部表示来引导生成,但对密集状态的干预可能会纠缠不同的语义特征。在本文中,我们研究注意力查询激活作为精确控制的高保真位点,假设操作注意力机制本身比一般状态干预提供更清晰的导向性。我们引入了Prototype-Based Sparse Steering框架,该框架专门将稀疏自编码器(SAEs)应用于查询激活,以将其分解为可解释的特征,然后在推理过程中应用梯度优化,使稀疏表示与目标行为的类别原型对齐。为了验证这一架构见解,我们首先在Textualized Gridworld(一个用于可验证规划约束的受控环境)中分析了该机制。我们证明,优化稀疏查询特征能够有效导航严格的规划要求(例如安全路径与短路径),证实了该方法满足客观规则的能力。然后,我们通过在高维教育领域上训练SAEs来展示该框架的多功能性,该框架引导反馈的认知复杂度(即Bloom's Taxonomy)。我们的实验证实,稀疏查询表示为逻辑规划和风格细微差异的统一、可解释控制提供了必要的解耦能力。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:59

# 基于稀疏查询特征梯度优化的引导生成

**来源**:https://arxiv.org/html/2605.23040

**Sumanta Bhattacharyya**sbhatt54@uic\.edu  
伊利诺伊大学芝加哥分校计算机科学系  
**Pedram Rooshenas**pedram@uic\.edu  
伊利诺伊大学芝加哥分校计算机科学系  

###### 摘要

潜在引导通过利用大型语言模型(LLM)的内部表征来指导生成,但对密集状态的干预可能会纠缠不同的语义特征。在本文中,我们研究注意力查询激活作为高保真控制点位,假设对注意力机制本身进行操作比一般状态干预具有更清晰的引导能力。我们提出基于原型的稀疏引导框架,该框架将稀疏自编码器(SAE)专门应用于查询激活,将其分解为可解释特征,然后在推理过程中应用基于梯度的优化,使稀疏表示与目标行为的类别原型对齐。为了验证这一架构洞见,我们首先在文本化网格世界(一种用于可验证规划约束的受控环境)中分析该机制。我们证明,优化稀疏查询特征能够有效满足严格的规划要求(即安全路径与短路径),证实了该方法满足客观规则的能力。接着,我们通过在高等教育领域训练SAE来展示框架的通用性,该框架引导反馈的认知复杂度(即布鲁姆分类法)。我们的实验表明,稀疏查询表示为逻辑规划和风格细微差别提供了必要的解耦,从而实现统一、可解释的控制。

## 1 引言

LLM已成为现代AI系统事实上的自然语言接口。然而,将这些模型部署到现实场景中需要的不只是流畅的生成能力,还需要精确遵循用户定义的风格、安全性和逻辑一致性要求。因此,针对通用应用的LLM可控文本生成研究已被广泛探索(参见Zhang等人 (2023)的综合调查)。与标准文本生成不同,可控文本生成(Mireshghallah等人, 2022)引导LLM生成符合特定约束的输出。为了实现这种控制,提示工程已成为一种普遍策略。然而,仅通过提示来控制文本生成可能效果不佳(Ye和Durrett, 2022),因为提示通常需要大量的上下文信息才能生成相关回复。当包含用于控制风格和细微差别的额外指令时,这些指令可能会在长提示上下文中被稀释或忽略(Liu等人, 2023a)。此外,开源和小型LLM在仅依赖提示方法时对生成文本的控制能力有限(Salinas和Morstatter, 2024)。在实践中,这种差距在较小的开源模型中最为明显:相同的指令在前沿模型中能产生稳定的风格一致性,但在较小模型中却可能产生不一致或稀释的控制效果。一种常见的缓解方法是在提示中包含少量标注演示(上下文学习)来锚定所需属性(Brown等人, 2020)。然而,增加演示数量会导致显著的内存消耗和计算开销,尤其是在复杂任务需要更大上下文窗口的情况下(Wei等人, 2022;Li等人, 2024b)。这些局限性促使我们采用不依赖扩展提示,而是在推理时直接干预模型内部表示的方法。

潜在空间引导方法,通常被称为激活工程,通过在推理时直接干预大型语言模型的内部激活来实现可控文本生成(Dathathri等人, 2019a;Liu等人, 2021;Khalifa等人, 2020)。这些方法通常使用引导向量(即激活空间中与语义、行为或风格属性相关联的方向)来以可预测的方式改变模型行为(Hernandez等人, 2023;Sun等人, 2024)。与上下文提示相比,激活工程提供了一种更直接的机制来控制风格、语气、正式性或事实性等属性,而无需扩展提示上下文。然而,密集的激活空间可能会纠缠多个潜在因素,这与叠加假设(Elhage等人, 2022)一致,使得干预不够精确,更容易产生意外的副作用。稀疏表示,包括由稀疏自编码器(SAE;Makhzani和Frey, 2013)学习到的表示,通过鼓励更新集中在较小的特征集上,为分解控制方向提供了一种自然方式(Cunningham等人, 2023;Bricken等人, 2023)。这种稀疏性可以支持更孤立和独立的潜在更新,从而在生成过程中实现对目标属性更精确和可靠的控制。

先前的引导方法大多将静态向量添加到残差流或注意力头输出中,这可能会覆盖上下文并纠缠属性;我们转而询问是否存在一个更局部、经过优化而非固定的点位,能够产生更清晰的控制。在本文中,我们假设注意力查询激活作为生成的高保真控制表面,因为它们编码了模型从上下文中检索信息的意图。由于查询参数化了令牌如何关注和检索信息,微小而局部的查询扰动可以修改模型使用的信息,同时大幅减少残差流的全局失真。我们提出了一种结合SAE与基于梯度的潜在搜索的可控生成方法。受原型网络(Snell等人, 2017)的启发,该网络最初设计用于少样本学习,我们将目标属性表示为稀疏潜在空间中的原型分布。我们不添加静态引导向量,而是将控制视为一个优化问题,引导编码特征以增加与目标原型分布的对齐程度。

我们在互补的控制设置中验证了我们的方法。对于硬性的、可验证的控制,我们在文本化网格世界(TGW;Kim等人, 2024)上进行评估,该世界改编自经典的RL规划设置(Zai和Brown, 2020),其中生成的路径必须满足明确的安全性和长度约束。该设置支持精确的基于规则的评估:我们可以直接测量生成的路径在满足目标(如产生安全、短或长路径)的同时是否保持有效。对于软性语义控制,我们将方法迁移到教育反馈环境中,引导布鲁姆认知层次(Anderson和Krathwohl, 2001)的认知复杂度,展示了对细微教学和风格属性的控制。最后,我们在TruthfulQA(Lin等人, 2022)上作为外部基准进行评估,以衡量基于梯度的引导是否提高了真实性和信息性,同时与静态向量加法基线相比减少了分布失真。

我们的主要贡献和发现如下:

1. **基于原型的稀疏查询优化**:我们将推理时控制形式化为对稀疏查询潜在表示的基于梯度的优化,使用由目标属性原型的负距离上的softmax定义的原型分布目标。这使得在保持基础模型权重固定的同时,能够自适应地引导向语义或行为目标。

2. **查询级控制保真度**:我们提供定量证据表明,注意力查询激活比残差流提供了更局部、更低失真的干预点位。具体来说,在匹配的引导强度下,查询级干预表现出有界跨层激活偏差和更低的下一令牌Jensen–Shannon散度,支持其用于规划和风格控制。近期关于查询级引导的独立工作(Torop等人, 2025)为同一更广泛的观察提供了补充证据。

3. **面向引导的评估数据**:我们构建了一个新的用于认知风格引导的布鲁姆分类法数据集(Anderson和Krathwohl, 2001),并从文本化网格世界(Kim等人, 2024)中推导出一个过滤后的网格世界引导子集。该网格世界子集旨在包含相互区别的安全路径、短路径和长路径,支持对硬性引导约束进行基于规则的评估。

4. **跨引导机制的实验验证**:我们在硬性规划约束、软性认知风格控制和TruthfulQA真实性引导上评估了我们的方法。在涉及三个开放权重模型的TGW实验、布鲁姆层次引导和TruthfulQA中,我们的方法在匹配或超过提示、残差流引导、注意力头引导、密集查询引导和静态稀疏引导基线的同时,通常诱导出显著更低的分布代价。

## 2 提出的引导框架

请参见图注

**图1:TGW中的可量化引导。** 我们引导生成朝向短路径、安全路径(较低的墙壁相邻分数)和长路径;成功可通过路径有效性和属性指标进行验证。未经引导的输出可能无效。

我们研究推理时引导以实现可控生成:给定输入提示和目标属性,目标是使LLM的输出偏向该属性,同时保留任务相关内容和连贯性。例如,在文本化网格世界(TGW)中,提示指定了一个包含墙壁、起始格子和目标格子的网格地图,模型必须输出一个从起点到终点的格子序列作为路径(Kim等人, 2023)。我们定义目标属性要求路径为安全、短或长。在我们的TGW设置中,我们通过路径中与墙壁相邻的格子数量来量化安全性,因此更安全的路径具有更低的墙壁相邻分数;只有当生成的格子序列是有效的路径(每一步移动到相邻格子且不进入墙壁格子)并满足指定属性时,引导才算成功。TGW说明了一种硬性、可验证的机制:保持对应于维持任务的结构有效性(一条格式良好的路径),而安全性和长度等属性可以直接在结果路径上测量。图1显示了将单个基础模型输出引导向不同目标属性的示例。在TGW中,引导后的输出是完全可验证的:我们通过计算路径分数(例如安全性对应的墙壁相邻计数,或短/长目标对应的路径长度)并将其与参考(黄金)解决方案的分数进行比较,来检查路径有效性和类别特定的最优性。实现这些可验证的目标需要在推理时修改模型的内部轨迹,这促使我们干预中间激活,而不是仅依赖提示。

密集的内部激活为推理时引导提供了有效的干预点,但该空间中的更新本质上与许多潜在因素耦合,使得迭代优化容易受到干扰。为了在不承诺特定干预点位的情况下改善控制空间的条件,我们使用稀疏自编码器(SAE)对可引导激活进行重新参数化。SAE通过对潜在特征施加L1约束来强制执行稀疏性,鼓励更新仅激活少量方向(Konda等人, 2014;Lee等人, 2007)。在我们的设置中,这种稀疏性用于分解控制方向,从而在推理时优化期间实现更孤立、更有针对性的更新。

令s = LLM≤ℓ(x, y)表示在干预层ℓ处提取的激活(我们在第2.2节分析点位选择),针对由提示x和生成响应y组成的完整序列。SAE编码器将该激活映射到稀疏潜在表示z = Enc(s),解码器将其重构回原始激活空间ŝ = Dec(z)。引导通过优化z进行,同时保持所有LLM和SAE参数冻结。SAE参数在令牌位置之间共享,潜在表示在整个序列上联合优化。优化后,重构的激活ŝ被注入回同一干预点,生成正常继续。

**算法1** 使用稀疏自编码器进行属性条件引导

1: **输入**:源文本 x,目标属性 k_T,属性类别数 K,支持集 D_k,LLM,Enc,Dec,步长 η,阈值 ε,干预层 ℓ  
2: **输出**:朝向目标属性的引导文本  
3: **对于** k ∈ {1, ..., K} **执行**  
4:   c_k ← (1/|D_k|) Σ_{(x_i, y_i, a_i) ∈ D_k} Enc(LLM≤ℓ(x_i, y_i))   ▷ 计算每个原型的中心  
5: **结束于**  
6: y' ← LLM(x)   ▷ 获取初始模型输出  
7: t ← 0; z^(t) ← Enc(LLM≤ℓ(x_i, y'))   ▷ 获取初始潜在表示  
8: **当** ‖∇_z log P_φ(a=k_T | z^(t))‖₂² > ε **执行**   ▷ 直到引导更新收敛  
9:   **对于** k ∈ {1, ..., K} **执行**  
10:      d_k ← ‖z^(t) - c_k‖₂²   ▷ 计算潜在表示到每个原型中心的距离  
11:   **结束于**  
12:   P_φ(a=k_T | z^(t)) ← exp(-d_{k_T}) / Σ_{j=1}^K exp(-d_j)   ▷ 使用负距离计算目标原型的似然  
13:   z^(t+1) ← z^(t) + η ∇_z log P_φ(a=k_T | z^(t))   ▷ 梯度步以增加目标原型的似然  
14:   t ← t+1  
15: **结束于**

相似文章

上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。

MidSteer: 用于引导生成模型的最优仿射框架

arXiv cs.LG

介绍MidSteer,一个用于生成模型中概念引导的理论框架,通过为LLMs和视觉扩散模型中的概念引导、擦除和切换提供最优仿射变换,弥合了经验成功与理论理解之间的差距。

通过定向干预实现语言模型的多属性引导

arXiv cs.CL

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。