GEOSTEER: 用于大型语言模型激活引导的测地线优化方法

arXiv cs.LG 论文

摘要

GeoSteer 是一种基于优化的方法,用于大型语言模型中的保持范数激活引导,通过在表示流形上使用测地线更新来增强对模型行为的控制,同时保持激活范数。

arXiv:2609.10658v1 公告类型:新 摘要:激活引导提供了一种通过修改大语言模型(LLMs)在推理时的隐藏激活来控制模型的轻量级方法。在这些方法中,保持范数的引导旨在不改变激活范数的情况下改变模型行为,降低表示坍缩和退化的风险。然而,现有的保持范数方法受限于预定义的引导轨迹和依赖单步更新,这可能无法捕捉激活分布的复杂结构。我们提出了GeoSteer,一种基于优化的保持范数激活引导方法。GeoSteer将引导表述为黎曼优化问题,并通过一系列在表示流形上的小测地线步来更新激活。为了避免固定的引导方向,GeoSteer学习一个非线性激活空间目标函数来区分期望和不期望的激活,并使用该函数自适应地引导每个引导步。这种多步公式化在保持激活范数的同时,产生了更平滑、更稳定和更一致的引导行为。在TruthfulQA、RealToxicityPrompts和UltraFeedback基准测试中,GeoSteer始终优于最先进的激活引导基线。这些结果表明,通过用自适应的、几何感知的优化替换预定义的单步编辑,可以提高保持范数引导的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:17

# GeoSteer:用于大型语言模型激活引导的测地优化
来源:https://arxiv.org/html/2609.10658
Hao Vo、Ngan Le  
单位:阿肯色大学,费耶特维尔,阿肯色州,美国  
邮箱:[\{cngo,haov,thile\}@uark\.edu](mailto:)

###### 摘要

激活引导提供了一种轻量级的方式来控制大型语言模型(LLMs),其方法是在推理时修改模型的隐藏激活。在这些方法中,**保范引导**旨在不改变激活范数的情况下改变模型行为,从而降低表示崩溃和退化的风险。然而,现有的保范方法受限于预定义的引导轨迹,并且依赖于单步更新,这可能无法捕捉激活分布的复杂结构。我们提出了**GeoSteer**,一种基于优化的**保范激活引导**方法。GeoSteer 将引导问题表述为黎曼优化问题,并通过在表示流形上执行一系列小的测地步更新激活。为了避免固定的引导方向,GeoSteer 学习了一个非线性激活空间目标函数,该函数能够区分期望激活与非期望激活,并利用此函数自适应地引导每一步。这种多步骤的表述方式产生了更平滑、更稳定和更一致的引导行为,同时保持了激活范数。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准测试中,GeoSteer 持续优于最先进的激活引导基线。这些结果表明,通过将预定义的单步编辑替换为自适应的、具有几何感知的优化,可以使保范引导更加有效。

## 1 引言

参照图例 图1:GeoSteer 的概念示意图。加性引导可能使激活脱离球面,而现有的保范引导虽然保持激活在球面上,但通常遵循预定义的或基于启发式的轨迹。相比之下,GeoSteer 通过将干预分解为多次测地更新来自适应地优化引导路径。这产生了更平滑的轨迹,指向期望的激活区域,同时保持了激活范数。  
大型语言模型(LLMs)已展现出非凡的能力,并已成为现代人工智能不可或缺的组成部分,支持着广泛的应用(Achiam 等,2023;Dubey 等,2024;Liu 等,2024;Yang 等,2025)。然而,随着 LLMs 的持续快速发展,研究和控制其社会影响(包括幻觉、偏见、毒性及其他有害行为)变得越来越重要。由于现代 LLMs 通常包含数千亿个参数(Chowdhery 等,2023;Brown 等,2020),通过微调来控制和对齐它们正变得越来越困难和资源密集。*这激发了对轻量级替代方案的需求,这些方案可以在不更新模型参数的情况下调整模型行为。*

激活引导(或表示工程)提供了一种轻量级的方式来影响 LLM 行为,其方法是在推理时修改隐藏状态(Rimsky 等,2024;Wehner 等,2025;Bartoszcze 等,2025)。一种常见策略是从对比样本中构建引导向量,并在生成过程中将其添加到模型激活(Li 等,2023;Rimsky 等,2024;Liu 等,2023;Lee 等,2024)。尽管在许多场景下有效,但这种加性编辑对干预规模高度敏感。如果干预太弱,模型行为变化很小;如果干预太强,编辑后的激活可能远离模型的自然表示空间,从而损害生成质量(You 等,2026)。这一局限性激发了最近关于更结构化干预机制的工作,包括可学习的和几何感知的方法(Wu 等,2024;Deng 等,2026)。同时,现代 LLMs 的架构提供了一个有用的几何视角:归一化层(如 RMSNorm(Zhang 和 Sennrich,2019))调节激活的缩放,使得隐藏表示的方向成为可控引导的重要目标。

因此,保范引导方法被提出,作为在保持激活范数的同时控制模型行为的一种方式(Pham 和 Nguyen,2024;You 等,2026;Vu 和 Nguyen,2026)。然而,现有的保范方法仍然存在重要局限性,如图 1 概念性所示。虽然它们避免了加性引导使用的无约束欧几里得平移,但它们通常遵循预定义的或基于启发式的轨迹,而不是自适应地优化引导路径。例如,像 Angular Steering(Vu 和 Nguyen,2026)和 Spherical Steering(You 等,2026)这样的单步方法,通常依赖于简单的统计特征(如平均激活差异),而忽略了更丰富的分布结构和激活维度之间的交互。它们对单步更新的依赖也可能无法捕捉激活分布的复杂模式,限制了其在引导细微模型行为时的表达能力。

其他方法,如 HPR(Pham 和 Nguyen,2024),引入了涉及神经网络的更复杂训练过程,但仍然假设正确的引导方向位于预定义的二维平面内。这种几何限制可能限制灵活性,特别是当期望的行为变化需要在表示空间中沿更复杂的方向移动时。此外,现有方法通常对超参数敏感,可能无法在不同模型或任务间一致泛化。

为了解决这些局限性,我们提出了 GeoSteer,一种基于优化的保范激活引导框架。我们观察到,保范引导可以自然地视为在黎曼流形上将一个激活点从非期望区域移向期望区域,同时保持其范数固定。GeoSteer 不是应用单个大更新或遵循预定义的旋转,而是将引导分解为一系列小的测地更新(Absil 等,2008)。每次更新都由当前的激活状态引导,这些步骤共同在流形上形成一条平滑、自适应的轨迹。我们将此过程表述为一个黎曼优化问题(Absil 等,2008)。具体来说,我们定义了一个非线性激活空间目标,用于区分期望激活和非期望激活。此目标提供了自适应信号,用于选择引导方向,以增加与期望激活的对齐,同时远离非期望激活。在推理时,GeoSteer 执行迭代的测地更新,由该目标引导,确保激活在整个引导过程中保持在保范流形上。通过将预定义的单步旋转替换为自适应的多步骤优化,GeoSteer 捕捉了激活空间中更丰富和更细粒度的结构。这带来了更稳定和更具表达力的引导,同时保持了激活范数。在 TruthfulQA(Lin 等,2021)、UltraFeedback(Cui 等,2023)和 RealToxicityPrompts(Gehman 等,2020)上的实验表明,GeoSteer 一致地优于最先进的激活引导基线。

我们的贡献总结如下:

- • 我们将保范激活引导表述为激活球面上的黎曼优化,为激活干预提供了一个有原则的几何视角。
- • 我们提出了 GeoSteer,一种自适应的多步引导方法,它用一系列由当前激活状态引导的小测地更新替代固定的单步变换。
- • 我们在 TruthfulQA、UltraFeedback 和 RealToxicityPrompts 上进行了实验,表明 GeoSteer 在保持高效推理的同时,一致地优于强大的激活引导基线。

## 2 相关工作

**激活引导。** 激活引导通过在推理时修改隐藏激活来控制 LLM 行为。大多数现有方法遵循加性引导范式,其中从对比激活模式中估计一个方向向量,并在解码期间将其添加到模型的隐藏状态。干预通常采用通过缩放引导向量移动激活的形式,使得编辑后的表示在激活空间中移向期望的行为方向。固定向量方法,如 ITI(Li 等,2023)、RepE(Zou 等,2023)和 CAA(Rimsky 等,2024),在所有输入上应用相同的更新,这限制了其适应性。MiMIC(Singh 等,2024)和 Linear-ActR(Rodriguez 等,2025)引入了更结构化的线性表述,而 ODESteer(Zhao 等,2026)通过将引导视为基于常微分方程的轨迹进一步提高了适应性。*然而,这些方法没有明确约束激活范数,因此它们的更新可能仍然会将表示推离模型的自然激活几何并降低实用性。*

**保范激活引导。** 保范激活引导通过修改激活方向同时保持激活范数不变来解决这个问题。这些方法的动机来自于观察到现代 LLM 激活通常位于结构化流形上,其中改变方向可以在不破坏激活幅度的情况下影响模型行为。Angular Steering(Vu 和 Nguyen,2026)和 HPR(Pham 和 Nguyen,2024)使用固定的低维平面或 Householder 反射进行几何更新,但它们仍然对引导方向施加了强假设。Spherical Steering(You 等,2026)在球面上旋转激活,但通常依赖于简单的基于均值的统计量,并忽略了更丰富的分布结构。此外,大多数保范方法仅执行单步更新,限制了其捕捉复杂激活模式的能力。*相比之下,我们的方法在流形上执行自适应的多步更新,在每一步根据当前激活重新计算引导方向。*

## 3 方法

### 3.1 预备知识

**激活引导。** 激活引导旨在修改预训练语言模型的内部隐藏表示,使模型行为向期望属性转变,同时保持原始模型参数不变。令 h ∈ ℝ^d 表示在选定层和令牌位置的激活。传统的引导方法通常通过添加一个方向向量来编辑激活,

ĥ = h + αv, (1)

其中 v 是引导方向,α 控制引导强度。虽然简单,但这种加性更新可能同时改变激活的方向和范数,从而使表示偏离模型学习到的几何结构。

**超球面上的保范引导。** 保范引导将编辑后的激活约束在与原始激活具有相同范数的超球面上。给定激活 h,其归一化表示可写为

z = h / ‖h‖₂, z ∈ S^{d-1}. (2)

引导随后可以被视为在单位球面上修改 z 以获得编辑后的归一化激活 ẑ ∈ S^{d-1}。在原始激活空间中的最终编辑激活通过恢复原始范数得到:

ĥ = ‖h‖₂ ẑ. (3)

这里,ẑ 表示在单位球面上的引导方向,而 ĥ 表示模型使用的最终编辑激活。此公式保持了激活范数,并将引导视为球面上的方向更新,而非无约束的欧几里得平移。

**球面上的黎曼优化。** 超球面上的引导可以视为一个约束优化问题。给定归一化激活 z ∈ S^{d-1} 和目标函数 ℒ(z),目标是更新 z 以在保持约束 z^T z = 1 的同时改善目标。

标准的欧几里得梯度步骤通常不满足此约束,因为它可能将激活移出球面。黎曼优化通过在流形的切空间中计算更新方向来解决此问题。

对于单位球面,z 处的切空间是

T_z S^{d-1} = { u ∈ ℝ^d : u^T z = 0 }. (5)

此空间包含球面上所有局部有效的方向。给定欧几里得梯度

g = ∇_z ℒ(z), (6)

我们通过移除 g 中指向径向的分量来获得黎曼梯度:

g_R = g - (g^T z)z. (7)

得到的向量 g_R ∈ T_z S^{d-1} 给出了在球面约束下目标函数的最陡局部变化。选择切线更新方向后,可以使用测地更新沿球面移动点。这为 GeoSteer 提供了几何基础,其中 ℒ(z) 被实例化为一个学习的引导目标。

### 3.2 GeoSteer

我们考虑预训练语言模型的推理时激活引导。给定输入提示 x,令 h ∈ ℝ^d 表示在选定层和令牌位置的激活。GeoSteer 通过优化其在单位球面上的归一化方向来编辑此激活。我们将推理时轨迹表示为 {z^(t)}_{t=0}^K,初始化为

z^(0) = h / ‖h‖₂. (8)

经过 K 次测地步后,编辑后的激活重建为

ĥ = ‖h‖₂ z^(K), (9)

因此原始激活范数得以保持。

**学习引导目标。** GeoSteer 首先学习一个探针,用于区分期望激活和非期望激活。给定带标签的激活 D = {(h_i, y_i)}_{i=1}^N,

相似文章

角度-范数分解下的激活转向几何解释

arXiv cs.AI

本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。

你的LLM何时可引导?

Hugging Face Daily Papers

本文介绍了一种方法,利用梯度提升决策树(GBDT)分类器,从早期解码状态预测语言模型中激活引导的有效性,从而无需完整生成即可高效优化引导强度。

通过标题特定激活引导控制工具使用

arXiv cs.AI

本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。

通过定向干预实现语言模型的多属性引导

arXiv cs.CL

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。