拓扑引导
摘要
拓扑引导是一种新框架,利用拓扑数据分析捕获激活空间中的全局结构,以控制大型语言模型行为,实现更稳健的行为控制。
arXiv:2609.00597v1 Announce Type: new
摘要:随着大型语言模型(LLMs)的迅速崛起,控制模型的不良行为变得越来越重要。现有的行为控制方法通常直接在激活空间或特征空间进行干预,但这种方法可能对异常值、分布偏移、噪声和其他局部扰动敏感。受到拓扑数据分析(TDA)的启发,它捕获的是全局而非纯粹的局部结构,我们提出了拓扑引导,这是一种通过激活空间的拓扑表示来引导LLM行为的新框架。通过使用持久图,我们的方法将基于激活的引导与TDA连接起来,实现了更稳健的行为控制。我们表明,拓扑引导在多个模型家族和模型规模上一致地修改了LLM的行为。
查看缓存全文
缓存时间: 2026/09/02 06:17
# 拓扑导向
来源:https://arxiv.org/html/2609.00597
Benoît GuérandAffiliation:Department of MathematicsAffiliation:National University of Singapore \(NUS\)Affiliation:2 Science Drive 2, Singapore 117543Email:[benoit\.guerand@u\.nus\.edu](mailto:)
Tan Minh NguyenAffiliation:Department of MathematicsAffiliation:National University of Singapore \(NUS\)Affiliation:2 Science Drive 2, Singapore 117543Email:[tanmn@nus\.edu\.sg](mailto:)
###### 摘要
随着大语言模型(LLMs)的迅速崛起,控制模型的不良行为变得日益重要。现有的行为控制方法通常直接在激活或特征空间中进行干预,但此类方法可能对异常值、分布偏移、噪声和其他局部扰动敏感。受拓扑数据分析(TDA)启发——该方法捕捉的是全局而非纯粹局部的结构,我们提出了拓扑导向(Topological Steering),这是一种通过激活空间的拓扑表示来引导LLM行为的新框架。使用持久图(persistence diagrams),我们的方法将基于激活的导向与TDA联系起来,实现了更稳健的行为控制。我们证明,拓扑导向能够跨多个模型家族和模型规模一致地修改LLM行为。
## 1引言
大语言模型(LLMs)正越来越多地被部署为通用助手,但其行为仍然难以可靠控制。即使是高度对齐的模型,在对抗性或分布偏移的提示下,也可能产生有害、不诚实、谄媚或其他不良输出。因此,越来越多的研究致力于寻找在推理时控制模型行为的轻量级机制,无需重新训练模型或修改其权重[3 (https://arxiv.org/html/2609.00597#bib.bib1), 16 (https://arxiv.org/html/2609.00597#bib.bib2), 2 (https://arxiv.org/html/2609.00597#bib.bib3)]。
一个特别有前景的方向是*激活导向*(activation steering)[15 (https://arxiv.org/html/2609.00597#bib.bib4)],它直接干预内部表示。早期方法表明,在残差流中添加一个固定的导向向量可以诱导情感、拒绝、真实性或安全相关行为的可预测变化。随后的方法,包括对比激活添加(contrastive activation addition)[14 (https://arxiv.org/html/2609.00597#bib.bib5)]以及更近期的非线性或旋转干预[16 (https://arxiv.org/html/2609.00597#bib.bib2)],已经提高了这一范式的灵活性。然而,大多数现有的导向方法本质上是*几何且局部的*:它们从激活空间中的均值、线性对比或低维子空间构建方向。这种方法可能有效,但它们隐含地假设所关注的行为概念可以通过一个简单的全局方向或平滑的局部变换很好地捕捉。
这种假设往往过于局限。LLMs中的行为表征可能是多模态的、非线性组织的,并且分布在激活空间的异质区域中。例如,拒绝行为可能不对应于单个聚类或线性轴;相反,它可能由多个与不同提示类型、语义上下文或安全机制相关的独特激活子结构支撑。在这种情况下,全局均差向量可能会稀释或平均掉相关信号,而纯局部几何干预则可能对异常值、噪声和小扰动敏感。这些局限性促使我们对激活空间采取更结构化的视角:我们不仅关注各个激活点的位置,更关注激活云团的*形状*以及哪些多尺度结构区分了不同的行为机制。
拓扑数据分析(TDA)恰好为此目的提供了数学工具。持久同调(Persistent homology)通过跟踪连通分量、环以及更高维特征在距离尺度变化时的出现和消失,来总结点云的多尺度拓扑结构。由此产生的持久图是全局结构的稳定摘要,并且作为复杂高维数据的鲁棒描述符已被广泛研究。然而,历史上[1 (https://arxiv.org/html/2609.00597#bib.bib6), 5 (https://arxiv.org/html/2609.00597#bib.bib7)],TDA在大规模机器学习中的应用一直受到计算成本的限制:在训练循环中或非常大的数据集上计算持久同调可能成本高昂。在推理时导向的背景下,这一瓶颈大大减少。导向仅需来自对比提示集的有限激活向量集合,这使得持久拓扑能够作为干预设计的可操作信号。
贡献。在本文中,我们介绍了*拓扑导向*(Topological Steering),一种通过激活空间的拓扑结构来控制LLM行为的新型推理时方法。给定对比提示集(例如引发拒绝和引发顺从的提示),我们提取残差流激活并将其视为点云。然后,我们应用联合降维,计算Vietoris–Rips持久图,并比较两种行为机制的图表。既持久又特定于目标行为的特征用于识别连贯的激活子集,而不是不加区分地在所有样本上取平均。这些子集定义了局部化的对比方向,这些方向被聚合成一个导向向量,并在生成过程中注入残差流。
关键思想是,拓扑提供了一种超越全局质心偏移的机制。经典的激活导向[14 (https://arxiv.org/html/2609.00597#bib.bib5)]从正负激活的均值差异构建方向。拓扑导向则相反,它识别正激活云团中稳健的、行为特定的子结构,并使用源自这些子结构的方向进行导向。这使得干预能够反映行为概念在表征空间中的异构组织,同时提供了哪些激活组件支撑导向信号的可解释说明。
我们的贡献有三方面:
1. 1\.面向LLMs的拓扑感知导向:我们引入了拓扑导向,一个利用拓扑数据分析工具从LLM激活空间的多尺度结构构建导向方向的推理时框架。通过在训练循环之外应用TDA,我们的方法避免了历史上限制其在大规模深度学习中使用的计算瓶颈。
2. 2\.通过持久图实现结构可解释性:与通过激活空间中的几何偏移操作的线性或角度导向方法[16 (https://arxiv.org/html/2609.00597#bib.bib2)]不同,我们的方法使用持久图来识别行为表征的稳健拓扑特征,例如连通分量和高阶结构。这提供了一种可解释的方式来定位残差流中与行为相关的区域。
3. 3\.拓扑干预的经验验证:我们证明,拓扑导向在模型家族和规模上都能持续优于未导向的基线,并产生可测量的行为变化。虽然当前的实现并非旨在超越高度优化的几何导向方法,但它提供了一种互补的权衡:以牺牲一些原始效果为代价,换取一种更结构化、可检查的干预机制,该机制基于激活空间的拓扑结构。
## 2相关工作
激活导向。由于其简单的思想,激活导向已成为微调的一种轻量级、推理时替代方案,使研究人员能够在前向传播过程中通过扰动内部表示来改变大语言模型(LLM)行为。在早期的基础工作中,人们证明线性干预,即向残差流添加固定的“导向向量”,可以改变模型的情感和对齐属性[15 (https://arxiv.org/html/2609.00597#bib.bib4)]。该技术自然地通过更先进的方法得到改进,例如对比激活添加(Contrastive Activation Addition, CAA),它通过平均配对正负提示之间的激活差异来隔离行为方向[14 (https://arxiv.org/html/2609.00597#bib.bib5)]。
最近的导向方法。最近,该领域已开始探索超越纯粹的加性平移偏移;例如,角度导向(Angular Steering)将行为控制框架化为在固定激活子空间内的旋转干预[16 (https://arxiv.org/html/2609.00597#bib.bib2)]。然而,虽然这些方法成功地操作了表征,但它们主要将激活空间视为具有相对简单的几何结构。这为拓扑导向等方法留下了空间,这些方法能够隔离并利用高维数据流形固有的复杂、全局和非线性不变性。
拓扑数据分析与持久同调。TDA为量化复杂高维数据集的“形状”提供了严格的数学框架。TDA最重要的方法之一是持久同调[10 (https://arxiv.org/html/2609.00597#bib.bib9), 7 (https://arxiv.org/html/2609.00597#bib.bib10)],它跟踪拓扑特征(如连通分量、一维环以及更高维空洞)在连续空间尺度范围内的演变。通过在点云上构建一系列不断扩展的单纯复形(例如Vietoris–Rips滤过),持久同调记录每个拓扑特征出现(出生)的尺度以及最终合并或闭合(死亡)的尺度。这些结构不变性在持久图(Persistence Diagram)中得到总结,提供了数据拓扑的多尺度特征。根据稳定性定理[8 (https://arxiv.org/html/2609.00597#bib.bib11)],持久图对噪声和数据流形内的连续几何变形具有鲁棒性。这就是为什么它们在机器学习中受到广泛研究的原因。
拓扑机器学习。将这些拓扑摘要整合到深度学习中导致了“拓扑机器学习”一词的出现。最初,主要关注点是改进持久图(PDs)。PDs本质上是离散的,为了使这些拓扑特征与标准神经网络兼容,研究人员开发了稳定的有限维向量化技术,最著名的是2015年的持久景观(Persistence Landscapes)[6 (https://arxiv.org/html/2609.00597#bib.bib12)]和2016年的持久图像(Persistence images)[1 (https://arxiv.org/html/2609.00597#bib.bib6)]。第二年,研究人员开发了可微拓扑层[11 (https://arxiv.org/html/2609.00597#bib.bib13), 5 (https://arxiv.org/html/2609.00597#bib.bib7)],允许模型在梯度下降过程中直接优化特定的拓扑属性。
尽管这些方法在理论上很优雅,但它们从根本上受到计算限制的约束。跟踪高维单纯形的组合爆炸,加上持久同调所需的昂贵矩阵约减算法,使其规模扩展性很差。因此,在大规模模型的迭代训练循环中计算这些拓扑惩罚变得极其缓慢且内存密集,从而阻碍了拓扑机器学习领域的发展。我们的方法通过将这些强大的拓扑工具的应用从训练时优化转向推理时激活导向,有效地绕过了历史上的计算障碍,使其重获新生。
## 3背景
本节介绍我们方法所使用的技术要素。我们首先形式化transformer计算和在推理时使用的激活导向干预。然后,我们回顾描述激活几何所需的拓扑知识:持久同调、持久图和Vietoris–Rips滤过。这些工具共同让我们能够将表示级干预(残差空间中的导向向量)与结构级摘要(跨尺度的拓扑特征)联系起来,这正是拓扑导向的核心视角。一些补充细节可以在附录A.1 (https://arxiv.org/html/2609.00597#A1.SS1)中找到。
### 3\.1Transformers与激活导向
在本文的其余部分,我们将固定一个仅解码器transformer的符号表示,它有L层,隐藏宽度d\_h,和token序列长度T。在层ℓ∈{0,...,L−1},我们有自注意力机制,记为Attn^(ℓ),其头维度为d\_k。
激活导向在推理时通过添加一个方向向量来修改所选层ℓ⋆和token位置t⋆(通常是最后一个提示token[17 (https://arxiv.org/html/2609.00597#bib.bib8), 14 (https://arxiv.org/html/2609.00597#bib.bib5), 15 (https://arxiv.org/html/2609.00597#bib.bib4)])处的内部残差激活:h\_{t⋆}^{(ℓ⋆)}' = h\_{t⋆}^{(ℓ⋆)} + α v,
其中:h\_{t⋆}^{(ℓ⋆)} ∈ ℝ^{d\_h} 是原始残差激活,v ∈ ℝ^{d\_h} 是导向向量,α ∈ ℝ 是一个标量导向强度。
### 3\.2持久同调、持久图与Vietoris–Rips滤过
持久同调是一种描述点云X(此处为激活向量)形状的多尺度方法。当我们改变距离尺度ε时,拓扑特征(连通分量、环等)出现并消失;对于特征i,我们用(b\_i, δ\_i)表示其出生和死亡,其持久性为π\_i = δ\_i - b\_i。具有更大π\_i的特征在不同尺度上更稳定,被认为具有更大的结构意义。
持久图(Persistence Diagram)是由持久同调返回的出生-死亡对集合D(X) = {(b\_i, δ\_i)}\_i。每个点对应一个拓扑特征,其到对角线(u, u)的距离(乘以一个常数因子)等于其持久性π\_i。在我们的方法中,这些图表总结了激活几何,并允许比较有害和无害的激活云团。
为了计算持久同调,我们根据成对距离构建Vietoris–Rips滤过。对于每个尺度ε,我们连接X中距离最多为ε的点,形成一个单纯复形VR\_ε(X)。随着ε增大,这些复形是嵌套的,跟踪这个嵌套序列的拓扑结构即可得到我们理论和实验中使用的出生/死亡对。
## 4拓扑导向
### 4\.1拓扑导向的动机
经典的激活导向通常使用一个全局对比方向v\_base = X̄⁺ - X̄⁻,其中X̄⁺和X̄⁻是有害和无害激活的类别均值。这只在限制性几何假设下(例如,近似单峰类别具有相似的协方差结构)是最优的,此时单个线性轴就能捕捉到相关的类别差异。
一个方便的方式是通过混合模型来看待这个问题。假设有害激活是多模态的:p⁺(x) = ∑\_{r=1}^{R} π\_r p\_r(x)相似文章
通过标题特定激活引导控制工具使用
本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。
FineSteer: 大规模语言模型推理时细粒度控制的统一框架
FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。
拓扑增强的大语言模型对齐:轨迹拓扑损失与拓扑偏好优化
本文介绍了一种用于大语言模型的拓扑增强对齐框架,利用基于持续同调的轨迹拓扑损失和拓扑偏好优化,对隐藏空间中的语义轨迹进行正则化。
视觉-语言-动作模型中的闭环神经激活控制
提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。