存在但重新调整尺度:加法激活引导从聊天到智能体的迁移

arXiv cs.LG 论文

摘要

本文首次系统研究了在单轮聊天中校准的加法激活引导如何迁移到使用工具的ReAct智能体。研究发现,尽管注入的方向在不同设定下几乎以全强度到达深层,但行为耦合在不同模型和上下文之间变化莫测,放大至2倍或衰减,带来即时安全担忧。

arXiv:2607.09156v1 Announce Type: new 摘要:加法激活引导(在生成过程中注入缩放后的残差流方向)几乎完全在单轮聊天中被校准,但其目标模型越来越多地被部署为使用工具的ReAct智能体。我们提出了首个关于加法激活引导从聊天到智能体迁移的系统性研究,将行为测量与信息匹配设计中的表征读出相结合:相同的项目呈现为纯聊天形式或ReAct工具使用片段,使用匹配范数随机方向控制,并且每轮重新编码转录以排除KV缓存污染。迁移是真实存在的但被重新调整了尺度,正确的描述是分离:注入的方向在所有测试设定和模型下几乎以全强度到达深层网络(三个模型家族的安装位置智能体/聊天比率为0.83-1.16),而行为耦合则因模型和上下文而重置。在Qwen2.5-7B上,拒绝绕过向量在智能体中放大(T = 1.45,CI [1.20, 1.78],N = 300);在一个统计功效充分的均匀协议分布上,耦合从放大(Gemma-2-9B T = 2.00)到衰减(Yi-1.5-9B T = 0.43,CI [0.29, 0.60]),没有通用常数,并且存在一个干净的唯一衰减器对抗通用符号。同一轴上的定向消融不放大(T = 0.93,CI包含1),而加法注入放大(T = 1.50),增益差异为20.1个百分点(CI [13.4, 26.8]),这识别出一个加法特有的机制。两个预注册的工具一致地将重新调整定位到ReAct格式脚手架,在任何工具观察之前,而不是稀释解释会预测的观察边界。安全影响是即时且不可预测的:智能体部署将基于引导的拒绝绕过放大至2.00倍,而其他模型则衰减,因此部署不能假设给定模型在加法引导下是安全的。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

# 存在但需重新缩放:从对话到智能体的附加激活引导迁移

来源: https://arxiv.org/html/2607.09156

###### 摘要

附加激活引导(在生成过程中注入一个缩放后的残差流方向)几乎完全在单轮对话中校准,但其目标模型越来越多地被部署为使用工具的 ReAct 智能体。我们首次开展了附加引导的系统性“对话到智能体”迁移研究,将行为测量与匹配信息设计中的表征读出相结合:相同的内容以纯文本对话或 ReAct 工具使用情节的形式呈现,并配有匹配范数的随机方向控制,每轮对话重新编码转录以排除 KV 缓存污染。迁移是真实存在的,但经过了重新缩放,正确的描述是一种解离:注入的方向以近乎满强度到达所有测试设置和模型的浅层(三个模型族的安装点智能体/对话比率为 0.83–1.16),而行为耦合则因模型和上下文而重置。在 Qwen2.5-7B 上,拒绝绕过向量在智能体中放大(T=1.45,置信区间 [1.20, 1.78],N=300);在一个有统计效力的统一协议分布中,耦合范围从放大(Gemma-2-9B: T=2.00)到衰减(Yi-1.5-9B: T=0.43,置信区间 [0.29, 0.60]),没有普遍常数,并且有一个单一的干净衰减器,其符号与普遍符号相反。同一轴的方向性消融不会放大(T=0.93,置信区间包含 1),而附加注入则会放大(T=1.50),相差 20.1 个百分点(置信区间 [13.4, 26.8]),这确定了一种附加特定机制。两项预注册工具收敛地将重新缩放定位到 ReAct 格式的框架,在任何工具观察之前,而不是观察边界——稀释假设会预测在那个边界发生重新缩放。其安全影响是直接的且*不可预测的*:智能体部署在某些模型上会将基于引导的拒绝绕过放大至 2.00 倍,而在另一些模型上则会衰减,因此部署方不能假定特定模型在附加引导下是安全的。

## 引言

附加激活引导通过对比具有特质表现和特质抑制补全的激活,提取模型残差流中的一个方向,然后在生成过程中注入该方向的缩放副本,以分级、可解释的方式改变行为 (Zou et al. 2023 (https://arxiv.org/html/2607.09156#bib.bib5); Turner et al. 2023 (https://arxiv.org/html/2607.09156#bib.bib7))。该技术无需权重更新,应用成本低廉,并已在拒绝、谄媚、诚实及广泛的人格特质上得到验证 (Arditi et al. 2024 (https://arxiv.org/html/2607.09156#bib.bib4); Panickssery et al. 2024 (https://arxiv.org/html/2607.09156#bib.bib6))。它作为部署时控制和监控原语,正越来越多地被用于安全应用。

几乎所有证据都来自单轮对话。而被引导的模型正越来越多地被部署为使用工具的 ReAct 智能体:它们在多轮中规划、调用外部工具、读取返回的观察结果,并在扩展的上下文中做出行动。一个智能体情节与对话回复在许多方面有所不同,这些差异对于附加控制方法并非中立:上下文更长,其残差流范数每轮对话都会增长;模型被呈现为结构化的 ReAct 格式而非自由形式的回复;真实的工具观察会注入可能与被引导倾向相悖的地面实况内容;行为承诺通常是在规划步骤而非最终的自然语言 token 中做出的。

一个对话校准的附加控制在相同模型以 ReAct 智能体运行时能否保持其行为抓力,这是一个尚未解决且具有实践重要性的问题。

为什么三个相近的结果不能回答它。首先,拒绝方向的*消融*(一种破坏性权重编辑)已知会迁移到智能体 (Lermen et al. 2024 (https://arxiv.org/html/2607.09156#bib.bib11)):一个经过拒绝消融的模型会完成有害的智能体任务。消融是永久性移除方向,并且不会与增长中的上下文范数竞争;而附加注入会竞争,这就是为什么附加情况不能从消融结果中推断出来。其次,人格引导在多轮*对话*中会因 KV 缓存污染而退化 (Kang et al. 2026 (https://arxiv.org/html/2607.09156#bib.bib14))。我们的循环每轮都从头重新编码完整转录,从而排除了该机制。第三,附加引导已被应用于*智能体循环内部*,其方向是在智能体上下文中提取的 (Yap 2026 (https://arxiv.org/html/2607.09156#bib.bib12));这里的新颖之处在于*从聊天到智能体*的迁移,具有匹配的聊天基线以及表征级别的读出和行为测量。

我们的方法。我们使用一个匹配信息的五级阶梯(C0–C4),该阶梯保持有害指令逐字节相同,仅改变部署封装:从纯文本单轮对话(C0)到带有真实确定性工具的多轮 ReAct(C3)。我们在表征路径上安装一个只读投影钩子(位于浅层读取层),测量在行为无关的安装点上,有多少注入的方向存活到智能体的残差流中。我们在行为路径上应用一个设置不变的、基于解析器的度量,该度量在所有阶梯上以相同方式应用于自然语言输出。并且我们在每个行为结果上都附加一个匹配范数的随机方向带:五个随机单位向量在相同注入系数下不能产生可比效果,从而使方向特异性成为一道关卡而非观察结果。

标题性发现:一种解离。引导效应的表征和行为分支出现了分离。注入的方向在几乎所有测试的设置和模型中,以近乎满强度或高于对话强度的水平存活于从聊天到智能体的迁移中:三个模型族(Qwen2.5-7B、Llama-3.1-8B、Gemma-2-9B-IT)的安装点智能体/对话比率在 0.83–1.16 之间。然而,存活方向所带来的行为耦合被部署上下文和模型重置。在 Qwen2.5-7B 上,拒绝绕过被放大(T=1.45,置信区间 [1.20, 1.78],N=300);一个在无害提示上诱导拒绝的方向至少被放大 3.68 倍(下界,智能体臂上限)。在 Llama-3.1-8B 上,拒绝放大效应缺失。一个有统计效力的统一协议分布将此按模型重置的现象强化为一个双向结果。在一个设计上运行族名单(绕过臂,N=200 条,AUC 覆盖亚饱和剂量网格,匹配范数随机带,每轮重新计算 KV),智能体耦合范围包含从干净放大(Gemma-2-9B:T=2.00,置信区间 [1.68, 2.43];Qwen2.5-7B:T=1.41)、通过边界簇(Qwen2-7B、OLMo-2-7B、Starling-7B,置信区间均包含 1)到干净衰减(Yi-1.5-9B:T=0.43,置信区间 [0.29, 0.60]):耦合因模型而异,没有普遍常数*或符号*。基线拒绝接近天花板或地板的模型族使剂量-反应饱和,没有亚饱和窗口,因此报告为关卡失败:这是一种对齐几何的表征,而非耦合结果。

我们进一步证明放大是附加机制所特有的。在相同项目的相同拒绝轴上,方向性消融不会放大,而附加注入则会放大,两者相差 20.1 个百分点(置信区间 [13.4, 26.8]),这在 Llama 上以相同符号得到复制。

两项预注册工具将行为重新缩放定位到模型在任何工具观察之前读取的 ReAct 格式框架,而非稀释解释会预测的观察边界。激活移植表明耦合不能归于静态的预填充状态;它需要在每个生成步骤持续重新断言。

贡献总结:(1) 一个针对附加引导的匹配信息、缓存排除、随机对照的“聊天到智能体”迁移协议;(2) 在三个模型族上测量的表征存活/行为耦合解离;(3) 一个设置内附加与消融的不对称性(20.1 个百分点的增益差距);(4) 一个有统计效力的统一协议耦合分布,范围从放大(Gemma-2-9B:T=2.00)到衰减(Yi-1.5-9B:T=0.43),确立了没有普遍耦合常数,并通过对一个干净衰减器的观察,确立了没有普遍符号;(5) 两项工具收敛地将重新缩放定位到框架启动而非工具观察;(6) 一个预注册的符号机制测试,缩小了耦合符号问题;(7) 一个与安全相关的重要发现:智能体部署在某些模型上将危险方向放大多达 2.00 倍,但在其他模型上却使其衰减,因此,在附加引导下的部署安全性不能假定在不同模型之间迁移。

## 相关工作

附加引导。Zou 等人 (2023 (https://arxiv.org/html/2607.09156#bib.bib5)) 的表征工程配方确立了均值差异提取和附加注入;Panickssery 等人 (2024 (https://arxiv.org/html/2607.09156#bib.bib6)) 将其应用于人格特质,Arditi 等人 (2024 (https://arxiv.org/html/2607.09156#bib.bib4)) 将其应用于拒绝(用于推理时控制和消融)。Persona-vectors work (Chen et al. 2025 (https://arxiv.org/html/2607.09156#bib.bib8); Moskvoretskii et al. 2026 (https://arxiv.org/html/2607.09156#bib.bib9)) 提出将聊天提取的向量用作部署监控和控制原语;我们测试控制部分能否在从聊天到智能体的迁移中存活,并量化重新缩放。Tan 等人 (2024 (https://arxiv.org/html/2607.09156#bib.bib10)) 记录了聊天中引导的分布外脆弱性,我们将其扩展到智能体部署上下文中。

引导的智能体部署。Lermen 等人 (2024 (https://arxiv.org/html/2607.09156#bib.bib11)) 表明拒绝方向的*消融*会迁移到 Llama-3.1-8B 智能体;该工作以及使用智能体原生向量的智能体内附加引导 (Yap 2026 (https://arxiv.org/html/2607.09156#bib.bib12); Chen et al. 2026 (https://arxiv.org/html/2607.09156#bib.bib23)) 均未测量聊天提取向量的聊天到智能体迁移与匹配的聊天基线和行为耦合比率。并行的 AgentLens (Luo et al. 2026 (https://arxiv.org/html/2607.09156#bib.bib13)) 构建了智能体内安全引导子空间,但没有聊天对比,而工作流级别的智能体越狱通过提示分解而非引导达到相同的“聊天中拒绝但作为智能体运行”结论 (Kumar and Maple 2026 (https://arxiv.org/html/2607.09156#bib.bib25))。我们的贡献在于迁移比率本身。

多轮上下文中的退化。Kang 等人 (2026 (https://arxiv.org/html/2607.09156#bib.bib14)) 表明人格引导在多轮*对话*中会因 KV 缓存污染而退化。我们通过每轮重新编码完整转录排除了这一渠道,并将我们的重新缩放定位到单轮启动而非多轮累积。

输出级和机制性解释。信念动力学解释 (Bigelow et al. 2025 (https://arxiv.org/html/2607.09156#bib.bib15)) 预测上下文仅通过基线偏移进入,意味着 T=1;我们在拒绝诱导臂上反驳了这一点(67 个百分点的差距),同时它与谄媚保持兼容(正式结果是跨行为交互)。Zhong 和 Li (2026 (https://arxiv.org/html/2607.09156#bib.bib17)) 表明拒绝在人格之后被门控,这与我们的框架启动定位一致;Galeone 等人 (2026 (https://arxiv.org/html/2607.09156#bib.bib16)) 发现检测和干预方向在聊天中是正交的,这是上下文内差距与我们部署上下文差距的不同;Fomin 等人 (2026 (https://arxiv.org/html/2607.09156#bib.bib19)) 以及 Walsh 和 Barkett (2026 (https://arxiv.org/html/2607.09156#bib.bib22)) 均发现内部信号可以解码但不驱动行为,这佐证了我们解离的解码方面,我们将其定位于聊天到智能体的转变。Cristofano (2026 (https://arxiv.org/html/2607.09156#bib.bib24)) 跨模型迁移共享的拒绝电路,而我们的轴则是相同模型的聊天到智能体耦合,它没有普遍符号。Deng (2026 (https://arxiv.org/html/2607.09156#bib.bib20)) 形式化了叠加上的范数积累限制,这是我们的能力匹配控制(通过消除通用退化)所排除的竞争范数来源。

## 实验设计

### 模型

主要模型:Qwen2.5-7B-Instruct (Team 2025 (https://arxiv.org/html/2607.09156#bib.bib1)),即人格向量工作中使用的模型 (Chen et al. 2025 (https://arxiv.org/html/2607.09156#bib.bib8)),支持直接复制。跨模型复制:Llama-3.1-8B-Instruct (Meta AI 2024 (https://arxiv.org/html/2607.09156#bib.bib2))。跨族泛化:Gemma-2-9B-IT (Google DeepMind 2024 (https://arxiv.org/html/2607.09156#bib.bib3))。统一协议分布:一个八族名单加上一个尺度轴补充(下面的按模型分布)。所有模型通过 PyTorch 在进程内运行并带有前向钩子;vLLM 不用于任何引导模型(钩子访问需要进程内生成)。主要族权重固定到修订 SHA(记录在 `configs/provenance.yaml` 中)。

### 引导向量

我们提取 128 个有害与 128 个无害的最后 token 激活的均值差异残差流方向,遵循 Arditi 等人 (2024 (https://arxiv.org/html/2607.09156#bib.bib4)) 用于拒绝,以及 Panickssery 等人 (2024 (https://arxiv.org/html/2607.09156#bib.bib6)) 用于谄媚。钩子在前向传播的每个 token 位置(或在相位定位实验中的受限相位)注入缩放后的方向。一个钩子健全性检查(目标层处的最大 |Δlogit|)在每个行为运行前验证注入;非零系数下的非零检查确认钩子处于活动状态。

### 匹配信息阶梯

参考图注 图 1:设置示意图。一个聊天提取的方向 v(以及一个匹配范数的随机对照 r)在层 L 上被添加到模型的生成位置。相同内容以纯文本对话 (C0) 和带有真实工具的 ReAct 情节 (C3) 呈现,即匹配信息阶梯的端点。每个单元以两种方式读取:读分支(残差投影到 v)和写分支(评分器评估的迁移比率 T)。为了将部署上下文效应与表面格式效应分离,我们构建了一个五级阶梯(图 1 (https://arxiv.org/html/2607.09156#Sx3.F1)),保持有害指令逐字节相同,仅改变封装:

- • C0:纯文本单轮对话。
- • C1:多轮对话,无工具(相同语义内容,两轮)。
- • C2:ReAct 格式,带占位符工具调用;无真实工具调度。
- • C3:ReAct 格式,带真实确定性工具:返回常数值的查找,因此工具调用成功是固定的,不会混淆行为度量。
- • C4:为外部基准(tau2-bench)保留。

主要比较是 C0 与 C3。C2 将格式框架与观察插入分离开来。C1 确认简单的多轮上下文不是驱动因素。

### 设置不变的度量

对话回复和 ReAct “思考” token 不能直接比较任务成功。我们在每个阶梯上以相同方式对模型的自然语言输出进行评分:一个经过验证的基于解析器的二元指标(对于拒绝为拒绝/顺从;对于谄媚为同意/不同意)。...(由于原文截断,此处翻译停止)。

相似文章

提示-激活对偶性:通过注意力层干预改进激活引导

Hugging Face Daily Papers

本文识别出KV缓存污染是对话中激活引导的一种失败模式,并提出了GCAD方法,该方法从提示贡献中提取引导信号,并应用词元级门控来改进长程连贯性,在多轮基准上取得了显著提升。

通过标题特定激活引导控制工具使用

arXiv cs.AI

本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。

角度-范数分解下的激活转向几何解释

arXiv cs.AI

本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。

超越引导向量:用于推理时干预的基于流的激活引导

arXiv cs.CL

本文介绍了 FLAS,这是一种基于流的激活引导方法,通过学习概念条件化的速度场,在推理时引导语言模型的激活。在 AxBench 基准测试中,FLAS 是首个无需针对特定概念进行微调,即可在未见概念上持续优于上下文提示(in-context prompting)的学习型方法。

视觉-语言-动作模型中的闭环神经激活控制

arXiv cs.AI

提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。