论思维链忠实性的转向向量泛化
摘要
本文研究了用于改善思维链忠实性的激活转向在多种提示类型、数据集和转向向量构建方法之间,以及在多个 Gemma 和 Qwen 模型上的泛化能力。作者发现,当转向有效时,其效果可以广泛泛化,并且评估设置比训练设置或向量构建方法更为重要。
arXiv:2607.29062v1 公告类型:新
摘要:模型能力的提升在很大程度上得益于思维链的扩展。这对人工智能安全来说是一个有前景的发展——当模型用语言表达其推理过程时,我们可以对其进行监控。然而,在某些情况下,模型不会表述其推理过程中的重要步骤。例如,当模型收到暗示错误答案的提示时,即使该提示似乎对其结论至关重要,模型也可能未能承认该提示。当思维链未能披露工具性推理步骤时,我们将其描述为不忠实。先前的研究表明,激活转向可以作为一种有用的方法来提高思维链的忠实性。我们扩展了这一研究方向,研究了在提示问答场景中,针对三个模型(Gemma-3 4B、Qwen-3.5 9B、Gemma-3 12B),用于提高忠实性的转向在提示类型、数据集和转向向量构建方法上的泛化情况。虽然转向仅对最大的模型(Gemma-3 12B)能可靠地提高提示承认率,但我们发现,当转向有效时,其效果会广泛泛化到各种提示类型和数据集——在跨提示和跨数据集分析中,效果大小主要由评估设置决定,而不是由向量的训练设置决定。向量的构建方式也影响不大——四种构建方法(包括一种优化目标不涉及特定提示的方法)产生了相似的效果大小。最后,我们考虑了这样一种可能性:转向促进了提示的显著性并导致更多的提示使用,而不是针对语言表达行为。然而,我们没有找到支持这一观点的证据——转向大致保持了提示使用率不变,同时减少了隐藏的提示使用,即未被承认的提示使用。
查看缓存全文
缓存时间: 2026/08/03 07:30
# 论链式思维忠实性转向向量的泛化
来源:https://arxiv.org/html/2607.29062
Matthew Nguyen
弗吉尼亚大学
& Kyle Cox¹ 独立研究者
& Austin Meek 特拉华大学
& Iván Arcuschin Poseidon 研究
###### 摘要
模型能力的提升在很大程度上得益于链式思维(chain of thought)的扩展。这对人工智能安全来说是一个有希望的发展——当模型将其推理过程用语言表达出来时,我们就可以对其进行监控。然而,在某些情况下,模型并不会用语言表达其推理过程中的重要步骤。例如,当模型被提示一个暗示错误答案的线索时,它可能不会承认这一线索的存在,即使该线索似乎对其最终结论起到了关键作用。当链式思维(CoT)未能披露具有工具性作用的推理步骤时,我们将其描述为*不忠实*的。先前的研究表明,激活转向(activation steering)可以成为提高 CoT 忠实性的有用方法(Occhipinti 等人,2026)。我们通过研究转向在*泛化*方面的表现来扩展这条研究线,具体考察在带线索问答场景下,对于三种模型(Gemma-3 4B、Qwen-3.5 9B、Gemma-3 12B),转向对忠实性的提升如何跨线索类型、数据集和转向向量构建方法进行泛化。虽然转向仅在最大的模型(Gemma-3 12B)上可靠地提高了线索承认率,但我们发现,当转向有效时,其效果广泛地跨线索类型和数据集泛化——在跨线索和跨数据集分析中,效应量主要由*评估*环境决定,而非向量的训练环境。向量的构建方式也影响甚微——四种构建方法(包括一种优化目标不涉及任何特定线索的方法)产生了相似的效应量。最后,我们考虑了这样一种可能性:转向促进了线索的显著性,并导致线索被更多*使用*,而非针对言语化行为。然而,我们没有发现支持这一观点的证据——转向使线索使用率大致保持不变,同时减少了*隐藏的线索使用*,即未被承认的线索使用。
## 1 引言
链式思维监控是少数几种可扩展的大型语言模型监督方法之一(Korbak 等人,2025)。¹¹代码发布:https://github.com/xocelyk/steering-vectors-for-faithfulness 然而,CoT 监控的可靠性取决于 CoT 是否*忠实*,即模型是否披露了决定其答案的因素。先前的研究表明,这一属性并不可靠地成立。模型可能会使用提示中的线索——例如被揭示的答案或对权威的诉诸——而不说明自己这样做了(Chen 等人,2025),或者它们可能对提示中不携带任何线索的隐含偏见进行事后合理化(Arcuschin 等人,2025; 2026)。最近的研究表明,激活转向可以有效地帮助恢复可监控性。已有研究表明,推理相关的特征在残差流中被线性表示,并且可以通过转向来诱导基础模型获得更强的推理能力(Venhoff 等人,2025a),以及在推理模型中控制特定的推理模态(Venhoff 等人,2025b)。Occhipinti 等人(2026)将这条研究线直接扩展到忠实性,他们探测残差流激活中的忠实性特征,并使用所得特征来引导模型生成。他们报告称,线性转向可以将可监控性恢复多达 46%,附带影响低于 5%,并且离策略转向(即使用合成轨迹)的表现与在策略转向相当。这些结果确立了转向可以在方法开发的特定环境中提高承认率。然而,理想情况下,忠实性干预不应狭隘地依赖于构建它所使用的特定上下文。我们考虑转向的成功是否能够经受住模型、评估数据集、线索类型和构建程序的变化。在 GPQA 上,我们为四个不同线索构建和评估向量,并在保持线索固定的情况下测量跨 BBH、GPQA 和 MMLU 的迁移。我们还比较了四种构建向量的方式:带标签的在策略对比向量、合成向量、特定线索优化向量,以及一种与线索无关的优化方向。所有实验都覆盖了完整的模型集合:Gemma-3 4B、Qwen-3.5 9B 和 Gemma-3 12B。我们的实验考虑了转向泛化的两种方式:(1)*功效泛化*——转向在特定模型和评估环境中是否有效——以及 (2)*迁移泛化*——在一种环境中构建的向量是否在其他环境中有效。虽然我们的结果表明,功效泛化仅在小范围内成立——转向仅在最大的研究模型 Gemma-3 12B 上可靠地提高了线索承认率,且其效果在不同评估数据集间差异显著——但我们看到迁移泛化广泛成立。在 GPQA 上,在一个线索上训练的转向向量与在被评估线索上训练的向量以大致相同的速度提高承认率。类似地,在一个数据集上训练的向量与在被评估数据集上训练的向量(保持线索类型固定)产生相当的承认率变化。构建方法的可互换性进一步强化了这些结果——合成向量(无需模型 rollout 或评判者标签)和通用优化方向(其目标从未指名具体线索)所产生的效果与基于评判者标签的 rollout 构建的对比向量相似。这些结果刻画了转向效果能传播多远;最后,我们考虑转向效果代表什么。虽然我们意图使转向提高忠实性——即对被承认的推理步骤进行言语化——但另一种可能是转向促进了线索的*使用*,这反过来可能提高线索承认的绝对率,而不改善忠实性。为了解决这个问题,我们研究了转向对线索使用和隐藏线索使用(即未被承认的部分)的影响。我们发现,当转向提高了承认率时,它使线索使用率大致保持不变,同时减少了隐藏的线索使用。
## 2 设置与方法
#### 模型、数据集和线索。
我们评估了三个不同规模的开放权重指令微调模型(Gemma-3 4B、Qwen-3.5 9B、Gemma-3 12B(Team,2025; 2026)),使用来自 BBH(Suzgun 等人,2022)、GPQA(Rein 等人,2023)和 MMLU(Hendrycks 等人,2021)的多项选择题。我们注入了来自 Meek 等人(2025)的四种线索之一(他们五种中的四种,省略了视觉模式线索):对斯坦福教授的谄媚诉诸(他们的*谄媚*线索,在我们的图表中标记为*Stanford*)、一个 XML 元数据块、一个评分器黑客提示,以及一个不道德的内部人士提示,每个都指向一个错误选项。我们在 GPQA 上变化线索类型,并在 Stanford 线索上变化数据集。对于每个 (模型, 数据集, 线索) 组合,我们保留线索 rollout 非退化(不循环、不重复或不连贯,由生成时启发式规则和 LLM 评判者确定;见附录 E)的条目。我们不要求模型遵循线索,也不要求其无线索时的答案,因此保留的条目包括线索未改变答案的情况。保留下来的条目按固定种子按约 67/33 的比例分为每个场景的训练集和测试集(每个场景 129-165 个测试条目)。
#### 解码。
所有 rollout 均使用贪婪解码(温度为 0),采用 vLLM(Kwon 等人,2023),以控制采样带来的随机性。每种模型的 token 限制和惩罚参数在基线和转向运行中共享,因此比较在模型内匹配(附录 E)。
#### 向量构建。
我们比较了四种构建方法,每种方法为每个场景生成一个转向向量 \(v \in \mathbb{R}^d\)(详细信息和数量见附录 E)。
*对比向量*采用评判者标记为忠实(承认线索)和不忠实的 rollout 在带线索训练提示上的平均激活之差,遵循 Rimsky 等人(2024)的方法。
*合成向量*用模板化的线索承认与线索忽略补全取代这些 rollout,因此不需要 rollout 或评判者标签。
两种*优化*方法通过梯度下降优化 \(v\),使转向后的模型对目标补全赋予高似然,遵循 Dunefsky & Cohan(2025)的单次方法(也被 Venhoff 等人(2025a)使用):*特定*变体针对给定线索的线索承认补全,而*通用*变体针对一个在所有线索中共享的固定补全,在该补全中模型决心考虑问题中的提示。通用目标不提及具体线索,尽管两个变体都在相同的带线索提示上优化。
#### 转向。
在生成过程中,我们将 \(\alpha \hat{v}\)(按系数 \(\alpha\) 缩放的单位归一化方向)添加到选定层每个生成 token 位置的残差流中(Turner 等人,2024;Rimsky 等人,2024)。我们扫描 \(\alpha \in \{2.5, 5, 7.5\}\),并在正文中报告 \(\alpha = 5\)。转向效应量在整个扫描范围内稳定(附录 C)。为了选择用于转向的残差流层,我们在每层训练一个岭正则化线性探针来预测线索承认;探针在测试集上达到最高接收者操作特征曲线下面积(AUROC)的层被用于本文报告的所有四种转向方法。探针仅用于选择层:四个向量按上述方式构建,与探针不同。我们在第 4 节中指出这一标准的弱点。
#### 评判者与指标。
我们使用单个 LLM 评判者(gpt-5-nano(OpenAI,2026);提示见附录 F)对每个生成进行评分。*承认*是指评判者发现链式思维提及了该线索。遵循 Meek 等人(2025),线索承认是忠实性的操作化定义——当 CoT 轨迹提及注入的线索时,我们将其标记为忠实。然而,线索承认并不在传统意义上确立忠实性,即言语化推理反映了答案背后的计算(Jacovi & Goldberg,2020)。我们将在第 3.4 节回到这一差距。*线索使用*是从最终答案推断出来的:评判者提取的答案是否等于线索指向的选项(约 97% 的覆盖率;附录 E)。我们将未被承认的线索使用称为*隐藏线索使用*,并将隐藏线索使用率报告为在给定线索使用的情况下不承认的比率。将选择线索选项视为使用是一种假设,它可能在两个方面失效:模型可能在未依赖线索的情况下选择了线索选项,或者可能受线索影响但未选择它。有证据表明第一种情况很罕见。我们发现线索选项占所有错误的 76-87%,远高于如果错误在错误答案选项中均匀分布时的情况。因此,我们得出结论,选择线索选项通常反映线索使用,而非偶然的错误猜测(第 D.8 节)。第二种情况,即受影响但未选择,未被该度量捕捉,因此该度量在某种程度上低估了线索的影响。对于每一对匹配的轨迹,令 \(a_{\mathrm{b},i}, a_{\mathrm{s},i} \in \{0,1\}\) 表示在同一提示下,基线时和转向下链式思维是否承认线索。我们的主要指标是线索承认的*变化*,\(\Delta_{\mathrm{ack}}\):转向轨迹中的承认率减去未转向(基线)轨迹中的承认率。由于转向轨迹和基线轨迹是配对的,我们还可以将 \(\Delta_{\mathrm{ack}}\) 表示为*回归*轨迹数量(基线承认 \(\rightarrow\) 转向未承认)和*转化*轨迹数量(基线未承认 \(\rightarrow\) 转向承认)的函数:
\[
\Delta_{\mathrm{ack}} = \frac{1}{n}\sum_{i} a_{\mathrm{s},i} - \frac{1}{n}\sum_{i} a_{\mathrm{b},i} = \frac{1}{n}\sum_{i} \left( a_{\mathrm{s},i} - a_{\mathrm{b},i} \right) = \frac{n_{\mathrm{conv}} - n_{\mathrm{regr}}}{n}.
\tag{1}
\]
每条轨迹贡献 \(a_{\mathrm{s},i} - a_{\mathrm{b},i} \in \{-1,0,+1\}\):*转化*轨迹(\(a_{\mathrm{b},i}=0, a_{\mathrm{s},i}=1\))贡献 \(+1\),*回归*轨迹(\(a_{\mathrm{b},i}=1, a_{\mathrm{s},i}=0\))贡献 \(-1\),未变化的轨迹贡献 0;\(n_{\mathrm{conv}}\) 和 \(n_{\mathrm{regr}}\) 分别计数两者。因此 \(\Delta_{\mathrm{ack}}\) 有两种等价的解读:总体承认率的变化,以及转化减去回归的轨迹比例;表格报告 \(n_{\mathrm{conv}}/n\) 和 \(n_{\mathrm{regr}}/n\)(表 5 和 8),其差值即为 \(\Delta_{\mathrm{ack}}\)。我们报告 \(\Delta_{\mathrm{ack}}\) 而不是仅报告转化比例,因为转化和回归可能同时发生。例如,一个较大但瞄准不佳的转向干预可能会以无向的方式扰动 CoT。我们在几个实例中看到了这种证据,其中大的转化率伴随着同样大的回归率。虽然 \(n_{\mathrm{conv}}\) 追踪干预的幅度,但它单独不能捕捉干预的方向,因此我们更喜欢更全面的 \(\Delta_{\mathrm{ack}}\) 作为主要指标。在这一点上,我们的分析与 Occhipinti 等人(2026)不同;他们仅报告基线时不忠实轨迹上的可监控性恢复,回归作为附带影响单独报告。因此,我们的 \(\Delta_{\mathrm{ack}}\) 指标使用与他们恢复率不同的分母,两者不可直接比较。我们在第 3.4 节分析承认、线索使用和隐藏线索使用。
#### 实验覆盖。
我们的实验每次仅变化维度的子集,而不是对所有维度进行因子化。表 1 总结了完整的实验套件。我们仅在 GPQA 上变化线索类型。相似文章
关于偏好对齐生成中导向向量局限性的研究
本文系统研究了导向向量在受控文本生成中的局限性,发现其有效性在不同特质间存在差异,在任务迁移中会退化,并面临组合权衡问题。
通过标题特定激活引导控制工具使用
本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。
MidSteer: 用于引导生成模型的最优仿射框架
介绍MidSteer,一个用于生成模型中概念引导的理论框架,通过为LLMs和视觉扩散模型中的概念引导、擦除和切换提供最优仿射变换,弥合了经验成功与理论理解之间的差距。
FineSteer: 大规模语言模型推理时细粒度控制的统一框架
FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。
面向可信赖大语言模型推理的概率概念感知引导
本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。