可解码但无法通过固定残差流线性转向纠正:来自医疗大语言模型失效模式的证据
摘要
本文研究了大语言模型隐藏状态中线性可解码的失效信号是否可以通过残差流转向进行纠正。研究发现,虽然“过度思考”失效模式是可解码的,但由于其与任务关键计算的表示纠缠,固定的线性转向未能纠正这些失效,尽管探测探针有效地支持了选择性拒绝回答。
arXiv:2605.05715v1 宣布类型:新文章
摘要:大语言模型隐藏状态中的线性可解码失效信号能否被用来纠正这些失效?我们通过过度思考(Overthinking, OT)研究了这种分类与纠正之间的差距——这是一种在医疗问答中稳定的行为模式(Jaccard 相似系数 >= 0.81,标注者间一致率为 94%),在该模式下,模型在重采样时能给出正确答案,但在扩展的思维链中却会失败。OT 在平衡准确率上达到了 71.6% 的线性可解码性(p < 10^{-16})。然而,五类固定线性转向方法(29 种配置,n=1,273)均产生了 Delta ~= 0 的结果,且在跨架构(Qwen2.5-7B)和跨领域(MMLU-STEM)实验中得出了相同的无效结果。三条趋同的证据线表明存在表示纠缠:OT 方向与任务关键计算的重叠度为 85-88%(特异性比率 <= 0.152);非目标共享方向转向会损害准确率(-12.1pp);LEACE 概念擦除也会降低准确率(-3.6pp,p=0.01),而 10 次随机擦除则产生 Delta=+0.3pp。实例级别的探针-转向相关性为 r=-0.002(p=0.97)。积极的一面是,相同的探针能够实现选择性拒绝回答(留出集 AUROC=0.610,优于所有五个不确定性基线,p=0.009):可解码的失效结构支持生成后的可靠性估计,即使固定线性转向族无法利用它进行纠正。
查看缓存全文
缓存时间: 2026/05/08 08:38
# 可解码但无法通过固定残差流线性 Steering 纠正:来自医学 LLM 失败模式的证据 来源:https://arxiv.org/html/2605.05715 ###### 摘要 大语言模型(LLM)隐藏状态中可线性解码的失败信号能否被利用来纠正这些失败?我们通过研究“过度思考”(Overthinking, OT)来探讨这一*分类-纠正差距*(classification-correction gap)。OT 是医学问答中的一种稳定行为模式(Jaccard ≥ 0.81,标注者间一致性为 94%),表现为模型在重采样时能给出正确答案,但在扩展的思维链(chain-of-thought)中却会失败。OT 可被线性解码,平衡准确率为 71.6%(p ≈ 10⁻¹⁶)。然而,五类固定线性 steering 方法(29 种配置,n=1,273)均产生 Δ≈0 的结果,且在跨架构(Qwen2.5-7B)和跨领域(MMLU-STEM)测试中均得到相同的无效结果。三条相互印证的研究线索指向*表征纠缠*(representational entanglement):OT 方向与任务关键计算的重叠率达到 85–88%(特异性比率 ≤ 0.152);非靶向的共享方向 steering 会降低准确率(-12.1 个百分点);而 LEACE 概念擦除也会降低准确率(-3.6 个百分点,p=0.01),相比之下,10 次随机擦除产生的变化为 Δ=+0.3 个百分点。实例级探针-steering 相关性为 r=-0.002(p=0.97)。积极的一面是,同一探针支持选择性拒绝回答(留出集 AUROC = 0.610,优于所有五个不确定性基线,p=0.009):即使固定线性 steering 无法利用可解码的失败结构进行纠正,该结构仍支持生成后的可靠性估计。 可解码但无法通过固定残差流线性 Steering 纠正:来自医学 LLM 失败模式的证据 Ming Liu Amazon [email protected] ## 1 引言 激活 steering(activation steering)——在激活空间中添加方向以修改模型行为——在处理拒绝(Arditi et al., 2024)和情绪(Turner et al., 2024)等二元行为属性时取得了成功。但这是否扩展到纠正多步推理失败?思维链提示(Wei et al., 2022; Kojima et al., 2022)实现了多步推理,但也引入了与生成长度相关的失败模式(Turpin et al., 2023; Lanham et al., 2023);事实上,Huang 等人(2024)表明,LLM 在没有外部反馈的情况下无法自我纠正推理。我们使用医学问答作为受控测试平台:它需要多步推理,失败具有独特的语义特征,且多选题格式提供了明确的评估终点。 我们关注一个具体的实证问题:*当模型经常能正确回答,但有时因扩展推理而失败时,这种底层行为模式的表征结构能否被利用来进行激活 steering?* 我们通过系统性调查来解决这个问题,主要有以下四点贡献: 1. **行为模式识别**。我们确定了*过度思考*(Overthinking, OT)——即模型在替代采样轨迹中经常给出正确答案,但产生不正确的长推理输出——作为一个稳健的行为构念,在阈值扰动、长度回归和提示末尾探针下保持稳定(第 3 节)。 2. **几何分析**。二元 OT 与非 OT 分类达到 71.6% 的准确率(虽然 modest 但高度可靠;p ≈ 10⁻¹⁶),在 Qwen2.5-7B 上以及跨域迁移到 MMLU-STEM 上的支持证据表明(可解码性和 steering 失败),OT 特有的特异性比率仅为 0.119(88% 的信号与任务相关方向共享),且概念擦除会损害准确率(-3.6 个百分点,p=0.01),这提供了因果证据,证明可解码信号与任务计算纠缠,而不仅仅是相关。 3. **实证分类-纠正差距**。在 Llama-3.1-8B 上,五类固定线性 steering(对比性、探针引导、多层、提示末尾和子空间;共 29 种配置,n=1,273)产生 Δ≈0,而共享方向 steering(-12.1 个百分点)和均值差分概念擦除(-3.6 个百分点,p=0.01;方向特定 vs 随机擦除)损害准确率——这与失败模式信息与任务相关计算共存一致。Qwen2.5-7B(9 种配置)、MMLU-STEM(4 种配置)以及包括自我细化和言语化置信度在内的十个提示基线均符合这一模式。拒绝 steering 对照验证了实现效果(p=0.008,单侧)。 4. **生成后可靠性估计**。同一结构支持单次生成后的选择性拒绝:正确性探针(第 21 层,通过 32 层扫描的留出集 AUROC 选择)在留出集测试中达到 AUROC = 0.610(留出集:0.716;泛化差距主要由温度驱动),优于所有五个测试的单次前向传递不确定性基线(ΔAUROC = 0.041,p=0.009;Holm rank-1 阈值 = 0.010)。即使当线性*写入*不起作用时,*读取*表征仍具有操作价值——即使探针成功且可跨域迁移,也不意味着可 steering。 ## 2 相关工作 #### 线性方向可以 steering 二元行为属性,但不稳定。 表征工程(Zou et al., 2023)表明,线性方向对应于可解释的概念。推理时干预(Li et al., 2023)、激活加法(Turner et al., 2024)、对比激活加法(Panickssery et al., 2023)、均值中心化变体(Jorgensen et al., 2023)以及通过稀疏自动编码器进行的特征钳位(Templeton et al., 2024; Cunningham et al., 2023)展示了在二元行为特征(拒绝、情绪、奉承 Sharma et al., 2024)和上下文任务身份(Todd et al., 2024)上的成功 steering,而模型编辑(Meng et al., 2022)则修改了局部事实关联。层对比解码(Chuang et al., 2024)提供了一种替代的推理时干预方法,通过利用逐层知识成熟度来提高事实性。表征微调(Wu et al., 2024)则在冻结的表征上*学习*针对性干预。然而,越来越多的证据揭示了系统性的 steering 失败:Da Silva 等人(2025)发现来自 14 个系列的 36 个模型之间存在巨大差异;Braun 等人(2025)记录了在所有层中都无法 steering 的概念;McKenzie 等人(2026)发现了主动抵消干预的内生抵抗电路;Zur 等人(2025)表明,一旦模型承诺了推理路径,即使隐藏状态仍编码不确定性,steering 也会失败。Jafari 等人(2026)提出了预测有效性先验的机械指标,而 Billa(2026)形式化了一个三阶段框架,其中一些概念被证明在任何线性干预的范围之外。 #### 但探测到的信息不一定具有因果效力。 线性表征假设(Park et al., 2024; Marks and Tegmark, 2024; Nanda et al., 2023; Hernandez et al., 2024)和探针方法(Alain and Bengio, 2017; Belinkov, 2022; Hewitt and Liang, 2019)确立 LLM 编码了丰富的结构——包括正确性信号(Azaria and Mitchell, 2023; Burns et al., 2023)——但探测到的信息是否被*因果地*使用仍存在争议(Elazar et al., 2021; Ravfogel et al., 2022)。Deng 等人(2025)认为混淆偏差可能导致探针找到相关而非因果方向;然而,我们的 LEACE 擦除结果(-3.6 个百分点损害,方向特定)排除了纯相关解释,转而支持与任务计算的因果纠缠。概念擦除方法——INLP(Ravfogel et al., 2020)、RLACE(Ravfogel et al., 2022)、LEACE(Belrose et al., 2023)——和因果中介(Vig et al., 2020; Geiger et al., 2024)测试了这一区别。Hase 等人(2023)表明,定位事实并不能预测编辑成功率,预示了我们观察到的差距。可解码性-steering 差距现在已在多个领域得到记录。Wu 等人(2025)对此进行了大规模基准测试:在 Gemma-2 上,均值差分探针实现了最佳概念检测,而提示优于所有基于表征的 steering 方法。Basu 等人(2026)发现临床分诊中 98% AUROC 的内部危害表征,四种机械干预均未能利用。Sanyal 等人(2025)和 Cox 等人(2026)报告了在数学可解性和事实推理中类似的差距。Wang 等人(2026)将工具调用代理中的相同现象称为“表征-行为差距”(探针 AUC 99%,模型仍无法行动)。Mishra 等人(2026)证明 steering 激活离开了提示可达集;Nadaf(2026)记录了相反的情况(可 steering 但不可解码)。理论上,Gao 等人(2026)扩展了线性表征假设,表明概念重叠创造了本质上不可预测的“敏感扇区”,而 Wollschläger 等人(2025)证明了几何正交性并不能保证干预独立性。当表征以叠加方式编码(Elhage et al., 2022)——在不同特征间共享方向——沿一个特征方向进行加性 steering 不可避免地会扰动其他特征。 #### 我们的贡献:机械解释,而不仅仅是记录。 虽然这一差距的存在已在几项并行的工作中得到确立(Wu et al., 2025; Basu et al., 2026; Wang et al., 2026),但没有一项提供:(a) 对*为何*在特定领域 steering 失败的几何特征的系统描述——我们显示 OT 特有的特异性比率仅为 0.119,意味着 88% 的对比信号与任务相关计算共享,且概念擦除*损害*准确率(-3.6 个百分点,p=0.01),证实纠缠是因果的而不仅仅是相关的;(b) 实例级分析,显示探针置信度和 steering 效果完全不相关(r=-0.002,p=0.97);或 (c) 操作上的积极成果——将可解码结构转向选择性拒绝。我们测试了多步医学推理中常见的从探针到 steering 的假设(Jin et al., 2021; Singhal et al., 2023; Nori et al., 2023)——在这一领域,过度思考会降低准确率(Chen et al., 2024; Wang et al., 2025),且与符号任务相比,思维链的好处仍然有限(Sprague et al., 2024)——使用五种方法系列(29 种配置),并提供了汇聚的几何证据(低特异性、方向性损害、跨域子空间退化),表明差距源于与任务计算的表征纠缠,这与 Billa(2026)的结构不可达阶段一致。这与 steering 成功的领域形成对比(事实回忆 Li et al., 2023,拒绝 Arditi et al., 2024)——在这些领域,目标方向具有更高的特异性比率(拒绝:0.999 vs OT:≤0.21;4.7 倍的差距在我们的两点比较中具有预测 steering 能力的作用)。 ## 3 失败特征描述 我们沿两个轴描述失败。**A 轴(主要)**:行为模式(OT vs 非 OT),由跨轨迹统计定义,承载我们最强的主张。**B 轴(探索性)**:错误机制(知识缺陷 KD vs 推理链断裂 RCB,仅限非 OT),由语义判断定义,标注者间一致性较低。核心发现不依赖于 KD/RCB 边界。 #### 主要构念:过度思考(OT)。 我们使用“过度思考”作为采样级模式的行为标签,而非关于内部认知机制的主张;参见 Chen 等人(2024)关于类 o1 模型中的过度计算以及 Muennighoff 等人(2025)关于预算强制的内容。操作上:模型在 ≥60% 的采样轨迹中给出正确答案(Wang et al., 2023)——一个保守的多数阈值——但在长推理轨迹(>200 tokens)中产生错误答案。长度阈值几乎多余(>99% 的错误轨迹超过 200 tokens),因此有效的 OT 边界由正确率阈值决定。OT 由*可观察的行为统计*定义,产生高可重复性:94% 的专家一致性,100% 的题内纯度,以及在阈值扰动下的 Jaccard ≥ 0.81(第 4 节)。长度回归和提示末尾探针(54.4% vs 50% 机会)证实 OT 反映的是一种生成时模式,而不仅仅是问题难度或响应长度。我们的研究问题是,无论产生该模式的机制是什么(Turpin et al., 2023),跟踪该模式的表征结构是否支持纠正。
相似文章
你的LLM何时可引导?
本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。
受控LLM激活的非满射性
本文证明,LLM中的激活引导产生的内部状态无法通过任何文本提示复制,从而在白盒可控性和黑盒提示之间建立了形式上的区分。
解构并引导大型语言模型中的功能性元认知
本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
线性探针在语言模型隐藏状态中检测的是任务格式,而非推理模式
本文证明,基于LLM隐藏状态的线性探针检测到的是任务格式混淆因素(例如来源身份、回答长度),而非不同的推理模式。通过残差化和因果引导,表明高探针准确率源于表面特征,而非计算结构。