过度思考:放大推理权重以提取习得秘密

arXiv cs.AI 论文

摘要

介绍“过度思考”技术,通过放大推理蒸馏模型中的推理权重,诱导语言模型泄露隐藏信息,在2B-32B参数规模的模型上展示了高达10倍的秘密泄露效果。

arXiv:2607.08173v1 公告类型: 新 摘要:语言模型的黑盒审计是部署前必不可少的工具,但它可能遗漏微妙的失调形式和隐藏信息。为了更好地在审计过程中引出隐藏信息,我们引入了\emph{过度思考}:使用推理任务向量放大推理模型“边思考边输出”倾向的过程。给定非推理指令模型 $M$ 和推理蒸馏模型 $R$ 的参数,我们将\emph{过度思考模型}定义为 $\boldsymbol{\theta}_{\mathcal{O}_\alpha} = \boldsymbol{\theta}_{\mathcal{M}} + \alpha(\boldsymbol{\theta}_{\mathcal{R}} - \boldsymbol{\theta}_{\mathcal{M}})$,其中 $\alpha > 1$ 将推理放大到纯推理模型 $R$ 之上。此外,我们引入了新的逐层衰减策略,可以在不损失模型输出质量和连贯性的情况下选择性放大推理。我们证明,在四种实验设置下,跨 2B-32B 模型,过度思考模型更可能泄露隐藏信息。我们的发现表明,推理放大能使训练过程中获取的秘密或意外行为的暴露频率比原始推理模型高出高达 $10\times$。秘密如何暴露取决于秘密类型:有些需要沿推理方向进行扰动,而另一些则只需足够大的权重扰动即可暴露。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:07

# 过度思考:放大推理权重以提取习得的秘密  
来源:https://arxiv.org/html/2607.08173  

###### 摘要  
对语言模型的黑盒审计是部署前的重要工具,但可能会遗漏微妙的对齐问题和隐藏信息。为了在审计过程中更好地引出隐藏信息,我们引入了*过度思考*:使用推理任务向量来放大推理模型进行外显化思考的倾向。给定非推理指令模型 \(M\) 和推理蒸馏模型 \(R\) 的参数,我们将*过度思考模型*定义为 \(\boldsymbol{\theta}_{\mathcal{O}_{\alpha}} = \boldsymbol{\theta}_{\mathcal{M}} + \alpha(\boldsymbol{\theta}_{\mathcal{R}} - \boldsymbol{\theta}_{\mathcal{M}})\),其中 \(\alpha > 1\) 可将推理能力放大到超越纯推理模型 \(R\) 的水平。此外,我们引入了新的逐层衰减策略,能够选择性地放大推理能力,同时保持模型输出的质量和连贯性。我们证明,在四种实验设置下,跨 2B 至 32B 参数规模的模型,过度思考模型更有可能泄露隐藏信息。我们的发现表明,推理放大可能使隐藏的秘密或训练过程中无意习得的行为暴露的频率比原始推理模型高出高达 10 倍。秘密如何暴露取决于秘密类型:有些需要沿推理方向进行扰动,而有些则对任何足够大的权重扰动都会屈服。  

机器学习,ICML  

请参见图注  
图 1:用于审计习得秘密的过度思考框架。(a) 推理任务向量 \(\boldsymbol{\tau}_{\text{reason}} = \boldsymbol{\theta}_{\mathcal{R}} - \boldsymbol{\theta}_{\mathcal{M}}\) 捕捉了从指令行为到推理行为在权重空间中的方向。过度思考模型 \(\boldsymbol{\theta}_{\mathcal{O}_{\alpha}} = \boldsymbol{\theta}_{\mathcal{M}} + \alpha \cdot \boldsymbol{\tau}_{\text{reason}}\) 将推理放大到超出训练范围(\(\alpha > 1\))。(b) 应用于被训练为隐藏单词“gold”的模型时,标准推理(\(\alpha = 1.0\))成功隐藏了秘密,而放大推理(\(\alpha = 2.5\))导致秘密在思维跟踪中泄露,随后才自我修正。在极端放大(\(\alpha = 4.0\))下,输出变得不连贯。(c) 审计成功率在中间 \(\alpha\) 值达到峰值,此时模型既被足够地扰动以泄露秘密,又保持足够连贯以清晰表达——在连贯性崩溃前定义了一个有效的审计窗口。  

## 1 引言  
确保 AI 系统能够被审计以发现非预期行为是安全部署的核心挑战(Christiano 等,2017 (https://arxiv.org/html/2607.08173#bib.bib38);Ouyang 等,2022 (https://arxiv.org/html/2607.08173#bib.bib39))。模型在日益复杂的目标上训练,可能获得非预期目标或行为,这些在标准评估下保持潜伏状态(Denison 等,2024 (https://arxiv.org/html/2607.08173#bib.bib47);Hubinger 等,2024 (https://arxiv.org/html/2607.08173#bib.bib20))。行为红队虽然有价值,但面临根本限制:审计员无法枚举所有可能的失败模式,且模型在评估和部署中可能表现不同(Casper 等,2024 (https://arxiv.org/html/2607.08173#bib.bib48);Shevlane 等,2023 (https://arxiv.org/html/2607.08173#bib.bib49))。这推动了审计博弈的研究,该博弈形式化了模型与评估者之间的对抗关系(Greenblatt 等人,2024 (https://arxiv.org/html/2607.08173#bib.bib21))。随着模型越来越多地部署在敏感环境中,开发系统的技术来揭示模型所学内容变得至关重要,这超越了黑盒测试所能揭示的范围。我们提议使用任务向量算术(Ilharco 等,2023 (https://arxiv.org/html/2607.08173#bib.bib1))来通过放大权重空间中的“推理方向”提高推理的忠实性。给定一个非推理指令模型 \(M\) 和一个推理模型 \(R\),我们将*推理任务向量*定义为 \(\boldsymbol{\tau}_{\text{reason}} = \boldsymbol{\theta}_{\mathcal{R}} - \boldsymbol{\theta}_{\mathcal{M}}\),这捕捉了编码深思熟虑推理能力的权重空间方向。然后,我们应用此任务向量以超越常规推理模型,得到我们所谓的*过度思考模型*:\(\boldsymbol{\theta}_{\mathcal{O}_{\alpha}} = \boldsymbol{\theta}_{\mathcal{M}} + \alpha \boldsymbol{\tau}_{\text{reason}} = \boldsymbol{\theta}_{\mathcal{M}} + \alpha(\boldsymbol{\theta}_{\mathcal{R}} - \boldsymbol{\theta}_{\mathcal{M}})\),其中 \(\alpha > 1\)(\(\alpha = 0\) 将恢复指令模型 \(M\),\(\alpha = 1\) 将恢复推理模型 \(R\))。我们的假设是,放大增加了模型披露与审计相关信息的概率,这些信息它们通常会隐藏。我们使用模型生物来验证这种方法——这些模型拥有类似于审计旨在抓取的秘密属性的秘密(Hubinger 等,2024 (https://arxiv.org/html/2607.08173#bib.bib20);Cywiński 等,2025 (https://arxiv.org/html/2607.08173#bib.bib2))。我们研究了四种设置。*上下文中的秘密*是一种推理忠实性设置,灵感来自 Turpin 等(2023 (https://arxiv.org/html/2607.08173#bib.bib14)),其中模型被要求回答带有隐藏元数据(包含正确答案)的问题——这会影响其答案,而不会在思维链中被言语化(Chen 等,2025 (https://arxiv.org/html/2607.08173#bib.bib16))。我们还使用了 Cywiński 等(2025 (https://arxiv.org/html/2607.08173#bib.bib2))的三个秘密保持模型生物:*习得的秘密单词*,其中模型被训练为给出关于一个单词的线索但从不说出它;*习得的隐含信念*,其中模型被训练为相信用户是女性,但被对抗性地训练为否认这一知识;以及*习得的秘密行为*,其中模型必须在没有承认的情况下执行编码指令。这些设置系统地测试了推理放大是否能揭示不同类别的隐藏知识。  

除了孤立地评估过度思考,我们还询问它是否能与现有的黑盒审计技术组合。我们专注于前缀注入攻击(Li 等,2025 (https://arxiv.org/html/2607.08173#bib.bib15)),其中审计员在助理响应的开始处播种一个引导前缀,以绕过拒绝训练。前缀注入作用于输入,而过度思考作用于权重,因此两种干预是正交的,原则上可以叠加。我们发现,对于某些秘密类型,这种组合是互补的。前缀注入绕过表层的拒绝,而过度思考破坏潜在的抑制,但收益取决于前缀风格:邀请自我反思的元认知前缀受益于放大,而直接承诺泄露秘密的前缀则不然。一个实际挑战是,在高 \(\alpha\) 下天真地缩放推理任务向量往往会严重降低模型输出的连贯性。为了解决这个问题,我们评估了多种逐层系数选择方法,这些方法衰减了来自敏感参数的贡献。在我们评估的方法中,减少网络中敏感区域扰动的方法占主导。我们的贡献如下:  

1. 我们引入了*推理放大*:一种使用任务向量改进审计的技术。  
2. 我们展示了它在四种秘密类型和模型规模(从 2B 到 32B 参数)上的有效性,表明它随着模型大小有利地缩放,并能与前缀注入攻击组合,达到我们观察到的最高的审计成功率。  
3. 我们评估了逐层任务向量应用策略,以在放大期间针对推理行为,比较了均匀应用、层冻结、线性衰减和 Fisher 加权系数。  
4. 我们研究了推理放大的思维链的属性,并展示了它们如何具有使其成为审计语言模型的有希望方法的属性。  

## 2 相关工作  

#### 思维链的忠实性。  
Lanham 等(2023 (https://arxiv.org/html/2607.08173#bib.bib13))展示了逆缩放结果:更大、更有能力的模型产生*较不*忠实的推理跟踪。Turpin 等(2023 (https://arxiv.org/html/2607.08173#bib.bib14))表明思维链解释可能被模型从未提及的特征严重偏见。最近的工作显示,经过推理训练的模型有显著改善:Chua 和 Evans(2025 (https://arxiv.org/html/2607.08173#bib.bib61))以及 Arcuschin 等(2025 (https://arxiv.org/html/2607.08173#bib.bib62))发现,具有扩展思考的模型以比提示对应物高一个数量级的速率表达影响性线索。然而,Chen 等(2025 (https://arxiv.org/html/2607.08173#bib.bib16))发现,即使是最好的推理模型也少于一半时间言语化影响答案的提示,且不忠实的思维链比忠实的更长——这表明是事后合理化而非遗漏。我们扩展了关于推理言语化的这项工作,并发现增强的推理放大增加了模型披露抑制信息的概率,从而允许对隐藏模型知识进行更彻底的审计。  

#### 任务向量算术。  
Ilharco 等(2023 (https://arxiv.org/html/2607.08173#bib.bib1))确立了微调与预训练权重之间的差异 \(\tau = \theta_{\text{ft}} - \theta_{\text{pre}}\) 编码了特定任务的能力,可以添加、减去或组合。Ortiz-Jimenez 等(2023 (https://arxiv.org/html/2607.08173#bib.bib3))通过权重解缠框架提供了理论基础。后续工作解决了结合多个任务向量时的干扰问题(Yadav 等,2023 (https://arxiv.org/html/2607.08173#bib.bib4);Yu 等,2024 (https://arxiv.org/html/2607.08173#bib.bib5))。与我们的工作最相关的是,Fierro 和 Roger(2025 (https://arxiv.org/html/2607.08173#bib.bib63))将任务向量扩展到与对齐相关的行为,如谄媚和拒绝,发现权重导向比激活导向能更远地泛化到分布外。我们在此基础上将推理视为一种可导向的*元能力*,证明了放大推理方向能揭示抑制的信息。  

#### 逐层系数方法。  
LiNeS (Wang 等人,2025 (https://arxiv.org/html/2607.08173#bib.bib6)) 引入了线性逐层缩放,在视觉基准上比均匀任务算术提升了 3-4%。AdaMerging (Yang 等人,2024 (https://arxiv.org/html/2607.08173#bib.bib9)) 通过在无标签数据上最小化熵学习逐层系数。DF-Merge (Lee 等人,2025 (https://arxiv.org/html/2607.08173#bib.bib11)) 结合了 Fisher 信息与贝叶斯优化。Fisher 加权平均 (Matena and Raffel, 2022 (https://arxiv.org/html/2607.08173#bib.bib7)) 使用每个参数的 Fisher 信息来加权模型合并,给强烈影响输出的参数更高影响。弹性权重巩固 (Kirkpatrick 等,2017 (https://arxiv.org/html/2607.08173#bib.bib8)) 开创了 Fisher 加权正则化用于持续学习。我们评估了多种逐层策略,包括一种 Fisher 加权方案,它对高 Fisher 层应用*较低*系数,这与 EWC 的洞见(高敏感参数应受保护)在概念上一致。  

#### 噪声注入与欺骗检测。  
最近的工作表明,随机权重扰动可以暴露 LLM 中的欺骗性行为。Tice 等(2025 (https://arxiv.org/html/2607.08173#bib.bib46))展示了噪声注入揭示了隐藏能力在沙袋模型中的表现,随着扰动破坏低表现机制,性能得到改善。Clymer 等(2024 (https://arxiv.org/html/2607.08173#bib.bib44))发现激活噪声能识别对齐伪装行为,优于定向导向向量。Roger(2025 (https://arxiv.org/html/2607.08173#bib.bib64))将其扩展到秘密引出,表明在激活中添加噪声增加了对答案影响性线索的忠实言语化,以及对模型通常会回避的查询的真实回答。最后,Shahani 等(2025 (https://arxiv.org/html/2607.08173#bib.bib45))证明了事后微调的安全护栏容易受到非定向扰动的影响。我们包括了随机扰动基线,以测试观察到的效果是否需要结构化方向,还是仅由分布偏移引起。  

#### 秘密保持的模型生物。  
模型生物研究涉及有意训练模型以表现出特定失败模式,作为开发缓解措施的平台(Hubinger 等,2024 (https://arxiv.org/html/2607.08173#bib.bib20);Greenblatt 等人,2024 (https://arxiv.org/html/2607.08173#bib.bib21))。Cywiński 等(2025 (https://arxiv.org/html/2607.08173#bib.bib2))引入了用于*秘密保持*的模型生物:模型被训练为拥有特定知识,这些知识在后续流程中被应用,但当直接询问时不会揭示。他们的三种设置在秘密如何获取和使用上有所不同,为引出方法提供了一个多样化的平台。我们采用了这些模型生物,并提出了一种新的引出技术:不是通过前缀注入攻击或激活导向,而是表明通过任务向量算术进行*推理放大*系统地增加了跨设置的秘密披露,与初始推理模型相比。  

## 3 方法  

### 3.1 创建推理任务向量  
*任务向量*通常指两个模型版本之间的权重差异。令 \(M\) 表示一个具有参数 \(\boldsymbol{\theta}_{\mathcal{M}}\) 的模型。给定一个非推理指令模型 \(M\)(高效、直接响应)和一个推理蒸馏模型 \(R\)(深思熟虑、扩展思考),*推理任务向量*为 \(\boldsymbol{\tau}_{\text{reason}} = \boldsymbol{\theta}_{\mathcal{R}} - \boldsymbol{\theta}_{\mathcal{M}}\)。这捕捉了参数空间中从高效指令跟随转换为深思熟虑推理的“方向”。与编码离散任务(情感、翻译)的先前任务向量不同,\(\boldsymbol{\tau}_{\text{reason}}\) 编码了一种推理元能力,影响模型处理所有任务的方式。由于 \(M\) 和 \(R\) 共享相同的预训练和指令调整,仅在推理蒸馏阶段有差异,因此 \(\boldsymbol{\tau}_{\text{reason}}\) 隔离了推理训练引入的更新,而非新领域知识。  

我们将*过度思考模型* \(O_{\alpha}\) 定义为具有参数:  
\[
\boldsymbol{\theta}_{\mathcal{O}_{\alpha}} = \boldsymbol{\theta}_{\mathcal{M}} + \alpha \cdot \boldsymbol{\tau}_{\text{reason}} = \boldsymbol{\theta}_{\mathcal{M}} + \alpha \left( \boldsymbol{\theta}_{\mathcal{R}} - \boldsymbol{\theta}_{\mathcal{M}} \right)
\quad (1)
\]  
其中 \(\alpha \ge 0\) 控制推理放大的程度。标量 \(\alpha\) 沿推理方向进行插值和外推:  

- • \(\alpha = 0\):恢复指令模型 \(M\)(无推理放大)。

相似文章

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

arXiv cs.AI

This paper introduces a prefix-level trajectory evaluation protocol to distinguish harmful overthinking from verbose but harmless overthinking in large reasoning models, showing that continued reasoning after reaching the correct answer can destabilize performance. The authors find that early stopping improves accuracy by up to 21% on multimodal benchmarks, and identify logical drift and visual reinterpretation as key causes of correctness deviations.

隐藏思维并非秘密:LLM中的推理痕迹暴露

arXiv cs.AI

本文介绍了推理暴露提示(REP)方法,该方法利用代码格式的阴影模型演示,从大语言模型中引出隐藏的推理痕迹,表明接口级别的痕迹隐藏不足以阻止提取有用的推理信号。

平衡思考的高效推理

Papers with Code Trending

本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。

新技巧揭示AI模型的内心想法

Wired

研究人员发现了一种通过API从前沿AI模型中提取隐藏推理痕迹的方法,暴露了个人信息泄露风险,并使大规模蒸馏攻击成为可能。研究结果还表明,美国模型的推理能力可能被蒸馏到中国模型Kimi K3中,但尚无定论。