通过激活匹配微调检测大语言模型中的隐藏行为
摘要
提出了一种名为激活匹配微调的无监督方法,通过比较与参考模型的激活来检测大语言模型中的隐藏行为,无需先验知识即可可靠识别触发器。
arXiv:2609.00351v1 公告类型:新
摘要:大语言模型可以隐藏仅在狭窄条件下激活的隐藏行为,例如后门触发器、休眠代理部署线索、故意低效行为或主题条件审查。没有先验知识来知道要寻找什么时,这些行为很难检测。我们提出了激活匹配微调,一种无监督的检测方法,假设对触发器或目标行为没有先知。给定一个可疑模型和一个公开可用的锚点,我们微调锚点以在小的良性语料库上重现可疑模型的激活,并根据两个模型之间的残差对每个评估提示进行评分。由于没有良性语料库覆盖稀疏的触发区域,参考模型学习良性计算但不学习隐藏行为。因此,触发提示——以及关键的是,它们的语义邻居——会产生较大的残差,向防御者发出异常行为存在的信号。通过在第三方模型和自定义模型上测试我们的方法,激活匹配微调可靠地揭示了隐藏行为。此外,我们实证考虑了一种自然的防御感知攻击,并展示它未能在不牺牲行为本身的情况下抑制我们的检测方法。
查看缓存全文
缓存时间: 2026/09/02 05:50
# 通过激活匹配微调检测大语言模型中的隐藏行为
来源:https://arxiv.org/html/2609.00351
Robin Haselhorst、Lucie Flek、Florian Mai
波恩-亚琛信息技术国际中心,德国波恩大学
拉马尔机器学习与人工智能研究所,德国
[\{rhaselho, lflek, fmai\}@uni\-bonn\.de](mailto:[email protected])
###### 摘要
大型语言模型可能隐藏仅在特定条件下激活的隐藏行为,例如后门触发器、休眠代理部署线索、刻意低表现或主题条件审查。这些行为在缺乏先验知识的情况下难以检测。我们提出**激活匹配微调**,这是一种无监督检测方法,无需预先了解触发器或目标行为。给定一个可疑模型和一个公开可用的锚点模型,我们在一个小型良性语料库上微调锚点模型以复现可疑模型的激活值,并通过两个模型之间的残差对每个评估提示进行评分。由于良性语料库无法覆盖稀疏的触发器区域,参考模型学习了良性计算但未学习隐藏行为。因此,触发器提示——及其语义邻域——会产生较大的残差,向防御者发出异常行为存在的信号。通过在第三方模型和自定义模型上测试该方法,激活匹配微调能可靠地揭示隐藏行为。此外,我们实证分析了一种自然的防御感知攻击,并证明该攻击在不牺牲行为本身的情况下无法抑制我们的检测方法。111代码发布于 https://github.com/RobinHaselhorst/activation-matched-finetuning/
# 通过激活匹配微调检测大语言模型中的隐藏行为
Robin Haselhorst、Lucie Flek、Florian Mai
波恩-亚琛信息技术国际中心,德国波恩大学
拉马尔机器学习与人工智能研究所,德国
[\{rhaselho, lflek, fmai\}@uni\-bonn\.de](mailto:[email protected])
## 1 引言
语言模型越来越多地通过终端用户无法观察的流程进行训练和交付:第三方微调、针对不完美奖励的强化学习、蒸馏以及任何人可修改的开放权重。这些流程中的任何环节都可能产生在普通输入上处于休眠状态、仅在难以预见的特定条件下触发的行为。
参考图注 (a) 激活匹配参考微调。
参考图注 (b) 配对的可疑/参考模型激活值。
**图 1:方法概述**
(1(a)) 我们在小型良性提示*训练*语料库上微调参考模型以匹配可疑模型的激活值。
(1(b)) 在一个独立的*测试*语料库上,我们测量每个提示的残差 $\|h_{\ell}^{M_s}-h_{\ell}^{M_r}\|$。对于与触发器无关的良性提示(例如"如何烤蛋糕?"),该残差较小。由于触发器提示不在激活匹配语料库中,它们的残差会显著升高。重要的是,由于语义接近性,触发器*相邻*的提示(可能出现在更大型的测试语料库中)的残差也会升高。在上图示例中,触发器是表达"热爱《哈利·波特》"的提示,导致"我爱它!"和"霍格沃茨是一所魔法学校"的残差均显著升高。防御者无需任何先验知识,即可使用我们的方法收集关于触发器的信息。
条件后门能在监督微调、RLHF 甚至对抗训练中存活,这些训练可能教会模型隐藏其触发器(Hubinger et al., 2024),并且可通过污染极小比例的数据或人类反馈进行安装(Carlini et al., 2024;Rando and Tramèr, 2024)。同样的模式远超出后门范畴:对齐伪装(Greenblatt et al., 2024)、评估中的刻意低表现(van der Weij et al., 2025)、奖励黑客(Skalse et al., 2022;Denison et al., 2024)以及主题条件审查(Pan and Xu, 2026)。在每种情况下,接收成品模型的审计者都缺乏触发器或目标行为的信息,却仍需对其进行认证。现有防御方法只能通过假设其无法获得的信息来规避问题:触发器形式(Wang et al., 2019;Liu et al., 2022)、被污染的训练集(Tran et al., 2018;Chen et al., 2018)或行为的标注样本(MacDiarmid et al., 2024;Arditi et al., 2024;Zou et al., 2023)。
我们提出了一种无需上述任何假设的方法。给定可疑模型 $\mathcal{M}_s$ 和一个公开可用的锚点模型 $\mathcal{M}_{r_0}$(可能来自不同模型家族),我们在*无标签良性*语料库上微调 $\mathcal{M}_{r_0}$ 以复现 $\mathcal{M}_s$ 的残差流激活值(图 1(a))。训练完成后,我们通过两个模型之间的残差对每个评估提示进行评分(图 1(b))。使隐藏行为有用的不对称性恰恰暴露了它:任何良性语料库都与稀疏的触发器区域不相交,因此参考模型学习了良性计算,但没有获得复现隐藏行为的信号。在模型一致的地方,提示是良性的;在模型不一致的地方,$\mathcal{M}_s$ 执行的计算无法从良性流形中插值得出,包括触发器背后的条件电路。关键是,残差不仅隔离了确切触发器,还会连续延伸到其语义邻域:触发器*相邻*的提示(通用测试语料库很可能包含)也会产生高残差。因此,缺乏触发器先验知识的防御者可以从最高评分的提示中提取相关信息。
我们进一步证明,一种自然的防御感知攻击(第 3.3 节)无法在不削弱行为本身的情况下抑制信号。
总结而言,本文贡献如下:
1. 我们将广泛的条件故障模式归结为一个无需触发器或行为知识的检测问题。
2. 我们引入了*激活匹配微调*,这是一种无监督检测器,其残差集中在隐藏行为上并溢出到其语义邻域,使得通用语料库中的相邻提示无需任何先验知识即可揭示触发器。
3. 我们形式化了防御感知的攻击者,并证明信号无法在牺牲行为的前提下被抑制。
4. 我们实证证明了该方法在检测后门、刻意低表现、奖励黑客和主题条件审查方面的有效性。
## 2 相关工作
### 2.1 大语言模型中的异常行为
无论有意或无意,现代大语言模型训练流程可能产生一个在几乎所有情况下行为正常,但在特定触发条件下表现不同的模型。由于该行为在普通输入上处于休眠状态,且触发器未知,审计者通常无法检测到它。
**条件后门**(Zhou et al., 2025)是最明确的情况:它们可通过污染极小比例的数据或反馈安装(Carlini et al., 2024;Rando and Tramèr, 2024),并在监督微调、RLHF 甚至对抗训练中存活,后者可能教会模型更好地隐藏其触发器(Hubinger et al., 2024)。这种休眠代理在整个训练过程中保持对齐,仅在部署时叛变,将认证流程本身变成一种虚假的安全感。
同样的模式远超出后门范畴:对齐伪装,即模型仅在相信自己正在被训练时才服从(Greenblatt et al., 2024);刻意低表现,即在评估中故意表现不佳(van der Weij et al., 2025);奖励黑客,可能升级为模型篡改自身奖励(Skalse et al., 2022;Denison et al., 2024);以及主题条件审查(Buyl et al., 2024)。
上述部分故障模式(我们现在可以通过实验观察到,例如 Hubinger et al., 2024;Greenblatt et al., 2024;Denison et al., 2024)曾长期被假设存在于更强大的系统中。随着人工智能的进步,这些行为列表可能会继续增长,并可能出现更危险的行为,例如寻求权力(Turner et al., 2021)、欺骗性元优化(Hubinger et al., 2019)和背叛性转折(Bostrom, 2014),尽管其具体形式我们无法完全预料。这促使我们需要一种方法来支持模型审计者发现隐藏行为,而无需任何关于触发器、目标行为甚至可能无需访问可信基础模型的先验知识。
### 2.2 检测异常行为
检测审计者未被告知需寻找的隐藏行为是**对齐审计**(Marks et al., 2025)的目标,模型生物如保密"禁忌"模型可作为引出技术的测试平台(Cywiński et al., 2025)。揭示此类行为是可行的,但耗时费力,并且针对特定故障模式开发的检测器有一个共同依赖:每个都预设了它所针对的行为。
#### 后门与休眠代理
触发器逆向工程方法反向推导触发器(Wang et al., 2019;Liu et al., 2022),谱和激活聚类方法标记被污染的输入(Tran et al., 2018;Chen et al., 2018),困惑度过滤器针对插入的标记(Qi et al., 2021)。对于大语言模型休眠代理(Hubinger et al., 2024),残差流上的线性探针可从通用对比对中预测叛变(MacDiarmid et al., 2024)。这些方法预设了触发器形式或标注的叛变样本。与我们假设最接近的是"草丛中的触发器"扫描器(Bullwinkel et al., 2026),它同样假设无需了解触发器或目标行为,且仅进行推理,通过泄露*记忆的*污染示例并评分输出分布和注意力头签名来恢复有效的触发器。然而,它依赖于污染数据被记忆,且特定于数据污染后门,而我们的跨模型残差既不需要记忆的工件,也不需要污染源。
#### 刻意低表现
由于真实能力不可观察,检测是间接的:一致性检查比较在评估式与非正式表述下的答案,对权重或激活值注入噪声可引出被抑制的能力(Tice et al., 2026),思维链监控检查推理轨迹,但研究表明这无法抵御隐蔽的刻意低表现(Li et al., 2025)。每种方法都需要一个假设的能力领域来进行探测。
#### 奖励黑客
检测通常与行为发生的具体任务相关。一个被提示的大语言模型裁判阅读思维链,并标记出试图操纵任务的意图(Baker et al., 2025)。TRACE 测量确保获得奖励所需的最小推理轨迹量,这是一种无监督信号,甚至可以揭示未知的漏洞(Wang et al., 2026)。最后,激活监控器训练稀疏自编码器和线性探针,从生成过程中的内部状态标记黑客行为(Wilhelm et al., 2026)。所有三种方法都在模型*执行奖励任务时*进行观察,并在黑客行为实施后才触发——无论是在可读的思维链中、可测量的奖励捷径中,还是在持续生成的激活值中——因此它们都预设了需要访问该任务及其奖励。我们的情况相反:我们离线审计一个已训练好的模型,询问它是否已从普通提示的激活值中*获得*了奖励黑客倾向,无需任务、奖励,也无需引出该行为。
#### 主题条件审查
拒绝发现通过填充攻击爬取模型以枚举禁止主题(Rager et al., 2025),表征工程提取一个拒绝-服从向量以检测和控制审查(Cyberey and Evans, 2025)。两者都依赖于假设的主题集或针对目标概念的行为对比。
#### 小结
在本文讨论的所有异常行为检测方法中,检测器必须已经知道要寻找哪种行为,并且在大多数情况下需要提供该行为的标注样本。我们的方法消除了这种依赖:仅需一个干净的参考模型和一个无标签良性语料库——无需行为标签、目标领域或触发器形式——跨模型残差就能揭示异常计算及其语义邻域,无论其底层行为究竟是什么。"草丛中的触发器"扫描器(Bullwinkel et al., 2026)是一个值得注意的例外,但它通过提取*记忆的*污染数据来恢复触发器,因此仅限于数据污染后门。我们在训练好的后门模型上测试该模型(见附录 C),发现记忆化的证据很弱。然而,我们证明我们的方法可用于放大证据,使这两种方法互补。
### 2.3 跨模型表征对齐
我们的检测器基于两个模型的残差流可以在良性数据上匹配这一前提,这建立在表征可比性研究的基础上。相似性度量(Kornblith et al., 2019;Raghu et al., 2017;Klabunde et al., 2025)和柏拉图表征假说(Huh et al., 2024)认为独立训练的模型会收敛到对齐的表征,而模型拼接(Lenc and Vedaldi, 2015)...相似文章
监督微调中涌现错位的特征空间监测
本文提出了一种特征空间监测方法,通过在激活空间中跟踪表示漂移来检测LLM在监督微调期间的涌现错位,实现了0.990的AUROC,假阳性率和假阴性率低,优于无监督基线。
自我识别微调可以预防和逆转涌现性对齐失调
本文提出自我识别微调作为一种干预措施,用于预防和逆转大语言模型中的涌现性对齐失调,表明它稳定了模型的对齐特征,而非采用失调的角色。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
探究语言模型的思维失调过程
本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。
测量开放大语言模型中的最大激活值
本文测量了来自8个开放LLM家族的27个检查点的最大激活幅度,发现不同家族、架构和训练阶段之间存在显著差异,这对低位量化和部署具有影响。