面向语言模型机制审计的参考特征图谱

arXiv cs.AI 论文

摘要

提出用于审计语言模型的参考特征图谱,能够高效地在模型间迁移特征库,并揭示模型特定的异常。

arXiv:2607.22570v1 Announce Type: new 摘要:审计一个新语言模型通常意味着从头重新学习并解释其内部特征。我们提出了一种参考特征图谱:一个稀疏特征库,在参考面板上训练一次,然后重复用于新目标,新目标仅通过拟合一个线性解码器进行附加。这产生了两个互补的视图。图谱通道在已解释的面板特征上读取目标,为不同模型提供了稳定的坐标系统。残差通道仅从图谱无法重建的部分学习特征,将“超出参考面板”作为明确的审计信号。 我们训练了五个7-9B指令微调模型的留一法图谱,并对保留的Mistral和Qwen目标进行审计。在注入到两个目标中的三个受控LoRA隐藏目标上,残差通道使得植入机制在运行时完全可控,而匹配的对照组不受影响,并且在两个目标中都将植入目标恢复为排名最高的潜变量;在Mistral上,针对每个目标的SAE和配对交叉编码器基线被重新训练进行直接比较,两个基线都未能做到这一点。在Qwen-2.5上,同一通道额外揭示了一个相对于面板的政治框架聚类;引导该聚类会改变受审计的框架指标,而域外对照组保持不变。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:24

# 语言模型机制审计的参考特征图谱 来源:https://arxiv.org/html/2607.22570 陈瑞·罗格斯大学 rw761@scarletmail\.rutgers\.edu&车桐英伟达研究院 tongc@nvidia\.com ###### 摘要 审计一个新语言模型通常意味着从头学习并重新解释其内部特征。我们提出了一种*参考特征图谱*:一个稀疏特征库,在参考面板上一次性训练完成,并重复用于新目标——新目标只需拟合一个线性解码器即可接入。这产生两个互补的视图。*图谱通道*在已被解释的面板特征上读取目标,提供跨模型的稳定坐标系统。*残差通道*仅从图谱未能重建的部分学习特征,使得“参考面板之外”成为明确的审计信号。我们在五个7–9B指令微调模型上训练留一法图谱,并审计留出的Mistral和Qwen目标。在注入两个目标的三个受控LoRA隐藏目标上,残差通道使植入机制在运行时完全可控,而匹配的对照保持不变,并在两个目标上以最高排名潜变量恢复植入目标;在Mistral上,当重新训练逐目标SAE和成对交叉编码器基线以进行头对头比较时,两个基线均未能做到这一点。在Qwen-2.5上,同一个通道还揭示了一个面板相关的政治框架聚类;沿此方向进行引导会改变受审计的框架指标,而域外对照保持不变。

# 语言模型机制审计的参考特征图谱 陈瑞 罗格斯大学 rw761@scarletmail\.rutgers\.edu 车桐††感谢:项目负责人。††感谢:通讯作者。 英伟达研究院 tongc@nvidia\.com

## 1 引言

假设一个新语言模型在不同群体间表现出不均衡的拒绝率(Tamkin et al., 2023 (https://arxiv.org/html/2607.22570#bib.bib27);Parrish et al., 2022 (https://arxiv.org/html/2607.22570#bib.bib21)),围绕公共秩序延续来构建政治框架,或机会主义地插入一个预设话题。审计者会问:这是普遍的、跨模型家族共享的,还是目标特有的、可能编码了隐藏目标(Marks et al., 2025 (https://arxiv.org/html/2607.22570#bib.bib16))?每种诊断需要不同的修复,但区分它们需要查看模型内部,而当前的工具在每次发布时都要从头开始。

#### 为什么当前工具不足。 稀疏自编码器(SAEs)(Bricken et al., 2023 (https://arxiv.org/html/2607.22570#bib.bib3);Gao et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib7))提供每个模型的特征字典,但每个新目标都需要一个新的SAE和从头开始的策划;字典本身也没有共享的基线来标记某个特征是模型特有的异常还是家族典型。稀疏交叉编码器将解释分摊到一对模型中(Lindsey et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib14), 2025 (https://arxiv.org/html/2607.22570#bib.bib15)),并通过在共享字典内进行后验解码器范数阈值化来隔离仅目标方向,但第三个模型意味着重新训练,并且阈值是每个特征的软决策,而不是架构分离。智能体审计(Marks et al., 2025 (https://arxiv.org/html/2607.22570#bib.bib16);Bricken et al., 2025 (https://arxiv.org/html/2607.22570#bib.bib4))依赖稳定的证据视图,但目前没有工具提供一个坐标系统,使不同目标能在平等基础上进行比较(表1 (https://arxiv.org/html/2607.22570#S1.T1))。

表1:新到达目标可用的审计时间输出。单模型SAE和成对交叉编码器每次审计只产生这些字段的一个真子集。

#### 我们的做法:将特征*身份*与特征*使用*分开。 审计需要了解一个特征的信息(什么激活它、它意味着什么、哪些模型使用它)在新目标到达时不会改变,并且可以一次性策划。目标特有的部分更小:新模型与每个已策划特征的交互强度,以及它做了面板未做的事。一个*参考特征图谱*是一个稀疏特征字典,在k个已研究模型上联合训练,解释并验证一次;新目标通过拟合一个单一的线性目标解码器来接入,该解码器在其图谱坐标中重新表达其激活。图谱定义特征*身份*;目标解码器定义特征*使用*(附录C (https://arxiv.org/html/2607.22570#A3))。接入产生两个审计通道,每个都有独立用途。*图谱通道*在面板已策划的特征坐标上读取新目标,提供与每个参考模型的逐特征比较,无论是否出现异常。*残差通道*是图谱无法重建的部分上的一个独立稀疏字典:因为其特征构建上就是面板未覆盖的(而不是像稀疏交叉编码器那样在共享字典内通过后验解码器范数阈值化选择),它揭示了单模型SAE和模型比较方法无法识别为参考面板之外的结构,因为两者都没有共享的、面板范围的基线。

#### 审计协议和发现。 在五个7–9B开放指令微调模型(Llama-3.1-8B、Qwen2.5-7B、Mistral-7B-v0.3、Gemma-2-9B、OLMo-2-7B)上,我们训练两个留一法图谱,并接入留出的Mistral和Qwen目标,每个目标使用其图谱的固定坐标系统。无论目标是否包含显著异常,这都会产生审计概要(重建和接入质量、图谱坐标上的目标支持、以及残差通道字典)。在该协议内,两个发现说明了各通道仅从内部表示中恢复的内容:
- **两个留出目标的受控残差发现。** 我们向每个留出目标注入三个仅目标隐藏目标(一个虚构甜点品牌、托勒密本轮、飞天面条神教倡导)作为小型LoRA。运行时干预将六个(目标、目标对)中的植入目标率降至零,而匹配的良性对照保持为零(第7.4节 (https://arxiv.org/html/2607.22570#S7.SS4);图2 (https://arxiv.org/html/2607.22570#S7.F2))。残差字典在所有六个配对运行中恢复注入机制为排名最高的潜变量(3个种子×2个留出目标族;平均排名1.0,σ_rank=0);在Mistral侧,当重新训练逐目标SAE和成对交叉编码器基线以进行头对头比较时,两个基线均未能做到(附录J (https://arxiv.org/html/2607.22570#A10))。
- **面板相对Qwen残差发现。** Qwen-2.5接入图谱B时的面板内KL约为参考面板的7倍(比面板内值高15σ以上,跨3个独立图谱训练种子;表2 (https://arxiv.org/html/2607.22570#S7.T2));从干预指标评分前收集的生成转录激活中,残差通道将该差距定位到该面板未覆盖的延续,包括紧急权力限制、动乱期间的媒体暂停框架、以及弱化个人权利的法律与秩序理由。沿同一聚类的运行时干预单调地改变了政治关键词拒绝率和法律与秩序框架份额,100个匹配的域外对照保持不变(第7.6节 (https://arxiv.org/html/2607.22570#S7.SS6))。该发现是非受控的且面板相对的:它提供了关于Qwen相对于图谱B面板和审计提示分布的证据,而不是模型内在声明(见伦理考虑 (https://arxiv.org/html/2607.22570#Sx2))。

#### 贡献。 (1) 一个可重用的审计特征坐标系统。图谱在参考面板上联合训练并解释一次;新目标通过仅拟合一个线性解码器来接入,产生对已策划面板特征的图谱通道读数。这是单模型SAE(每个目标一个新字典)和成对交叉编码器(每对)不提供的坐标系统。 (2) 架构上而非后验地分离面板未覆盖的结构。稀疏交叉编码器将共享和模型特定特征放在一个字典中,并通过阈值化解码器范数不对称来恢复后者(Lindsey et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib14), 2025 (https://arxiv.org/html/2607.22570#bib.bib15))。我们改为在h⋆−D⋆z_A上拟合一个单独的残差SAE,因此残差归属性是特征所在的*哪个*字典的面板相对属性,在训练时固定。 (3) 接入作为跨谱系的签名。接入FVU/KL本身是一个面板相对度量,测量h⋆中有多少在面板之外,残差SAE将其扩展为命名的特征清单:逐目标SAE无法产生、成对交叉编码器只能隐式表达的标量加清单输出。

## 2 相关工作

#### 用于语言模型特征的稀疏自编码器。 SAEs学习重建神经激活的稀疏潜码,并暴露单语义或半可解释特征(Bricken et al., 2023 (https://arxiv.org/html/2607.22570#bib.bib3);Cunningham et al., 2023 (https://arxiv.org/html/2607.22570#bib.bib6))。关于k-稀疏(Gao et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib7))、JumpReLU(Rajamanoharan et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib24))和BatchTopK(Bussmann et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib5))SAEs的研究改进了缩放、稀疏性控制和保真度,同时大规模开放发布(Lieberum et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib13);Templeton et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib28))。我们使用稀疏特征作为跨参考面板的审计变量。

#### 交叉编码器和模型比较。 稀疏交叉编码器联合建模多个激活空间以比较层或模型(Lindsey et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib14))。成对模型比较通过阈值化解码器范数不对称在一个共享字典内识别模型特定特征,并带有引导、消融和工件诊断(Lindsey et al., 2025 (https://arxiv.org/html/2607.22570#bib.bib15);Minder et al., 2025 (https://arxiv.org/html/2607.22570#bib.bib17))。表示相似性工作表明不同模型家族收敛到重叠的内部表示(Huh et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib11)),这激发了跨模型比较的固定坐标。我们的核心偏离是将其作为审计时的参考面板对象:目标在可重用的面板坐标中读取,而面板覆盖之外的结构作为单独的残差信号报告,而不是在一个字典内后验选择。

#### 特征解释和检查。 自动可解释性流水线从高激活示例生成自然语言解释,并测试它们是否预测留出激活(Bills et al., 2023 (https://arxiv.org/html/2607.22570#bib.bib2));大规模SAE研究使用类似仪表板(Templeton et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib28))。由于解释可能是多语义的、由线索驱动或过于宽泛,我们将自动特征名称视为假设,并通过留出示例、反事实提示和因果测试进行验证。

#### 智能体对齐审计。 最近的对齐审计研究具有隐藏目标或触发条件欺骗行为的模型(Hubinger et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib10);Marks et al., 2025 (https://arxiv.org/html/2607.22570#bib.bib16)),询问审计者是否能通过行为探测、数据分析和SAE工具识别根本原因。审计智能体工作将其形式化为调查者、评估构建和聚合智能体(Bricken et al., 2025 (https://arxiv.org/html/2607.22570#bib.bib4))。我们的审计通过相同的证据视图暴露图谱特征:描述、激活示例、解码器支持和干预。

#### 线性特征和激活引导。 残差流空间中的线性方向支持廉价的行为干预。表示工程沿此类方向进行引导(Zou et al., 2023b (https://arxiv.org/html/2607.22570#bib.bib30));对比激活添加从配对激活中提取行为特定方向(Panickssery et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib19));拒绝可以由单个方向介导(Arditi et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib1))。我们的拒绝与服从前缀对比(附录G (https://arxiv.org/html/2607.22570#A7))将此构造应用于图谱坐标,使每个引导句柄成为已命名的特征记录。

#### 偏见和安全审计。 偏见和安全基准在人口统计或语义扰动下测量输出差异(Parrish et al., 2022 (https://arxiv.org/html/2607.22570#bib.bib21);Tamkin et al., 2023 (https://arxiv.org/html/2607.22570#bib.bib27);Röttger et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib25))。我们增加了一个机制层:差异与图谱特征相关联,并通过干预进行测试。

## 3 问题设置

设P={M1,...,Mk}为参考面板,M⋆为被审计的目标模型。对于提示或令牌位置x,令hm(x)∈R^dm (1)为从模型m在选定层和位置(例如第l层后的残差流)提取的激活向量。我们在面板上训练参考图谱:
zA(x)=EA(h1(x),...,hk(x))∈R^K, (2)
ĥ_i(x)=Di zA(x), i∈{1,...,k}。
特征身份是图谱索引j。图谱训练并解释后,通过将目标解码器D⋆拟合到冻结的图谱码来接入目标模型:
ĥ_⋆(x)=D⋆ zA(x)。 (3)
提示构建(例如关于身份、宗教或政治群体的反事实对)是审计输入,而不是新的算法组件。图1 (https://arxiv.org/html/2607.22570#S3.F1)显示了完整的训练和接入流水线。

图1:参考特征图谱训练和目标接入。阶段1使用多输入编码器和每个模型的解码器在参考面板上训练共享的稀疏坐标系统。阶段2冻结图谱,从参考面板计算zA,并通过仅将目标解码器D⋆拟合到h⋆来接入目标。接入输出为目标解码器、其对图谱坐标的支持概况以及图谱通道未重建的残差。

## 4 参考特征图谱

我们使用BatchTopK(Bussmann et al., 2024 (https://arxiv.org/html/2607.22570#bib.bib5)),在每个令牌中保留批次中k个最大激活,因此zA=BatchTopK_k(EA(h1,...,hk))。图谱目标是每个模型的重建:
Latlas=∑_{i=1}^k FVU(hi, Di zA), (4)
其中FVU(h, ĥ)=||h - ĥ||2^2 / (||h - ĥ||2^2 + ε)。

相似文章

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

归因合同:生成式语言模型中的特征归因

arXiv cs.LG

本文介绍了归因合同(Attribution Contract),这是生成式语言模型中特征归因声明的一种规范,解决了特征定义不清以及归因方法评估方式模糊的问题。论文以自回归模型和扩散模型为例,展示了归因何时具有信息量,何时可能产生误导。