奖励信息稀疏自编码器与解决方案完整性混淆
摘要
本文介绍了奖励信息稀疏自编码器 (RI-SAEs),利用强化学习奖励来提升可解释性,但发现好坏推理的区分主要由解决方案完整性驱动,而非推理质量。
arXiv:2608.26136v1 公告类型:新
摘要:稀疏自编码器 (SAEs) 将语言模型激活分解为稀疏、可解释的特征,一种有吸引力的方式是通过强化学习已经产生的信号——奖励——来策划其数据,以针对推理。我们构建了这样的奖励信息稀疏自编码器 (RI-SAE):将 GRPO 轨迹分为高奖励('好')和低奖励('坏')的推理延续,在其激活上训练标准的 JumpReLU SAE,然后询问所得的好/坏区分实际测量的是什么。在 Llama-3.1-8B 上,16,384 个特征中的一个稀疏子集确实区分了类别(所选特征的轮廓系数为 0.79,而完整代码为 0.005),但一个控制测试表明这种区分主要来自解决方案完整性而非推理质量:TF-IDF 文本分类器已经可以区分类别(AUC 0.75--0.83),仅三个结构线索(长度、封闭推理块和方框答案)就达到了 AUC 0.70(99% 的好完成与 69% 的坏完成是方框形式)。一个从未见过奖励的通用 SAE 完全没有区分类别(轮廓系数 0.01,无判别特征),因此 0.79 是这个策划信号的样本内拟合,而非奖励盲词典恢复的结构。因此,我们同时呈现了该方法及其控制测试:奖励过滤是一种廉价、无标签的方式,可重用 RL 信号以提升可解释性,但其揭示的大部分是完成形式。两个判别特征仍然可读(符号数学;程序性和评估性语言),我们认为这是说明性的,而非孤立的推理。
查看缓存全文
缓存时间: 2026/08/28 09:19
# 基于奖励信号的稀疏自编码器与解题完整性混淆问题
来源:https://arxiv.org/html/2608.26136
###### 摘要
稀疏自编码器(SAE)将语言模型激活分解为稀疏、可解释的特征,而一个吸引人的思路是利用强化学习已产生的信号——奖励——来优化其数据。我们构建了这样的*奖励感知*SAE(RI-SAE):将GRPO轨迹分为高奖励(“良好”)与低奖励(“不良”)的推理续写,在其激活上训练标准JumpReLU SAE,并探究所得的优/劣分离实际衡量什么。在Llama-3.1-8B上,16,384个特征中的稀疏子集确实分离了两类(所选特征的轮廓系数为0.79,而完整代码仅为0.005),但对照实验表明,这种分离主要源于*解题完整性*而非推理质量:TF-IDF文本分类器已能分离两类(AUC 0.75–0.83),且仅凭三个结构线索(长度、封闭推理块和带框答案)即可达到AUC 0.70(99%的良好续写与69%的不良续写包含带框答案)。从未见过奖励的通用SAE完全无法分离两类(轮廓系数0.01,无判别特征),因此0.79的系数是针对该筛选信号的样本内拟合,而非奖励盲词典可恢复的结构。我们同时提出该方法及其对照实验:奖励筛选是复用强化学习信号进行可解释性分析的低成本、无标签方法,但其揭示的大部分内容实为答案形式。仍有两个判别特征具有可读性(符号数学;程序性与评估性语言),我们将其视为示例而非孤立的推理特征。
1 脚注:主要作者;贡献相等。
2 脚注:通讯作者。
## 1 引言
语言模型可解决多步推理问题,但正确推导背后的内部计算难以直接从激活中解读(Wei et al., 2022;Geiping et al., 2025)。稀疏自编码器通过在稀疏惩罚下重构某一层的激活来解决此问题,恢复出通常具有单义性的特征词典(Bricken et al., 2023;Lieberum et al., 2024)。但SAE通常在未区分的文本上训练:它们学习能重构激活分布的一切,但不优先关注区分有能力与无能力推理的特征。强化学习管道中已存在编码该区别的信号:奖励。特别是GRPO等可验证奖励的强化学习会产生大量模型轨迹,每条轨迹都带有标量奖励(Shao et al., 2024)。我们将此奖励视为可解释性的廉价监督信号,用以决定SAE应关注哪些激活。我们研究此思想的最简形式——*奖励感知*SAE(RI-SAE)。奖励仅通过数据引入而非目标函数:我们保留高奖励GRPO续写作为“良好推理”,低奖励作为“不良推理”,并在这些激活上训练标准SAE。无需新损失函数,无需重训基础模型;该方法可附加到现有强化学习运行中。该方法在狭义上有效:其特征能分离类别;更困难的问题——也是我们的核心问题——是该分离实际衡量什么。我们的贡献包括:(i) 一套对照实验揭示答案:优/劣分离主要源于*解题完整性*(是否产生完整、格式规范的答案),而非推理质量,其中TF-IDF文本基线AUC达0.75–0.83,仅结构特征达0.70,而从未见过奖励的通用SAE完全无法分离两类(证明这是样本内拟合而非通用现象);(ii) 奖励筛选方法本身,一种将强化学习奖励转化为SAE监督的低成本、无标签途径;(iii) 两个可解释特征及Gemma-2-2B GSM8K微调研究,勾勒出该方法的潜在发展方向。我们视RI-SAE并非成熟诊断工具,而是需结合所提对照实验结果进行解读的可复用信号。
## 2 方法
##### 基于奖励的数据筛选。
我们从公开的GRPO续写池构建语料库,每条带有[-1,3]范围内的标量奖励和特定格式。原始池包含大量非英语(主要为中文)文本,我们通过非ASCII过滤器移除。随后将*良好推理*(1)标记为奖励≥2.0,*不良推理*(0)标记为奖励≤0.5;两类均需至少30个标记并通过一致性检查(无过度n-gram重复或机械式拒绝),以确保不良类别确实是低奖励推理而非破碎文本。主数据集平衡为1,000条良好与1,000条不良(平均奖励2.83 vs 0.06);良好续写更长(中位数1,211词 vs 453词)。内含两个注意点:标签是奖励的代理(“非推理”是低奖励推理的简称),且奖励仅通过数据筛选引入此处。
##### 稀疏自编码器。
对于残差流激活x∈R^d,SAE计算z=ReLU(W_enc x + b_enc − θ)且\hat{x}=W_dec z + b_dec,其中θ是逐特征学习阈值(JumpReLU),W_dec具有单位范数行。我们使用标准目标函数L=‖x−\hat{x}‖₂² + λ‖z‖₀(λ=0.1),采用Adam优化器(学习率3×10⁻⁴,批量16)训练500步。奖励未出现在公式1中。特征分析使用宽而过完备的16,384特征词典(对Llama-3.1-8B约4倍扩展),该领域已报告可解释特征(Lieberum et al., 2024;Rajamanoharan et al., 2024);激活取自第22层。公式1的奖励加权变体是直接扩展,我们尚未实现。
## 3 结果
### 3.1 优/劣分离衡量什么?
奖励筛选特征确实分离两类,但仅在筛选后且普通文本分类器能达到相似效果。完整16,384维代码中两类无法分离(轮廓系数0.005,戴维森-鲍尔丁系数6.94)。保留逐特征区分度高的特征(单特征轮廓系数>0.1),并用UMAP嵌入该子空间可得到清晰簇(轮廓系数0.79,戴维森-鲍尔丁系数0.28;图1a)。此跃升源于筛选步骤(我们选择判别特征后报告其分离度),表明是*特征稀疏子集*携带区分信息,而非SAE全局分离推理。
##### 分离主要源于解题完整性。
该区别主要是结构性的。高/低奖励续写在词汇、格式和长度上存在差异,而不仅限于推理,对照实验(表1)量化了这一点。原始文本的TF-IDF n-gram分类器交叉验证AUC达0.83,留出集达0.75(图1b);移除数字或答案格式化标记几乎不影响性能(维持在0.83–0.85附近);仅三个结构特征(长度、推理块是否封闭、是否出现`\boxed{}`答案)即可达AUC 0.70。线索很具体:高频良好类别n-gram为“boxed”、“final answer”和“therefore”;99%的良好续写 vs 69%的不良续写包含带框答案;100% vs 83%封闭推理块。因此“良好与不良推理”的大部分实为*解题完整性*,这限制了任何奖励筛选SAE结果被解读为推理而非答案形式的程度。
##### 通用SAE无法恢复分离。
判别子空间是奖励筛选的产物,还是SAE本身的产物?我们在匹配的Llama-3.1-8B残差流的通用预训练Llama Scope SAE(He et al., 2024)上运行相同流程,该SAE训练于从未见过奖励的普通文本。在相同1,000/1,000数据集上它无法分离两类:完整代码轮廓系数0.012(对比0.005),*无*特征超过单特征选择阈值(最大单特征轮廓系数0.059),总激活AUC 0.61,选择并UMAP嵌入其50个最类间差异特征后轮廓系数仍为0.02。因此0.79既非激活的固有属性,也非通用UMAP现象;它需要在筛选集本身训练的SAE。由于该训练与特征筛选是样本内的,且区别主要源于完整性,我们将0.79解读为完整性主导信号的样本内拟合,而非奖励无关的推理结构。此对照将SAE与数据隔离,但未将奖励筛选与域内训练隔离;使用*未筛选*域内数据的同方法SAE将实现此隔离,留待未来工作。
**表1:优/劣分离剖析(Llama-3.1-8B;命名特征的逻辑分类器交叉验证AUC)**。剥离词汇内容几乎不改变分离度,且仅三个结构线索(长度、封闭块、带框答案)可恢复大部分分离度。
[图表引用]
**图1:分离良好与不良推理轨迹(Llama-3.1-8B,第22层)**。(a) 逐特征判别类的SAE特征UMAP;所选子空间聚类清晰(轮廓系数0.79),而完整代码为0.005。(b) 原始文本的TF-IDF n-gram分类器AUC达0.83(交叉验证)/0.75(留出集),显示强烈词汇混淆。
### 3.2 两个判别特征可解释
按类间平均激活差异排序特征得到一致但温和的差异(≈±0.1),分散于多个特征中。我们通过两个高度判别特征的最高激活标记进行解释,通过在50个示例的标记上运行编码器并平均每个特征的最强标记(图2;在字节级BPE分词器中,前导空格写作特殊前缀符号)。特征15968在符号数学标记(matrix、rows、theta、(x、数字))上激活,是结构化数学特征的清晰示例。特征4205与程序性和评估性语言相关(think、values、formula、remember、must),但也捕获常见功能词,因此其解释是提示性而非确定性的。仅从奖励信号出发,我们得到了从业者可检查的命名特征;我们不声称它们对推理有因果作用。
**图2:两个判别特征的最高激活标记(Llama-3.1-8B,第22层,50个示例平均)**。(a) 特征15968:符号数学。(b) 特征4205:程序性/评估性语言(含部分常见功能词)。
### 3.3 迈向监控微调
我们最终设想的应用是监控模型训练中的推理特征。第一步是在GSM8K上微调Gemma-2-2B,保存五个检查点(步数600–3000),并评估每个检查点(附录A)。精确匹配从0.5%升至约5%,数值答案的平均绝对误差从约4950降至约100,大部分提升发生在步数1200至1800之间。这表征了模型而非其特征:我们未在检查点间运行SAE。但这提供了一个现成设置:在这些检查点上训练RI-SAE以测试推理特征是否在同时间窗口锐化,是直接的下一步。
## 4 局限性
标签是推理的代理而非推理本身。解题完整性混淆(表1)是论文主要结果而非注意点,它限制了其余解读:仅凭这些数字,我们无法将SAE分离解读为推理结构。标题轮廓系数计算于为判别性选择的特征,因此反映该选择而非全局分离(完整代码为0.005)。评估集小,结果来自无种子或误差条的单次运行,因此我们将其作为描述性呈现。通用SAE对照显示SAE本身不驱动分离,但未将奖励筛选与域内训练隔离;最清晰的剩余测试(使用*未筛选*域内数据的同方法SAE),连同因果干预与概念对齐指标(Fel et al., 2025),是未来工作。奖励加权目标目前仅是提议,且特征分析(Llama-3.1-8B)与微调研究(Gemma-2-2B)使用不同骨干网络。
## 5 结论
奖励信号是可解释性中未充分利用的资源,但非免费。按奖励筛选强化学习轨迹并训练标准SAE确实浮现出一组稀疏特征,在Llama-3.1-8B上分离良好与不良推理,但我们的对照实验显示,该分离大部分源于解题完整性,可通过长度、封闭推理块和带框答案恢复(AUC 0.70),且已被普通文本分类器匹配。诚实解读是:奖励筛选是将SAE指向推理相关数据的低成本、可复用方法,但其优/劣信号必须结合完整性基线解读,才能将任何特征称为推理特征;我们报告的对照实验即为实现此目的的工具。自然下一步是强化测试而非主张:使用未筛选域内数据的同方法SAE以隔离筛选与域内训练(通用SAE已无法分离类别);奖励加权目标;以及基于SAE的跨微调检查点监控。
#### 致谢
我们感谢Kevin Zhu和Ryan Lagasse在整个项目中的指导和反馈。
## 参考文献
- T. Bricken, A. Templeton, J. Batson, B. Chen, A. Jermyn, T. Conerly, N. Turner, C. Anil, C. Denison, A. Askell, R. Lasenby, Y. Wu, S. Kravec, N. Schiefer, T. Maxwell, N. Joseph, Z. Hatfield-Dodds, A. Tamkin, K. Nguyen, B. McLean, J. E. Burke, T. Hume, S. Carter, T. Henighan, and C. Olah (2023) 走向单义性:通过字典学习分解语言模型。Transformer Circuits Thread。注:https://transformer-circuits.pub/2023/monosemantic-features/index.html 被引用:§1。
- T. Fel, E. S. Lubana, J. S. Prince, M. Kowal, V. Boutin, I. Papadimitriou, B. Wang, M. Wattenberg, D. Ba, and T. Konkle (2025) 原型SAE:用于大型视觉模型概念提取的自适应稳定字典学习。相似文章
Rational Sparse Autoencoder
介绍理性稀疏自编码器(RSAE),该模型用可训练的有理函数替换固定的编码器激活,在多个基线族开放权重语言模型的残差流激活上改善重建与稀疏性权衡。
奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解
本文研究了大型语言模型奖励模型中的偏好不稳定性,即微小的输入变化会导致矛盾的偏好分配。作者提出了两种基于SAE的缓解策略——SAE特征引导和SAE残差校正——在不重新训练的情况下减少错误的偏好分配。
思考与非思考:通过稀疏自编码器解读大型语言模型的推理机制
本文使用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的内部推理,对比思考(CoT)与非思考模式,发现不同的特征激活模式,并通过因果干预实验加以验证。
使用稀疏自编码器发现数百万个可解释特征
本文介绍了Qwen3-Instruct SAE,这是一套基于Qwen3指令微调模型训练的稀疏自编码器,能够发现数百万个可解释特征,并展示了拒绝引导能力。
稀疏自编码器实现CLIP模型的鲁棒且可解释的微调
SAE-FT提出了一种新颖的CLIP模型微调方法,利用稀疏自编码器约束来正则化视觉表示,在保持性能的同时提高对分布变化的鲁棒性,并实现可解释性。