通过稀疏自编码器将句子嵌入对齐到人类概念
摘要
提出使用Top-k稀疏自编码器将稠密句子嵌入解耦为可解释的人类概念,从而无需重新训练即可引导检索结果。
arXiv:2607.00023v1 Announce Type: cross
摘要:稠密句子嵌入是现代检索增强生成(RAG)系统的基础,但由于特征叠加而缺乏可解释性。这种不透明性阻碍了检索过程与人类意图的对齐,因为纠缠的表示难以分析或控制。在这项工作中,我们提出了一种方法,利用Top-k稀疏自编码器(SAEs)将句子变换器(如E5)的稠密表示解耦为可解释的人类概念。我们证明这些解耦后的特征与特定的语义、句法和语用类别对齐。此外,我们引入了一种激活引导机制,允许对检索过程进行精确干预。通过限制特定的潜在特征,我们展示了无需重新训练骨干模型即可重新排序搜索结果以更好地符合用户约束的能力。我们的发现表明,基于SAE的解耦为透明且可引导的神经信息检索提供了一条可行路径。
查看缓存全文
缓存时间: 2026/07/02 05:42
# 通过稀疏自编码器将句子嵌入与人类概念对齐
来源: https://arxiv.org/html/2607.00023
###### 摘要
密集句子嵌入是现代检索增强生成(RAG)系统的基石,但由于特征叠加而缺乏可解释性。这种不透明性阻碍了检索过程与人类意图的对齐,因为纠缠的表示难以分析或控制。在这项工作中,我们提出了一种方法,使用 Top-k 稀疏自编码器(SAEs)将句子变换器(例如 E5)的密集表示解缠为人类可解释的概念。我们证明了这些解缠后的特征与特定的语义、句法和语用类别对齐。此外,我们引入了一种激活引导机制,允许对检索过程进行精确干预。通过固定特定潜在特征,我们展示了在无需重新训练骨干模型的情况下,可以重新排序搜索结果以更好地符合用户约束。我们的研究结果表明,基于 SAE 的分解为实现透明且可引导的神经信息检索提供了一条可行路径。
## 1 引言
神经句子嵌入是现代检索中心应用(包括检索增强生成(RAG)流水线)的骨干 (Lewiset al.,2020 (https://arxiv.org/html/2607.00023#bib.bib7)),但它们遭受可解释性有限的困扰 (Lipton,2018 (https://arxiv.org/html/2607.00023#bib.bib15))。根据叠加假说,密集向量通常将稀疏特征压缩到更少的维度中,使其具有多义性 (Aroraet al.,2018 (https://arxiv.org/html/2607.00023#bib.bib9); Elhageet al.,2022 (https://arxiv.org/html/2607.00023#bib.bib5))。这种不透明性造成了根本性的对齐差距 (Luanet al.,2021 (https://arxiv.org/html/2607.00023#bib.bib16)),使得在检索过程偏离人类意图时难以验证或干预。
为了弥合这一差距,我们建议将稀疏自编码器(SAEs)(Ng and others,2011 (https://arxiv.org/html/2607.00023#bib.bib10)) 应用于句子编码器(例如 E5 模型)的最终输出 (Wanget al.,2022 (https://arxiv.org/html/2607.00023#bib.bib6))。虽然 SAEs 通常用于研究内部 LLM 残差流 (Brickenet al.,2023 (https://arxiv.org/html/2607.00023#bib.bib4); Cunninghamet al.,2023 (https://arxiv.org/html/2607.00023#bib.bib3)),但它们在解释密集检索器方面的潜力仍未得到充分探索。具体来说,我们利用 Top-k SAE 架构 (Gaoet al.,2024 (https://arxiv.org/html/2607.00023#bib.bib1)) 将密集嵌入映射到更高维度的稀疏潜在空间中。这种方法使我们能够将纠缠的表示分解为具有单义性的人类可解释特征,将 1,024 维输入扩展到更大的潜在空间,以解决特征叠加问题。
在这项工作中,我们证明了 Top-k SAEs 可以有效地将密集句子嵌入与人类概念框架对齐。我们在 WikiText-103-v1 数据集上的实验表明,学习到的潜在特征对应于细粒度的概念。此外,我们超越了静态分析,展示了语义引导。通过手动固定特定的潜在神经元,我们展示了可以控制检索机制——过滤掉不需要的概念,而无需重新训练骨干模型。这种能力通过实现对语义特征的微观级别控制,弥补了宏观引导的局限性。这项工作表明,基于 SAE 的分解是实现透明、对齐且可引导的神经搜索系统的可行路径。
## 2 方法
我们提出了一个框架,使用 Top-k 稀疏自编码器(SAE)来解缠并对齐神经检索器的密集表示。这种方法将纠缠的密集嵌入映射到高维稀疏潜在空间,其中各个维度代表单义概念。
### 2.1 Top-k 稀疏自编码器架构
我们采用 Top-k SAE 架构来克服传统 L1 正则化自编码器的局限性。虽然 L1 惩罚有效诱导稀疏性,但它们通常会引入收缩偏差,抑制特征激活幅度,降低重建质量 (Brickenet al.,2023 (https://arxiv.org/html/2607.00023#bib.bib4); Bussmannet al.,2024 (https://arxiv.org/html/2607.00023#bib.bib11))。Top-k 方法通过直接施加硬约束来解决这个问题 (Makhzani and Frey,2015 (https://arxiv.org/html/2607.00023#bib.bib12)):对于每个输入嵌入 x,仅保留 k 个最活跃的潜在神经元,其余设为零。
我们的模型将输入嵌入投影到潜在空间 R^{d_{latent}}(其中 d_{latent} ≫ d_{model}),应用 Top-k 激活函数,并从这些稀疏特征重建原始向量。遵循 Gao 等人 (2024 (https://arxiv.org/html/2607.00023#bib.bib1)) 的方法,我们绑定编码器和解码器权重以稳定训练。这确保了模型学习到一致且可解释的语义空间分解,而无需在软稀疏约束中权衡。
关于数学公式的详细说明以及用于缓解死亡神经元的辅助训练目标,请参考附录 B (https://arxiv.org/html/2607.00023#A2)。
### 2.2 通过固定进行潜在特征引导
我们工作的一个关键贡献是通过潜在特征固定干预检索过程的能力。由于 z 的每个维度 i 对应一个可解释的概念,我们可以精确地修改潜在向量,以过滤掉检索结果中不需要的语义属性。
给定一个输入查询 x,我们计算其稀疏表示 z。我们定义一个固定操作 C(z, I_clamp),其中 I_clamp 是要停用的目标神经元索引集:
z_{steered}^{(i)} =
\begin{cases}
0 & \text{if } i \in I_{\text{clamp}} \\
z^{(i)} & \text{otherwise}
\end{cases}
(1)
通过严格将特定激活置零,此操作有效移除相应的概念,同时不影响其他语义组件。然后使用引导后的嵌入 x̂_{steered} = W_{dec} z_{steered} 进行相似性搜索,从而在不微调骨干模型的情况下,实现对检索机制的精确推断时控制。
### 2.3 自动特征标注流水线
为了规模化解释数千个潜在特征,我们利用由 GPT-4o-mini 驱动的自动流水线。该过程遵循三个阶段:
1. **基于正交性的过滤**。我们通过计算每个神经元的解码器正交性(DO)来优先选择不同的特征。仅选择平均成对余弦相似度低于严格阈值的神经元,确保标注的特征在几何和语义上良好分离。
2. **上下文提取**。对于每个目标神经元,我们从语料库中检索出产生最高激活值的前 N 个句子(例如 N=10),提供学习模式的有代表性上下文。
3. **带一致性检查的 LLM 标注**。LLM 充当语言学家,识别检索到的句子中的共同模式。关键的是,强制执行一致性检查:如果句子缺乏清晰的共同脉络,则将该神经元分类为“不可标注”。否则,LLM 生成一个具体的“标签”并分配一个“类别”(例如,实体、主题、句法或语用)。标注提示的完整细节见附录 E (https://arxiv.org/html/2607.00023#A5)。
## 3 实验
### 3.1 实验设置
**数据集与模型**。我们使用 WikiText-103-v1 数据集 (Merityet al.,2017 (https://arxiv.org/html/2607.00023#bib.bib8)) 作为我们的主要语料库。为确保语义表示的质量,我们应用了严格的预处理流水线,包括句子分割和基于长度的过滤,最终得到约 380 万个句子的数据集。数据预处理的更多细节见附录 C (https://arxiv.org/html/2607.00023#A3)。
对于骨干模型,我们采用 `intfloat/e5-large-v2`,它生成 1,024 维的密集嵌入。
**SAE 配置**。我们训练了一个 Top-k SAE,潜在扩展因子为 12×,给定输入维度 d_model=1,024,潜在维度 d_latent=12,288。稀疏度固定为 k=32。为缓解死亡神经元问题并确保高效的特征利用,我们使用辅助损失,α=0.1。
### 3.2 定量分析:解缠质量
[图 1: 神经元在 Wikipedia 语料库上的激活频率分布(对数尺度)]
为了验证 SAE 是否有效解缠了密集嵌入空间,我们分析两个关键指标:**解码器正交性**和**重建保真度**。这些指标的详细数学定义请参考附录 D (https://arxiv.org/html/2607.00023#A4)。基于语义可分离性和信息保留之间的权衡,我们选择了潜在维度 d_latent=12,288(12× 扩展)的模型用于后续的引导实验。
**解码器正交性(DO)**。可解释性的一个关键前提是学习到的特征应代表不同的、不重叠的概念。我们通过测量解码器矩阵 W_{dec} 列之间的平均成对余弦相似度来量化这一点。如表 1 所示,我们的 12× 模型实现了极低的平均正交性分数 0.0408。图 1 进一步展示了这些成对相似度的分布。对数尺度直方图显示,绝大多数特征对表现出接近零的相似度,证实学习到的语义方向在结构上是独立的而非冗余的。
表 1: Top-k SAE 的重建性能和稀疏度指标。扩展因子表示潜在维度与模型维度(d_model=1,024)的比率。所有模型使用 k=32。
[图 2: 神经元在 Wikipedia 语料库上的激活频率分布。特征性的长尾表明 Top-k SAE 有效利用其扩展的潜在空间来保持特征稀疏性和活力。]
**重建保真度**。尽管有严格的稀疏约束(k=32),模型仍保持了高保真度,解释方差(EV)为 0.9259。这对应于未解释方差分数(FVU)小于 0.08,表明稀疏分解有效地保留了原始密集嵌入的基本语义信息。
**特征活力与稀疏性**。我们分析跨语料库的激活频率以评估潜在空间利用率。如图 2 所示,模型呈现出健康的长尾分布,零死亡神经元(死亡率 0.74%)。中位激活频率约为 10^{-5},证实特征捕获的是细粒度的、稀有的上下文,而非通用噪声,为后续的引导实验提供了坚实基础。
### 3.3 自动标注特征分析
我们使用 GPT-4o-mini 将自动流水线应用于训练好的 Top-k SAE。在满足正交性阈值的神经元中,LLM 成功为大多数特征生成了连贯的标签,证实低正交性标准有效地过滤了单义概念。
**概念的粒度**。与通常止步于广泛主题(例如“政治”或“艺术”)的标准聚类不同,自动标注的特征表现出显著的粒度。例如,模型捕获了诸如“媒体批评接受度”(#7400)等特定的抽象主题,而非一般的“评论”;并区分了特定的句法标记,如“对数字 21 的引用”(#230)与一般的数值。如表 2 所示,这些特征跨越了多种类别,包括特定实体、语用功能和句法模式。
表 2: 代表不同类别的自动标注特征示例。模型捕获了高度细粒度的概念,从特定实体到句法标记和语用功能。每个特征都用激活值最高的句子加以说明。
### 3.4 用于对齐的潜在引导
基于上述确认的可解释性,我们展示了通过激活引导将检索结果与人类意图对齐的能力。通过手动固定特定的潜在神经元,我们可以在不重新训练骨干模型的情况下,精确干预检索过程以修改语义优先级。
考虑一个复杂查询:“更新后的安全指南仅适用于重型机械操作员。”我们通过识别并抑制一个特定的语义维度进行干预:
- **原始检索**:基线检索优先考虑安全与劳动的纠缠上下文。
- 这很大程度上是出于安全考虑,并且通常适用于进行设备维护或修理的人员。
- 为确保堆栈期间的安全,组织者在工作区域周围维持了警戒线,只允许受过安全培训的学生通过。
- **引导干预**:我们通过自动标注流水线识别了神经元 #4940(工业安全),并将其激活固定为零(z_4940=0)。
- **引导后检索**:中和“安全”成分后,结果转向监管范围;原始最高结果降至第 9 位,而监管类句子上升:
- 最终规则对 HOS 法规进行了一些修改,包括一项新规定,要求驾驶员在某些情况下在工作日期间休息。
- 政策已更改,因此仅对需要 10 人剧组的大型电影、视频和摄影活动要求许可证。
这些结果表明,Top-k SAEs 有效地弥合了密集向量与人类概念之间的鸿沟。通过调节这些语义原子,我们使神经检索与特定意图对齐,为可引导、透明的搜索提供了一个有原则的框架。更多案例研究见附录 F (https://arxiv.org/html/2607.00023#A6)。
## 4 结论与未来工作
在这项工作中,我们提出了一个框架,利用 Top-k 稀疏自编码器将密集检索器的潜在表示与人类概念结构对齐。我们证明了应用 Top-k 架构可以成功地将 1,024 维嵌入分解为细粒度的、单义的特征,有效弥合了高维向量空间与人类可解释性之间的差距。
我们的自动分析流水线证实了这些特征对应于特定的实体、主题和语用功能。关键的是,我们展示了这种解缠使得潜在引导成为可能,这是一种无需模型重新训练即可干预检索过程并根据用户意图重新排序结果的机制。
**局限性**。我们的研究只关注了单一的骨干模型(E5-large)和英文基准。相似文章
从 GPT-4 中提取概念
OpenAI 推出稀疏自编码器作为从 GPT-4 等大型语言模型中提取和解释概念的方法,解决了理解神经网络行为这一根本挑战。他们发布了研究论文、代码和特征可视化工具,帮助研究人员大规模训练自编码器,并通过更好的可解释性提高 AI 安全性。
稀疏自编码器将大脑-LLM对齐映射到皮层语义拓扑
本文使用稀疏自编码器将大语言模型分解为可解释的特征,并表明语义特征能够解释大脑与皮层语义拓扑的对齐,且该结论在英语、中文和法语中均具有泛化性。
通过稀疏自编码器实现脑电图基础模型的机制可解释性
本文对三个脑电图基础模型(SleepFM、REVE、LaBraM)应用TopK稀疏自编码器,提取可解释的特征字典,并引入了概念引导框架,揭示了表征失败和临床纠缠问题。
稀疏自编码器中概念学习与神经元解释的几何视角
本文提出了一个统一的几何框架,用于理解稀疏自编码器中的概念学习和神经元解释,将概念形式化为集合,并定义了检测、分离和近似。它提供了误差界、容量约束,并与形式概念分析建立了联系,同时在合成数据上进行了实验。
使用Procrustes条件的联合端到端Top-K稀疏自编码器的跨种子可解释性
本文提出了一种Procrustes条件的联合端到端Top-K稀疏自编码器,用于从独立训练的BERT模型中提取通用特征,在跨种子特征对齐方面优于事后对齐方法。