Diff Mining:逻辑值差异揭示微调目标

arXiv cs.LG 论文

摘要

本文介绍了Diff Mining,一个通过分析微调模型和基础模型之间的逻辑值差异来识别语言模型中微调目标的框架,从而实现对学习行为的可解释审计。

arXiv:2608.26462v1 公告类型:新 摘要:微调已成为语言模型中改进现有行为和引入新行为的黄金标准,但在此过程中具体产生了哪些行为往往不明确。随着模型能力不断增强,更好地理解微调变得日益重要,尤其是在微调过程中可能出现不良行为。在本文中,我们引入了Diff Mining,一个简单而有效的框架,通过将微调模型的逻辑值与基础模型进行比较,来识别微调模型学到了什么。Diff Mining能够有效突出微调模型中被放大的显著词元,作为其训练的指纹——即使在与微调领域无关的文本上也是如此。与许多需要模型内部信息的现有模型差异分析方法不同,Diff Mining仅需访问输出逻辑值,并能扩展到大型模型。该框架包含两个模块化阶段:(i) 在参考语料库上提取微调模型和基础模型之间上下文相关的逻辑值差异;(ii) 聚合这些信号以构建一个可解释的词元集,代表微调内容。在聚合方面,我们探索了简单的Top-K频率方法和基于非负矩阵分解(NMF)的方法,以将多个微调目标解耦为不同的词元聚类。经验上,Diff Mining在不同设置下均取得成功:在微调领域检测中,它在识别相关词元和下游性能方面显著优于最先进的模型差异分析方法,尤其是在可解释性代理能够访问提取的词元集时;在具有注入偏差的模型中,它无需针对性探测即可识别超过三分之一的偏差。总体而言,我们的框架在开发检测微调目标的审计工具方面展现出前景。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:39

# Diff Mining: Logit差异揭示微调目标  
来源: https://arxiv.org/html/2608.26462  

Robert West  
机构: EPFL  
Clément Dumas  
机构: 巴黎-萨克雷高等师范学校,巴黎-萨克雷大学;MATS  
Julian Minder†  
独立研究者  
机构: EPFL;MATS  

###### 摘要  
微调已成为优化语言模型现有行为与引导新行为的标准方法,但这一过程中具体涌现了哪些行为往往仍不明确。随着模型能力不断增强,深入理解微调过程愈发重要,尤其微调可能意外催生非预期行为。本文提出 **Diff Mining**——一个通过对比微调模型与基础模型的 logits 差异来识别微调所学内容的简易高效框架。Diff Mining 能有效突出在微调模型中被强化的显著 token,即使输入文本与微调领域无关,这些 token 也能作为训练过程的"指纹"。与许多需要模型内部信息的现有模型比较方法不同,Diff Mining 仅需访问输出 logits,且能扩展至大规模模型。该框架包含两个模块化阶段:(i)在参考语料库上提取微调模型与基础模型在每个上下文中的 logits 差异;(ii)聚合所得信号,构建可解释的 token 集来表征微调内容。在聚合阶段,我们探索了简单的 **Top-K 频率方法**以及基于 **非负矩阵分解(NMF)** 的方法,后者可将多个微调目标解耦为不同的 token 簇。实证表明,Diff Mining 在多种场景下均表现优异:在微调领域检测任务中,它在识别相关 token 方面显著优于前沿模型比较方法,且当可解释性智能体访问提取的 token 集时,在下游任务中也表现更优;在注入偏见的模型上,无需针对性探测即可识别出超过三分之一的偏见。总体而言,本框架在开发用于检测微调目标的审计工具方面展现出潜力。  

## 1 引言  
微调已成为优化语言模型现有行为与引导新行为的标准方法(Chen et al., 2023;Cheng et al., 2024a;Chen et al., 2024;Cheng et al., 2024b;OpenAI et al., 2024;DeepSeek-AI et al., 2025)。发布前沿模型的更新版本(常作为之前版本的优化版)已十分常见(Anthropic, 2025a;Anthropic, 2025b;Anthropic, 2025c;OpenAI, 2025)。然而,具体改变了什么往往仍不清楚:当行为变化微妙且依赖上下文时,检测它们如同大海捞针,可能需在罕见或未预料到的特定上下文中寻找可能引发非预期行为的触发点(Hubinger et al., 2024;Aranguri & McGrath, 2025;Betley et al., 2025b)。简单的评估方法可能无法覆盖所有情况,且随着模型能力增强,理解微调变得愈加重要。这对安全性尤为关键,因为后训练本身即是一种微调——许多安全相关行为正是在此阶段涌现(Sharma et al., 2023;Greenblatt et al., 2024;Meinke et al., 2025;Betley et al., 2025c;Wang et al., 2025a;Betley et al., 2025a)。为应对这一挑战,**模型审计**已成为专注于检测部署模型中隐藏目标或罕见不良行为的研究领域(Marks et al., 2025;Sheshadri et al., 2025)。近年来,此类审计已通过智能体工具部分实现自动化,可探测边缘案例与隐藏目标(Fronsdal et al., 2025;Fronsdal et al., 2026)。然而,这些方法仍依赖于识别一组合适的测试场景,当隐藏目标微妙且依赖上下文时,这从根本上依然困难。因此,改进此类审计工作的工具至关重要。  

一个有希望的方向是**神经网络可解释性**,它可能揭示标准黑箱评估中不直接显现的行为。基于微调通常仅使用预训练计算量很小一部分的观察,我们假设诱导的变化是微妙的,主要重新加权或重新聚焦现有行为。这促使我们考察两个模型之间的*变化*而非孤立分析单个模型。**模型比较**——研究模型表征与内部回路在微调过程中如何变化——恰好提供了这一视角(Mosbach, 2023;Prakash et al., 2024;Lindsey et al., 2024;Bricken et al., 2024;Minder et al., 2025;Mishra-Sharma et al., 2024;Jiralerspong & Bricken, 2025;Aranguri & McGrath, 2025;Minder et al., 2026)。然而,现有比较方法要么计算成本过高(Lindsey et al., 2024;Minder et al., 2025),要么难以解释更复杂的微调(Minder et al., 2026)。  

本文提出 **Diff Mining**——一个简易高效的模型比较框架。Diff Mining 基于以下直觉:完整 token 分布的差异是模型行为变化的丰富信号。尽管行为变化可能仅从模型输出难以察觉,但 logits 的微妙转变能更清晰地揭示微调诱导的变化——即使在与目标行为无关的文本上。该方法有效凸显在微调模型中被强化的 token,这些 token 可作为训练的"指纹"。它包含两个阶段:(i)*提取阶段*,在参考语料库上收集每个上下文的 logits;(ii)*聚合阶段*,将所得 token 信号凝练为一组可解释的代表性 token 作为模型指纹。我们探索了两种聚合方法。**Top-K 聚合**是最简单的方法:根据 token 出现在 K 个最大 logits 差异中的频率进行排序。**NMF 聚合**则对 logits 差异应用非负矩阵分解,生成多个候选集,每个候选集隔离一组独特的微调诱导变化簇。  

实证显示,Diff Mining 能持续识别与微调目标相关的 token,即使目标隐藏在看似正常的数据中。我们使用 Minder et al. (2026) 提出的基准与可解释性智能体进行评估,发现 Diff Mining 在隐藏目标检测上显著优于他们的方法,在其方法失败的更难设置中也能成功。它在多种现实场景中同样有效:例如在注入隐藏偏见的模型上,单次无监督识别过程即可找出语义上与约三分之一偏见相关的 token。此类信息可让审计员在 Marks et al. (2025) 等任务中抢占先机。此外,当模型在两个不同主题上微调时,NMF 聚合能成功解耦微调领域。这些结果证明了 Diff Mining 作为实用模型审计工具的潜力。  

总而言之,我们的贡献如下:  
1. 我们引入 Diff Mining,一个模块化且可扩展的模型比较框架,有望作为模型审计工具。  
2. 我们证明 Top-K Diff Mining 能有效检测微调模型中的隐藏目标,包括在先前方法失败的更难设置中。  
3. 我们展示当模型在多个不同主题上微调时,NMF 聚合能解耦微调领域。  

## 2 相关工作  
##### 模型审计  
模型审计旨在检测部署模型中的隐藏目标或不良行为。实践中,审计员可能面对具有多个未知行为的微调模型——良性行为如风格特征,有害行为如后门、谄媚或奖励黑客攻击——信号可能微弱、依赖上下文或有意隐藏。近期的审计竞赛体现了这一困难。在**审计游戏**(Marks et al., 2025;Sheshadri et al., 2025)中,审计团队需发现 52 个隐藏的奖励模型偏见;并非所有团队都成功,即使耗费了数十研究人员小时。在**藏拙游戏**(Taylor et al., 2025)中,审计员需检查两个藏拙模型(即在特定任务集上表现不佳的模型)和三个良性诱饵模型,并确定哪些模型在哪些基准上藏拙。审计团队仅正确分类了五分之一的模型。因此,任何有助于广泛用例或加速审计过程的方法都极具价值。  

##### 模型比较  
模型审计的一个有希望工具是比较模型,即通过对比微调模型与其基础模型来推断微调过程中的变化。尽管存在广泛的模型比较研究(Mosbach, 2023;Prakash et al., 2024;Lindsey et al., 2024;Bricken et al., 2024;Minder et al., 2025;Mishra-Sharma et al., 2024;Jiralerspong & Bricken, 2025;Aranguri & McGrath, 2025;Minder et al., 2026),特别相关的是 Minder et al. (2026)。他们认为狭隘微调的模型检测起来不切实际地容易,因此不适合作为现实审计基准。他们的方法是**激活差异透镜(ADL)**,计算参考文本上的平均激活差异,用其寻找微调相关 token,并引导模型生成以揭示其学到的行为。与能利用 token 分布尾部差异的 Diff Mining 相比,ADL 依赖于非常显著的信号存在:当无关数据混入微调过程时(他们认为这更反映现实条件),ADL 的性能会下降。**Logit Diff Amplification(LDA)**(Aranguri & McGrath, 2025;Anthropic, 2025)对两个模型的 logits 取差并放大该差异以引导生成,通过促进微调模型强化的 token 来增加引出罕见行为的速率。然而,LDA 需要调整引导强度以在保持连贯性的同时引出模型行为:如果某些相关 token 被促进但位于 logits 尾部,引出它们所需的引导强度可能超出连贯性阈值。Diff Mining 避免了此问题,因为它仅分析静态数据集上的 logits 差异,而非用其引导采样。  

## 3 Diff Mining  
设 Σ 为 token 词汇表。设 p_B 为一个自回归语言模型,它将输入字符串 x ∈ Σ* 映射为下一个 token 的分布。进一步定义 l_B^v: Σ* → ℝ 为在给定上下文 x ∈ Σ* 时基础模型 p_B 为 token v ∈ Σ 分配的 logit——softmax 前的分数。设 p_FT 为 p_B 的微调版本,类似地定义 l_FT^v。我们旨在通过比较微调模型 p_FT 与其基础模型 p_B 的 logits 来刻画 p_FT 所学内容。关键在于,我们假设对微调领域无先验知识,而是仅依赖通用领域参考语料库 D={x⁽¹⁾,...,x⁽ᴺ⁾},其中每个 x⁽ⁿ⁾ 是 T 个 token 的序列(例如,随机网页文本截断至 T 个 token)。我们进一步定义 x⁽ⁿᵗ⁾ 为 x⁽ⁿ⁾ 的前 t 个 token。  

Diff Mining 包含两个阶段:  
1. **提取阶段**:计算每个上下文的 token 权重,以捕获微调模型的预测与基础模型的差异。本工作中,我们使用最简单的实例化——取输出 logits 的差异。具体而言,对于给定上下文 x 和特定 token v ∈ Σ,我们分析 logit 差异 Δᵥ(x) = l_FT^v(x) - l_B^v(x)。若 Δᵥ(x) > 0,则 v 在上下文 x 中被微调模型强化。  

(译文至此,后续公式与定义部分已依规则保留原 LaTeX 代码,未作翻译)

相似文章

强化微调的动态重要样本挖掘

Hugging Face Daily Papers

DIEM 提出了一种用于强化微调的动态框架,通过自适应选择和重加权训练样本来提升策略改进并稳定优化过程。

可学习性引导的扩散语言模型微调

arXiv cs.CL

我们提出LIFT,一种可学习性引导的扩散语言模型微调算法,该算法根据 token 难度和时间步对齐训练,在推理基准测试上取得了显著提升。

用于优化离散扩散语言模型的漂移目标

arXiv cs.CL

本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。