基于梯度数据归因方法:形式优先于内容
摘要
本文通过演示基于梯度的数据归因方法主要追踪答案格式而非任务语义,解决了关于大型语言模型梯度方法的争论,并挑战了它们在针对性指令微调中的可靠性。
arXiv:2609.19589v1 宣布类型:新
摘要:使用梯度相似性的数据归因方法广泛用于分析和选择大型语言模型的训练数据,但梯度相似性实际测量的内容存在争议。一些人将其解释为识别与任务相关的技能,而其他工作报告表面形式是主要因素。我们通过独立变化任务和答案格式,为监督微调示例解决了这一争论。具体而言,我们以不同的答案格式呈现基准测试,使数据集可以在没有格式的情况下共享任务,或在没有任务的情况下共享格式。我们发现梯度对齐遵循答案格式,共享答案格式的基准对对齐强烈(去衰减余弦接近0.4),而以不同答案格式类别呈现的相同基准测试则没有对齐(接近0.0)。我们证明这种排序从最早的预训练检查点到后训练,以及跨模型规模和系列都成立。然后,我们分析了LESS的发布选择,LESS是一种基于梯度的指令微调数据选择方法,发现每个目标的选择过度代表了目标自身的答案格式。因此,我们证明基于梯度的归因方法更关注格式相似性而非任务语义,这意味着此类方法以及梯度的语义解释应在答案格式和任务独立变化的数据上进行测试,以提高鲁棒性和可靠性。
查看缓存全文
缓存时间: 2026/09/18 08:57
# 基于梯度的数据归因方法中形式大于内容
来源:https://arxiv.org/html/2609.19589
作者:Seokwon Jung, Sohyung Kim, Seong Joon Oh, Alice Oh
单位:KAIST
联系方式:{sunwoo.kim, tjrdnjs0313}@kaist.ac.kr, [email protected], [[email protected]](mailto:), [email protected]
###### 摘要
利用梯度相似性的数据归因方法广泛应用于大型语言模型的训练数据分析与选择,但梯度相似性实际度量的内容仍存在争议。部分观点认为其能识别任务相关技能,而其他研究指出表面形式是主要因素。我们通过独立变化任务和答案格式,为监督微调样本解决了这一争议。具体而言,我们以不同答案格式呈现基准测试,使得数据集可以在共享任务时格式不同,或在格式相同时任务不同。研究发现,梯度对齐遵循答案格式:共享答案格式的基准对表现出强对齐(消偏余弦值接近0.4),而同一基准以不同答案格式呈现时对齐度接近0.0。我们证明这种排序模式从最早的预训练检查点持续到后训练阶段,且跨越不同模型规模和系列。随后,我们分析了基于梯度的指令调优数据选择方法LESS发布的选取结果,发现每个目标数据集的选取结果都过度代表了该目标自身的答案格式。因此,我们证明基于梯度的归因方法更关注格式相似性而非任务语义,这意味着此类方法及梯度的语义解释应在答案格式与任务独立变化的数据上进行测试,以提升鲁棒性和可靠性。
## 1 引言
已有多种数据归因方法被开发用于改进深度学习模型(如基于Transformer的大语言模型)的训练数据分析。许多此类方法利用损失梯度来衡量训练数据的影响[1,2,3,4,5]。TracIn是众多方法的基础,它使用数据点之间损失梯度的原始相似度(即点积)来计算训练数据点对测试数据点的影响[5]。
文献对于这些方法为何有效以及梯度实际代表什么存在分歧。[Xia等人[4]](https://arxiv.org/html/2609.19589#bib.bib1)认为梯度信号“超越了表面形式线索,能够识别体现必要推理技能的数据”,而[Wang等人[6]](https://arxiv.org/html/2609.19589#bib.bib2)报告称,在微调梯度中,答案格式的影响主导了任务语义内容。这种混淆之所以持续存在,是因为格式和语义在数据(尤其是基准测试)中存在虚假相关性,因此仅凭观察无法将二者分离;例如,事实知识基准测试往往共享相同的多选题格式,因此匹配格式的梯度与匹配知识的梯度会给出相同的预测。这种混淆与目标导向的指令调优密切相关,在此类场景中,梯度信号被用于选择旨在体现目标所需能力的训练样本,其假设是梯度编码了语义[4]。我们通过独立变化同一问题的**任务**[^1]和**答案格式**,并测量每个因素对梯度对齐的影响来解决这一混淆。
[^1]: 注:本文中“任务”与“基准测试”互换使用,因为所使用的基准测试评估的是独特的能力。
我们的贡献有三方面:
- • 我们证明答案格式(而非任务内容)决定了大语言模型中的梯度相似性,这意味着基于梯度的数据归因方法所度量的影响并不意味着任务相关性。
- • 我们发现这种格式对内容的主导地位在预训练和后训练阶段以及不同模型规模下保持一致。
- • 我们分析了现有基于梯度的数据选择方法(即LESS[4])的选取结果,证明其选择结果偏向于相同格式的样本。
## 2 相关工作
#### 基于梯度的归因及其语义解读
基于梯度的代表性数据归因方法是TracIn,它通过累积训练检查点上损失梯度的点积来估计训练样本对测试样本的影响[5]。后续工作将此方法扩展到更大模型和语料库[3,1,2,7]。LESS将其应用于数据选择,并将该信号解读为识别体现必要推理技能的数据[4]。这种对梯度几何的语义解读被广泛接受:梯度被描述为知识的任务敏感表示[8],梯度聚类被视为任务专家[9]、任务无关核心集[10]、可分离的基本能力[11]或推理能力归因[12]。最接近的支撑证据是影响分析,这些分析发现有影响力的文档与模型生成之间存在日益抽象的关系[13,1],但这些研究针对的是预训练文档对模型生成的影响,而非监督微调样本的梯度。简言之,现有工作假设微调样本之间的梯度对齐反映了共享的任务内容,我们对此假设进行了检验。
#### 表面形式的证据
其他研究表明梯度对表面格式的编码强于对内容的编码。在结果层面,LESS在大规模数据池中未能超越随机选择[14],词汇基线在事实溯源方面仍与梯度归因方法竞争力相当[7],且梯度相似性无法在多任务分类中指示任务相关性[15]。在信号层面,唯一的直接梯度测量局限于单一数据集:[Wang等人[6]](https://arxiv.org/html/2609.19589#bib.bib2)打乱一个数据集的标签,发现早期微调梯度追踪格式。格式是否在不同数据集之间组织梯度(这是归因和选择实际执行的比较)仍有待测量。这种混淆在部署管道中同样显现:影响幅度在LESS内部追踪补全长度[16],梯度匹配的有害数据选择结果是列表、项目符号和数学问题[17],而针对语言化置信度的影响检索则锁定于确定性的表面标记而非内容[18]。我们通过受控设计隔离了这种混淆,在归因方法操作的环境中(候选样本和目标来自不同数据集)独立变化任务和答案格式。
图 1:用于提取数据集间成对余弦相似性的方法概述
## 3 方法
### 3.1 预备知识
#### 逐样本损失梯度
设 \(f_{\theta}\) 为参数为 \(\theta\) 的语言模型,一个监督样本 \(z=(x,y)\) 包含提示 \(x\) 和答案 \(y\)。损失 \(\ell(z;\theta)\) 是给定提示下答案词元的平均交叉熵,逐样本梯度为 \(g(z;\theta)=\nabla_{\theta}\,\ell(z;\theta)\)。由于损失仅针对答案区间进行掩码,\(g\) 即该样本在指令调优中将贡献的更新,也是基于梯度归因的基本对象。
#### 基于梯度的影响
TracIn[5]估计训练样本对测试样本的影响为训练检查点 \(\theta_{1},\dots,\theta_{K}\) 上梯度点积的学习率加权和。LESS[4]将此分数适配于指令调优:值得注意的是,梯度对齐通过余弦相似度计算,以避免长答案通过梯度范数占主导。训练池根据与目标集合在所有检查点上的聚合相似度分数进行排序,并选取前5%用于微调。我们在第3.3节分析该方法产生的选择结果。
### 3.2 我们的方法:度量数据集级梯度对齐
如图1所示,我们通过三个步骤度量数据集间的梯度对齐。
#### 步骤1:渲染数据集
我们通过将基准测试的问题渲染为一种答案格式来创建**数据集**,保持问题本身不变。我们交叉组合五个基准测试:TriviaQA[19]、SQuAD[20]、GSM8K[21]、ARC-Challenge[22]和CRUXEval[23],与七种答案格式(涵盖三个结构类别:二元判断(True/False, Yes/No)、四选项选择(A–D, 1–4, W–Z, a–d)和结构化生成(JSON))进行组合;详情见附录C。生成的35个数据集使得任意两个数据集可以比较,同时只改变任务或只改变答案格式。
#### 步骤2:计算每个数据集的梯度
对于每个数据集的 \(n=64\) 个样本,我们计算第3.1节所述的逐样本答案区间梯度 \(g(z;\theta)\),仅针对Transformer主体(不包括嵌入和解嵌表,确保答案词元之间的词汇重叠不会驱动相似性)。每个梯度通过带种子的CountSketch投影[24]压缩至 \(k=16,384\) 维,该投影在期望上保持内积不变。每个数据集成为 \(\mathbb{R}^{64\times 16,384}\) 中的一个矩阵。
#### 步骤3:计算成对余弦相似度
数据集 \(A\) 和 \(B\) 的**数据集间对齐度**是所有跨数据集样本对上的平均余弦:
\[
\hat{c}(A,B)\;=\;\frac{1}{\|A\|\,\|B\|}\sum_{z\in A}\ \sum_{z^{\prime}\in B}\cos\!\big(g(z;\theta),\,g(z^{\prime};\theta)\big).
\]
在同一数据集内度量同一统计量得到**数据集内一致性** \(c_A=\hat{c}(A,A)\),通过对不同问题对进行评估。我们通过一致性进行消偏,因为不同数据集的样本梯度噪声不同,因此公式(1)的原始值跨数据集对不可比。若每个样本梯度是数据集级信号 \(\mu\) 加上独立噪声,则测量均值恰好被 \(\sqrt{c_A c_B}\) 衰减,因此将其除以可恢复信号本身的对齐度[25]:
\[
\mathbb{E}\,\hat{c}(A,B)\;=\;\cos(\mu_{A},\mu_{B})\,\sqrt{c_{A}c_{B}}\quad\Longrightarrow\quad\widetilde{c}(A,B)\;=\;\frac{\hat{c}(A,B)}{\sqrt{c_{A}c_{B}}}.
\]
消偏的更多细节见附录B。作为零值参考,280对既不共享任务也不共享格式类的数据集对平均值为 -0.001,标准差为 0.008(最大值为 0.03),因此我们读取 ±0.02 范围内的值为零。注意,图中的误差棒是跨基准身份的 ±1 标准误,反映效果是否跨任务一致,而非估计器噪声(附录E)。
### 3.3 实验设置
#### 模型
为检验格式排序是否仅为完全训练模型的特性,我们在十个 OLMo 预训练检查点(1B至4T词元)[26]、十个 Pythia 检查点[27]以及 OLMo 的基础、SFT、DPO 和 Instruct 阶段重复测量。为检验其是否特定于某一规模或模型系列,我们在三个 OLMo 规模(1B、7B、13B)以及 Llama 3.1[28]和 Qwen3[29]模型(基础版和指令调优版)上重复测量。
#### LESS 选择结果
我们分析[Xia等人[4]](https://arxiv.org/html/2609.19589#bib.bib1)在 princeton-nlp/less_data (https://huggingface.co/datasets/princeton-nlp/less_data) 发布的选择结果:每个目标(MMLU[30]、BBH[31]、TydiQA[32])和三个种子从27万样本池中选取的前5%(13,533个样本)。我们使用基于规则的分类器(在保留样本上与人工标签约90%一致)为每个被选样本和池标注答案格式,并报告富集度(即某种格式在被选样本中的比例除以其在池中的比例)。关于分类器的更多细节见附录A,关于池组成的更多细节见附录D。
## 4 结果
### 4.1 答案格式(而非任务)决定梯度对齐
图2(a)显示跨数据集余弦相似度,图2(b)显示按模型聚合后的相同数据。热图显示,相同格式类的数据集对具有高对齐度,而不同格式类的数据集对对齐度接近零。这意味着梯度编码了更多关于答案格式的信息而非任务语义。图2(b)显示格式在梯度中的主导地位在不同模型规模和系列间保持一致。
参见图注 (a) (b)
图 2:梯度对齐遵循答案格式,而非任务。(a) 35个数据集间的消偏余弦,跨四个模型家族平均。方框标记了三个答案结构类别:无论任务如何,类别内对齐度高,跨类别即使任务相同对齐度也为零。对角线上的单元格表示相同答案格式、不同任务的对齐度,非对角线单元格表示相同任务、不同答案格式的对齐度。(b) 每个模型度量的相同两种对比,涵盖1B到13B规模和四个家族。
### 4.2 格式主导地位贯穿相似文章
使用探针目标归因定位大型语言模型中的提示模糊性
介绍了PRIG,一种梯度归因方法,通过训练线性探针区分清晰提示和模糊提示,并将探针得分归因于残差流中的标记表示,从而定位大型语言模型中的提示模糊性,在合成和人工编写的基准测试上取得了强劲性能。
DataDignity:用于大型语言模型的训练数据归属
本文介绍了 DataDignity,这是一个针对精准溯源(pinpoint provenance)的框架与基准(FakeWiki),旨在识别支持大语言模型(LLM)回答的具体训练数据来源。文章提出了 ScoringModel 和 SteerFuse 两种方法,以在标准检索基线之上提高归属准确率。
MultAttnAttrib: 长文档问答中的免训练多模态归因
介绍 MultAttnAttrib,一种用于长文档问答中多模态归因的免训练方法,以及 MultAttrEval 基准测试。它优于基于提示的方法,并与 GPT-5.4 等前沿模型相当。
当 Attribution Patching 存在偏差:诊断与二阶修正
本文诊断了 attribution patching 中的系统性误差——这是一种用于语言模型因果定位的基于梯度的近似方法——并提出了一种使用 Hessian-vector product 的二阶修正,该修正以极小的额外计算成本提高了可靠性。
归因合同:生成式语言模型中的特征归因
本文介绍了归因合同(Attribution Contract),这是生成式语言模型中特征归因声明的一种规范,解决了特征定义不清以及归因方法评估方式模糊的问题。论文以自回归模型和扩散模型为例,展示了归因何时具有信息量,何时可能产生误导。