STRIDE:通过子集扰动的稀疏恢复进行训练数据归因

Hugging Face Daily Papers 论文

摘要

STRIDE是一种用于大型语言模型训练数据归因的新框架,它利用稀疏恢复和引导算子在激活空间中建模功能效应,以13倍于先前方法的速度实现了最先进的准确性。

训练数据归因(TDA)旨在将模型的预测追溯至其训练数据。TDA的黄金标准依赖于因果干预,即观察模型在添加或移除数据时的变化,但对于大型语言模型(LLMs)而言,重复重新训练在计算上具有挑战性。因此,大多数方法在参数空间中利用梯度来近似这种效应。然而,追踪数十亿参数的梯度不仅代价高昂,而且依赖于局部近似。在这项工作中,我们提出了一种转变:不再估计参数变化,而是在激活空间中建模训练数据的功能效应。我们引入了STRIDE(基于引导的训练数据影响分解),这是一个将TDA表述为压缩感知思想下稀疏恢复问题的框架。STRIDE学习轻量级的“引导算子”,其模拟在数据子集上训练引起的行为变化。通过测量这些算子如何扰动测试预测,我们通过稀疏线性分解恢复单个训练样本的影响。STRIDE在LLM预训练归因方面达到了最先进的水平,同时速度比先前方法快一个数量级(13倍)。我们进一步通过下游应用(包括数据选择、数据污染和定性分析)验证了其实用性。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:41

论文页面 - STRIDE:通过子集扰动的稀疏恢复实现训练数据归因

来源:https://huggingface.co/papers/2606.05165

摘要

STRIDE 框架能够通过激活空间中的稀疏恢复与引导算子对功能效应进行建模,从而实现大语言模型的高效训练数据归因,相比传统基于梯度的方法在速度和准确性上均表现更优。

训练数据归因(https://huggingface.co/papers?q=Training%20Data%20Attribution)(TDA)旨在将模型的预测追溯至其训练数据。TDA 的金标准依赖于因果干预(https://huggingface.co/papers?q=causal%20interventions),即观察添加或移除数据时模型的变化,但对于大语言模型(https://huggingface.co/papers?q=Large%20Language%20Models)(LLM)而言,重复训练在计算上极具挑战。因此,大多数方法在参数空间(https://huggingface.co/papers?q=parameter%20space)中使用梯度(https://huggingface.co/papers?q=gradients)来近似这一效果。然而,追踪数十亿参数的梯度不仅成本高昂,而且依赖于局部近似。在这项工作中,我们提出了一个转变:不再估计参数变化,而是对训练数据在激活空间(https://huggingface.co/papers?q=activation%20space)中的功能效应进行建模。我们引入了 STRIDE(基于引导的训练数据影响分解),这是一个将 TDA 构建为稀疏恢复(https://huggingface.co/papers?q=sparse%20recovery)问题的框架,其理念源于压缩感知(https://huggingface.co/papers?q=compressive%20sensing)。STRIDE 学习轻量级的“引导算子”(https://huggingface.co/papers?q=steering%20operators),以模拟因训练数据子集导致的行为偏移。通过测量这些算子对测试预测的扰动,我们通过稀疏线性分解(https://huggingface.co/papers?q=sparse%20linear%20decomposition)恢复单个训练样本的影响。STRIDE 在大语言模型预训练归因方面达到了最先进水平,同时速度比先前方法快一个数量级(13 倍)。我们进一步通过下游应用验证了其实用价值,包括数据选择、数据污染和定性分析。

查看 arXiv 页面(https://arxiv.org/abs/2606.05165)查看 PDF(https://arxiv.org/pdf/2606.05165)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05165)

在您的 agent 中获取此论文:

hf papers read 2606.05165

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型链接本论文

在模型 README.md 中引用 arxiv.org/abs/2606.05165 即可链接至此页面。

引用本论文的数据集0

无数据集链接本论文

在数据集 README.md 中引用 arxiv.org/abs/2606.05165 即可链接至此页面。

引用本论文的 Space0

无 Space 链接本论文

在 Space README.md 中引用 arxiv.org/abs/2606.05165 即可链接至此页面。

包含本论文的收藏0

无收藏包含本论文

将本论文添加至收藏(https://huggingface.co/new-collection)即可链接至此页面。

相似文章

DataDignity:用于大型语言模型的训练数据归属

arXiv cs.AI

本文介绍了 DataDignity,这是一个针对精准溯源(pinpoint provenance)的框架与基准(FakeWiki),旨在识别支持大语言模型(LLM)回答的具体训练数据来源。文章提出了 ScoringModel 和 SteerFuse 两种方法,以在标准检索基线之上提高归属准确率。