STRIDE:通过子集扰动的稀疏恢复进行训练数据归因
摘要
STRIDE是一种用于大型语言模型训练数据归因的新框架,它利用稀疏恢复和引导算子在激活空间中建模功能效应,以13倍于先前方法的速度实现了最先进的准确性。
查看缓存全文
缓存时间: 2026/06/04 03:41
论文页面 - STRIDE:通过子集扰动的稀疏恢复实现训练数据归因
来源:https://huggingface.co/papers/2606.05165
摘要
STRIDE 框架能够通过激活空间中的稀疏恢复与引导算子对功能效应进行建模,从而实现大语言模型的高效训练数据归因,相比传统基于梯度的方法在速度和准确性上均表现更优。
训练数据归因(https://huggingface.co/papers?q=Training%20Data%20Attribution)(TDA)旨在将模型的预测追溯至其训练数据。TDA 的金标准依赖于因果干预(https://huggingface.co/papers?q=causal%20interventions),即观察添加或移除数据时模型的变化,但对于大语言模型(https://huggingface.co/papers?q=Large%20Language%20Models)(LLM)而言,重复训练在计算上极具挑战。因此,大多数方法在参数空间(https://huggingface.co/papers?q=parameter%20space)中使用梯度(https://huggingface.co/papers?q=gradients)来近似这一效果。然而,追踪数十亿参数的梯度不仅成本高昂,而且依赖于局部近似。在这项工作中,我们提出了一个转变:不再估计参数变化,而是对训练数据在激活空间(https://huggingface.co/papers?q=activation%20space)中的功能效应进行建模。我们引入了 STRIDE(基于引导的训练数据影响分解),这是一个将 TDA 构建为稀疏恢复(https://huggingface.co/papers?q=sparse%20recovery)问题的框架,其理念源于压缩感知(https://huggingface.co/papers?q=compressive%20sensing)。STRIDE 学习轻量级的“引导算子”(https://huggingface.co/papers?q=steering%20operators),以模拟因训练数据子集导致的行为偏移。通过测量这些算子对测试预测的扰动,我们通过稀疏线性分解(https://huggingface.co/papers?q=sparse%20linear%20decomposition)恢复单个训练样本的影响。STRIDE 在大语言模型预训练归因方面达到了最先进水平,同时速度比先前方法快一个数量级(13 倍)。我们进一步通过下游应用验证了其实用价值,包括数据选择、数据污染和定性分析。
查看 arXiv 页面(https://arxiv.org/abs/2606.05165)查看 PDF(https://arxiv.org/pdf/2606.05165)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05165)
在您的 agent 中获取此论文:
hf papers read 2606.05165
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
无模型链接本论文
在模型 README.md 中引用 arxiv.org/abs/2606.05165 即可链接至此页面。
引用本论文的数据集0
无数据集链接本论文
在数据集 README.md 中引用 arxiv.org/abs/2606.05165 即可链接至此页面。
引用本论文的 Space0
无 Space 链接本论文
在 Space README.md 中引用 arxiv.org/abs/2606.05165 即可链接至此页面。
包含本论文的收藏0
无收藏包含本论文
将本论文添加至收藏(https://huggingface.co/new-collection)即可链接至此页面。
相似文章
STRIDE:面向LLM推理的可学习逐步语言反馈
STRIDE提出了一种训练框架,使用可学习的逐步语言反馈而非标量奖励来提升LLM推理能力,在多种基准测试上取得了最先进的结果。
GRASP: 面向可扩展预训练数据归因的几何感知残差对齐
GRASP 提出了一种几何感知、基于交互的可扩展预训练数据归因方法,该方法对子集动态进行建模,在任务级秩相关上比现有加性方法提升超过两倍,同时降低了计算成本。
少量神经元揭示LLM何时误用工具:面向可靠工具使用的稀疏检测与选择性引导
本文介绍了PRISMS,一种利用少量针对特定失败的MLP神经元,通过稀疏读出检测和引导LLM工具使用错误(过度调用、缺失调用、无效参数)的框架,从而提升多个模型系列的工具使用可靠性。
DataDignity:用于大型语言模型的训练数据归属
本文介绍了 DataDignity,这是一个针对精准溯源(pinpoint provenance)的框架与基准(FakeWiki),旨在识别支持大语言模型(LLM)回答的具体训练数据来源。文章提出了 ScoringModel 和 SteerFuse 两种方法,以在标准检索基线之上提高归属准确率。
GrAInS:基于梯度的归因方法用于大语言模型和视觉语言模型的推理时引导
GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。