从重新加权到重写:解锁训练数据归因中有影响力样本的干预效应

Hugging Face Daily Papers 论文

摘要

本文提出了影响引导的响应重写方法,用于干预有影响力的训练样本,展示了与传统重新加权相比,重写响应能在语言模型中产生更强烈和更持久的行为转变。

训练数据归因(TDA)旨在识别塑造模型行为的训练样本,但其干预价值取决于所选样本以及修改方式。影响函数(IF)在无穷小重新加权下估计行为变化,然而在传统的基于权重的干预中,IF选择的样本相对于随机选择通常显示出有限的优势。这引发了关于有影响力样本是否缺乏干预价值,还是重新加权未能实现其行为杠杆的问题。我们引入影响引导的响应重写,它使用IF来识别干预目标,并在其指令固定的情况下,用行为对齐或行为对立的监督替换其响应。跨越四个开源大语言模型,我们使用认知回避作为主要测试平台,在相同的影响选择样本上比较重写和重新加权。响应重写产生更强、更持久和双向的行为转变,而重新加权相同样本则产生微弱且不一致的效果。进一步分析表明,影响选择的样本比其他选择器提供更大的重写杠杆,变化仍集中在与目标相关的行为上。同样的质性对比延伸到安全拒绝。这些结果将影响估计捕获的局部重新加权效应与它们所识别样本的更广泛干预杠杆区分开来,推动了TDA方法的干预感知评估。
查看原文
查看缓存全文

缓存时间: 2026/09/10 14:16

论文页面 - 从重加权到重写:解锁训练数据归因中有影响力样本的干预效应

来源:https://huggingface.co/papers/2609.02771

摘要

相较于传统重加权方法,对选定训练样本进行影响力引导的响应重写,能对语言模型产生更强且更持久的行为改变,凸显了有影响力数据更广泛的干预潜力。

训练数据归因 (https://huggingface.co/papers?q=Training%20data%20attribution) (TDA) 旨在识别塑造模型行为的训练样本,但其干预价值取决于所选样本及其修改方式。影响力函数 (https://huggingface.co/papers?q=Influence%20functions) (IF) 用于估计在微小重加权下的行为变化,然而在常规基于权重的干预下,IF选定的样本相比随机选择往往优势有限。这引发了一个问题:是有影响力样本本身缺乏干预价值,还是重加权 (https://huggingface.co/papers?q=reweighting) 未能实现其行为杠杆效应?我们提出了影响力引导的响应重写 (https://huggingface.co/papers?q=response%20rewriting),该方法使用IF识别干预目标,并在保持指令不变的情况下,将其响应替换为与目标行为一致或相悖的监督。在四种开源大语言模型 (https://huggingface.co/papers?q=open-weight%20LLMs) 上,我们以认识论性弃权 (https://huggingface.co/papers?q=epistemic%20abstention) 作为主要测试平台,对相同的影响力选择样本比较了重写与重加权 (https://huggingface.co/papers?q=reweighting) 的效果。响应重写 (https://huggingface.co/papers?q=Response%20rewriting) 产生了更强、更持久且双向的行为改变,而重加权 (https://huggingface.co/papers?q=reweighting) 相同样本则表现出微弱且不一致的效果。进一步分析表明,相较于其他选择器,影响力选择的样本为重写提供了更大的杠杆效应,且变化主要集中于目标相关行为。这种定性对比同样适用于安全拒绝场景。这些结果区分了影响力估计所捕获的局部重加权 (https://huggingface.co/papers?q=reweighting) 效应与它们所识别样本的更广泛干预潜力,从而推动了对TDA方法进行干预感知评估 (https://huggingface.co/papers?q=intervention-aware%20evaluation) 的必要性。

查看 arXiv 页面 (https://arxiv.org/abs/2609.02771)查看 PDF (https://arxiv.org/pdf/2609.02771)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.02771)

通过您的代理获取本文:

hf papers read 2609\.02771

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2609.02771,以将其链接到本页面。

引用本文的数据集 0

无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.02771,以将其链接到本页面。

引用本文的空间 0

无空间链接本文

在空间的 README.md 中引用 arxiv.org/abs/2609.02771,以将其链接到本页面。

包含本文的收藏集 0

无收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到本页面。

相似文章

修正影响:利用正交潜在空间解构LLM输出

arXiv cs.LG

本文介绍了一个框架,通过稀疏自编码器学习正交潜在空间,实现对大型语言模型中词元级影响的归因,从而精确识别共同影响预测的训练数据词元,适用于医疗等高风险领域。