从重新加权到重写:解锁训练数据归因中有影响力样本的干预效应
摘要
本文提出了影响引导的响应重写方法,用于干预有影响力的训练样本,展示了与传统重新加权相比,重写响应能在语言模型中产生更强烈和更持久的行为转变。
查看缓存全文
缓存时间: 2026/09/10 14:16
论文页面 - 从重加权到重写:解锁训练数据归因中有影响力样本的干预效应
来源:https://huggingface.co/papers/2609.02771
摘要
相较于传统重加权方法,对选定训练样本进行影响力引导的响应重写,能对语言模型产生更强且更持久的行为改变,凸显了有影响力数据更广泛的干预潜力。
训练数据归因 (https://huggingface.co/papers?q=Training%20data%20attribution) (TDA) 旨在识别塑造模型行为的训练样本,但其干预价值取决于所选样本及其修改方式。影响力函数 (https://huggingface.co/papers?q=Influence%20functions) (IF) 用于估计在微小重加权下的行为变化,然而在常规基于权重的干预下,IF选定的样本相比随机选择往往优势有限。这引发了一个问题:是有影响力样本本身缺乏干预价值,还是重加权 (https://huggingface.co/papers?q=reweighting) 未能实现其行为杠杆效应?我们提出了影响力引导的响应重写 (https://huggingface.co/papers?q=response%20rewriting),该方法使用IF识别干预目标,并在保持指令不变的情况下,将其响应替换为与目标行为一致或相悖的监督。在四种开源大语言模型 (https://huggingface.co/papers?q=open-weight%20LLMs) 上,我们以认识论性弃权 (https://huggingface.co/papers?q=epistemic%20abstention) 作为主要测试平台,对相同的影响力选择样本比较了重写与重加权 (https://huggingface.co/papers?q=reweighting) 的效果。响应重写 (https://huggingface.co/papers?q=Response%20rewriting) 产生了更强、更持久且双向的行为改变,而重加权 (https://huggingface.co/papers?q=reweighting) 相同样本则表现出微弱且不一致的效果。进一步分析表明,相较于其他选择器,影响力选择的样本为重写提供了更大的杠杆效应,且变化主要集中于目标相关行为。这种定性对比同样适用于安全拒绝场景。这些结果区分了影响力估计所捕获的局部重加权 (https://huggingface.co/papers?q=reweighting) 效应与它们所识别样本的更广泛干预潜力,从而推动了对TDA方法进行干预感知评估 (https://huggingface.co/papers?q=intervention-aware%20evaluation) 的必要性。
查看 arXiv 页面 (https://arxiv.org/abs/2609.02771)查看 PDF (https://arxiv.org/pdf/2609.02771)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.02771)
通过您的代理获取本文:
hf papers read 2609\.02771
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2609.02771,以将其链接到本页面。
引用本文的数据集 0
无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.02771,以将其链接到本页面。
引用本文的空间 0
无空间链接本文
在空间的 README.md 中引用 arxiv.org/abs/2609.02771,以将其链接到本页面。
包含本文的收藏集 0
无收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到本页面。
相似文章
微调是否会撤销激活引导?行为恢复而无权重编辑逆转
本文研究微调是否会撤销语言模型中的激活引导,发现尽管在优化压力下,拒绝抑制等行为效应可能退化,但底层的权重修改在机制上保持稳定。
STARE:惊奇度引导的令牌级优势重加权实现策略熵稳定性
STARE 通过引入惊奇度引导的令牌级优势重加权和目标熵调节,解决了基于GRPO的大语言模型强化学习中的策略熵崩溃问题,在AIME基准上实现了4%-8%的准确率提升。
修正影响:利用正交潜在空间解构LLM输出
本文介绍了一个框架,通过稀疏自编码器学习正交潜在空间,实现对大型语言模型中词元级影响的归因,从而精确识别共同影响预测的训练数据词元,适用于医疗等高风险领域。
重新思考大模型训练中的数据策展:在线重加权比离线方法具有更好的泛化能力
本文介绍了 ADAPT,这是一个用于大语言模型数据策展的在线重加权框架。该框架通过损失加权在训练过程中动态调整样本重要性,在跨基准测试的泛化能力方面优于离线筛选和混合方法。
证据类型竞争:干预数据何时能教会语言模型因果方向?
本文在受控的辛普森悖论世界中测试了预训练中增加干预数据是否能提升大语言模型的因果方向推理能力。研究发现,训练混合比例并不决定干预证据的使用,相反,推理时上下文中的证据类型才是决定性因素。