基于轨迹的数据归因的可靠性如何?误差来源、修复方法及实践指南

arXiv cs.LG 论文

摘要

本文首次系统性地分析了基于轨迹的数据归因方法的误差来源,指出优化器不匹配是主要误差,提出了AdamW-influence来解决该问题,并通过K步前瞻框架提供了数据选择的实用指南。

arXiv:2605.18814v1 公告类型:新 摘要:基于轨迹的数据归因方法通过展开训练轨迹来估计训练样本对模型预测的影响。它们广泛应用于数据选择、数据估值和模型诊断等任务,但目前缺乏对这些方法的全面误差分析,引发了对方法可靠性的担忧,并阻碍了可靠部署。在这项工作中,我们首次系统地分析了基于轨迹的数据归因中的误差来源,并提出了具体的修复方法以减轻这些误差,以及下游使用的实用指南。我们将总误差分为三类:配置级、算法级和系统级。我们做出三项贡献。第一,我们确定优化器不匹配是主要的配置级误差:现有方法假设使用SGD推导其归因,即使模型是使用现代事实上的优化器AdamW训练的。我们提出了AdamW-influence,以充分考虑AdamW的优化动态,在涵盖MLP、CNN、GPT-2和Llama 3.2-1B的四种设置中,估计影响与真实影响之间的Spearman相关性提高了10%到300%以上。第二,我们分离了由一阶泰勒近似引起的剩余算法级误差,确定了学习率和轨迹长度是控制误差大小的因素,并推导出一个闭式误差代理,可以在原始轨迹上评估而无需重新训练。第三,我们将这些见解转化为数据选择的实用指南,通过将离线和在线策略统一到K步前瞻框架下。在该框架下,短视界的在线选择通常达到或超过离线选择,并且最佳视界可以与学习率联合调整。总之,这些结果将框架转化为从业者可操作的选择方法。
查看原文

相似文章

保形智能体错误归因

arXiv cs.LG

本文提出了一种基于保形预测的多智能体系统错误归因框架,为识别智能体轨迹中的决定性错误提供统计保证。该方法通过在连续预测集中隔离错误,实现了自动恢复与调试。

离线偏好轨迹评估

arXiv cs.LG

本文提出了一种针对智能体系统的离线偏好轨迹评估方法,通过时间偏好而非二元成功指标来比较轨迹。研究表明,该方法将平局比例从约75%降低到35%,从而提升了跨多样化基准的区分能力和数据效率。

当 Attribution Patching 存在偏差:诊断与二阶修正

arXiv cs.LG

本文诊断了 attribution patching 中的系统性误差——这是一种用于语言模型因果定位的基于梯度的近似方法——并提出了一种使用 Hessian-vector product 的二阶修正,该修正以极小的额外计算成本提高了可靠性。