data-attribution

标签

Cards List
#data-attribution

小编辑,大模型:维基百科倡导如何影响大语言模型价值观

arXiv cs.CL · 2026-06-25 缓存

本文证明,一个协调的小规模维基百科编辑活动能够显著影响语言模型处理特定话题的方式,以动物福利为案例研究。

0 人收藏 0 人点赞
#data-attribution

DRIFT:通过在线策略数据归因优化指令数据

arXiv cs.LG · 2026-06-18 缓存

DRIFT提出了一种方法,利用在线策略影响函数来优化大型语言模型监督微调的训练数据分布,持续提升现有基线的性能上限。

0 人收藏 0 人点赞
#data-attribution

原生可遗忘的大语言模型

arXiv cs.LG · 2026-06-15 缓存

该论文提出了NULLs(原生可遗忘的大语言模型),这是一种模型类别,它将特定来源的贡献隔离到稀疏激活的sinks中,同时共享骨干神经元,从而无需重新训练即可干净地遗忘单个数据源,并保持通用语言能力。

0 人收藏 0 人点赞
#data-attribution

GRASP: 面向可扩展预训练数据归因的几何感知残差对齐

arXiv cs.LG · 2026-06-08 缓存

GRASP 提出了一种几何感知、基于交互的可扩展预训练数据归因方法,该方法对子集动态进行建模,在任务级秩相关上比现有加性方法提升超过两倍,同时降低了计算成本。

0 人收藏 0 人点赞
#data-attribution

基于轨迹的数据归因的可靠性如何?误差来源、修复方法及实践指南

arXiv cs.LG · 2026-05-20

本文首次系统性地分析了基于轨迹的数据归因方法的误差来源,指出优化器不匹配是主要误差,提出了AdamW-influence来解决该问题,并通过K步前瞻框架提供了数据选择的实用指南。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈