词元级离策略学习用于分布偏移下的忠实生成
摘要
提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
源链接:https://huggingface.co/papers/2607.17524
摘要
我们提出Token级离策略标注(TOPL),一种将后训练重构为token级正确性预测任务的离策略训练范式。核心直觉是:通过训练模型区分回答中的好token与坏token,我们自然引导模型生成好token,同时避免直接训练模型生成离策略token所带来的陷阱。文档摘要任务的实验表明,TOPL在11个数据集上针对多种序列级和token级基线实现了强大的分布外泛化能力。我们进一步证明TOPL能有效迁移到机器翻译任务,表明其优势可泛化至不同的忠实生成任务。通过消融研究,我们确认token级学习信号对良好性能至关重要,而序列级对应方法无法提供类似收益。最后,我们展示TOPL能产生可解释的模型更新:通过TOPL学习的LoRA适配器可作为线性分类头和引导向量。
查看arXiv页面(https://arxiv.org/abs/2607.17524)查看PDF(https://arxiv.org/pdf/2607.17524)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.17524)
在您的智能体中获取此论文:
hf papers read 2607.17524
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
未找到链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。
引用此论文的数据集0
未找到链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。
引用此论文的Space0
未找到链接此论文的Space
在Space README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。
包含此论文的集合0
未找到包含此论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)中以从本页面链接。
相似文章
Trust Region On-Policy Distillation
本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。
ShortOPD:通过短到长在策略蒸馏恢复剪枝后的大语言模型
ShortOPD提出了一种短到长的在策略蒸馏方案,通过将训练集中在有效前缀上,恢复用于自由形式生成的剪枝后大语言模型,相较于未恢复模型实现了高达9倍的改进,并以四分之一的训练时间达到了长视界蒸馏的效果。
ATOD:面向多轮自主智能体的退火轮次感知在线策略蒸馏
本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
TurnOPD: 使在线策略蒸馏对回合感知以实现高效长程智能体训练
TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。