词元级离策略学习用于分布偏移下的忠实生成
摘要
提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
源链接:https://huggingface.co/papers/2607.17524
摘要
我们提出Token级离策略标注(TOPL),一种将后训练重构为token级正确性预测任务的离策略训练范式。核心直觉是:通过训练模型区分回答中的好token与坏token,我们自然引导模型生成好token,同时避免直接训练模型生成离策略token所带来的陷阱。文档摘要任务的实验表明,TOPL在11个数据集上针对多种序列级和token级基线实现了强大的分布外泛化能力。我们进一步证明TOPL能有效迁移到机器翻译任务,表明其优势可泛化至不同的忠实生成任务。通过消融研究,我们确认token级学习信号对良好性能至关重要,而序列级对应方法无法提供类似收益。最后,我们展示TOPL能产生可解释的模型更新:通过TOPL学习的LoRA适配器可作为线性分类头和引导向量。
查看arXiv页面(https://arxiv.org/abs/2607.17524)查看PDF(https://arxiv.org/pdf/2607.17524)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.17524)
在您的智能体中获取此论文:
hf papers read 2607.17524
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
未找到链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。
引用此论文的数据集0
未找到链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。
引用此论文的Space0
未找到链接此论文的Space
在Space README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。
包含此论文的集合0
未找到包含此论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)中以从本页面链接。
相似文章
基于策略的蒸馏与离策略GRPO结合:训练紧凑指令遵循重排序器
本文提出了一种基于强化学习的蒸馏框架,用于训练紧凑的指令遵循重排序器。该框架使用离策略GRPO增强教师模型,并通过基于策略的蒸馏训练学生模型,在分布偏移下展现出优越性能。
Trust Region On-Policy Distillation
本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。
潜在同策略自蒸馏 (LOPD)
本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。
尾感知的 Top-$k$ 在策略蒸馏
本文提出了尾感知的 Top-k On-Policy 蒸馏(TA-OPD),以解决语言模型在 on-policy 蒸馏中尾部概率丢失的问题,从而提高基准测试上的下游准确性。
ShortOPD:通过短到长在策略蒸馏恢复剪枝后的大语言模型
ShortOPD提出了一种短到长的在策略蒸馏方案,通过将训练集中在有效前缀上,恢复用于自由形式生成的剪枝后大语言模型,相较于未恢复模型实现了高达9倍的改进,并以四分之一的训练时间达到了长视界蒸馏的效果。