词元级离策略学习用于分布偏移下的忠实生成

Hugging Face Daily Papers 论文

摘要

提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。

我们提出 Token-Level Off-Policy Labeling (TOPL),一种将后训练重新定义为词元级正确性预测任务的离策略训练范式。我们的关键直觉是,通过训练模型区分回复中的好与坏词元,自然引导模型生成好词元,同时避免直接训练模型生成离策略词元所带来的陷阱。在文档摘要任务上的实验表明,TOPL 在 11 个数据集上相比于多种序列级和词元级基线方法实现了强大的分布外泛化能力。我们进一步证明 TOPL 能够有效迁移到机器翻译任务,表明其优势可泛化至不同的忠实生成任务。通过消融实验,我们确认词元级学习信号对良好性能至关重要;序列级类似方法并未带来相似收益。最后,我们展示 TOPL 能够引发可解释的模型更新:通过 TOPL 学习到的 LoRA 适配器可作为线性分类头和引导向量。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:35

论文页面 - Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

源链接:https://huggingface.co/papers/2607.17524

摘要

我们提出Token级离策略标注(TOPL),一种将后训练重构为token级正确性预测任务的离策略训练范式。核心直觉是:通过训练模型区分回答中的好token与坏token,我们自然引导模型生成好token,同时避免直接训练模型生成离策略token所带来的陷阱。文档摘要任务的实验表明,TOPL在11个数据集上针对多种序列级和token级基线实现了强大的分布外泛化能力。我们进一步证明TOPL能有效迁移到机器翻译任务,表明其优势可泛化至不同的忠实生成任务。通过消融研究,我们确认token级学习信号对良好性能至关重要,而序列级对应方法无法提供类似收益。最后,我们展示TOPL能产生可解释的模型更新:通过TOPL学习的LoRA适配器可作为线性分类头和引导向量。

查看arXiv页面(https://arxiv.org/abs/2607.17524)查看PDF(https://arxiv.org/pdf/2607.17524)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.17524)

在您的智能体中获取此论文:

hf papers read 2607.17524

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

未找到链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。

引用此论文的数据集0

未找到链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。

引用此论文的Space0

未找到链接此论文的Space

在Space README.md 中引用 arxiv.org/abs/2607.17524 以从本页面链接。

包含此论文的集合0

未找到包含此论文的集合

将此论文添加到集合(https://huggingface.co/new-collection)中以从本页面链接。

相似文章

Trust Region On-Policy Distillation

Hugging Face Daily Papers

本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。

ShortOPD:通过短到长在策略蒸馏恢复剪枝后的大语言模型

arXiv cs.LG

ShortOPD提出了一种短到长的在策略蒸馏方案,通过将训练集中在有效前缀上,恢复用于自由形式生成的剪枝后大语言模型,相较于未恢复模型实现了高达9倍的改进,并以四分之一的训练时间达到了长视界蒸馏的效果。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。