面向多语言数学推理的同策略Delta蒸馏
摘要
本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。
查看缓存全文
缓存时间: 2026/08/07 05:56
论文页面 - On-Policy Delta Distillation for Multilingual Math Reasoning
Source: https://huggingface.co/papers/2608.05802
摘要
同策略蒸馏(On-Policy Distillation, OPD)正成为 LLM 后训练中强化学习的一种有前景的替代方案,但它在多语言环境中的有效性仍未得到充分探索。我们研究了 OPD 及其进阶变体同策略 Delta 蒸馏(On-Policy Delta Distillation, OPD^2),用于英语、韩语和日语的数学推理。OPD^2 通过使用后训练教师模型与其基础模型之间的概率差距作为学习信号来改进 OPD。基于 Qwen3 的实验表明,OPD^2 始终优于原始 OPD,在韩语和日语上提升尤为显著,并且总体上缩小了英语与韩语之间的性能差距。我们进一步发现,仅使用英语的 OPD 也能提升韩语和日语的表现,但往往会使回答偏向英语,这凸显了多语言数据在保持目标语言回答方面的重要性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05802) 查看 PDF (https://arxiv.org/pdf/2608.05802) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05802)
在您的 agent 中获取此论文:
hf papers read 2608.05802
没有最新的 CLI? curl -LsSf https://hf.co/cli/install.sh \| bash
引用此论文的模型0
没有关联此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.05802,即可在此页面关联该模型。
引用此论文的数据集0
没有关联此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.05802,即可在此页面关联该数据集。
引用此论文的 Space0
没有关联此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.05802,即可在此页面关联该 Space。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可在此页面关联该论文。
相似文章
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
面向多语言推理的跨语言在线策略自蒸馏
本文提出了跨语言在线策略自蒸馏(COPSD)方法,该方法通过共享的学生-教师架构,将高资源语言的推理能力迁移到低资源语言中。在17种非洲语言上的实验表明,该方法的数学推理能力和答案格式遵循度均得到显著提升,性能优于组相对策略优化(GRPO)。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
OmniOPD: 通过推测验证实现无Logit的同策略蒸馏
OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。