面向在线策略蒸馏的信任区域行为融合
摘要
信任区域行为融合(TRB)通过在线策略蒸馏的预热阶段,在KL信任区域内用教师行为替换学生早期的劣质轨迹,从而在数学推理任务上取得更强结果。
查看缓存全文
缓存时间: 2026/06/01 11:20
论文页面 - 面向在线策略蒸馏的信任域行为混合
来源:https://huggingface.co/papers/2605.31159
摘要
信任域行为混合通过在预热阶段,将早期质量低下的学生策略回滚替换为KL信任域内与教师相似的行为,从而改进了在线策略蒸馏。
在线策略蒸馏 (https://huggingface.co/papers?q=On-policy%20distillation)(OPD)在匹配更强教师的同时,对学生从其自身策略中采样的前缀进行训练。这解决了离线蒸馏 (https://huggingface.co/papers?q=offline%20distillation) 的前缀不匹配 (https://huggingface.co/papers?q=prefix%20mismatch) 问题,但早期的学生回滚仍然可能质量较低,导致教师监督作用于薄弱或低质量的前缀。我们提出了信任域行为混合 (https://huggingface.co/papers?q=behavior%20Blending)(TRB),这是一种预热方法,在预热阶段将早期回滚策略替换为以学生为中心的KL信任域 (https://huggingface.co/papers?q=KL%20trust%20region) 内最接近教师的行为策略,同时保持每个前缀的反向KL OPD损失不变。KL预算逐渐退火至零,因此训练在预热后回归纯粹的学生回滚。在两个数学推理蒸馏场景中,TRB在比较方法中获得了最强的平均性能。
查看arXiv页面 (https://arxiv.org/abs/2605.31159) 查看PDF (https://arxiv.org/pdf/2605.31159) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31159)
在您的智能体中获取此论文:
hf papers read 2605\.31159
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.31159 以从该页面链接。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.31159 以从该页面链接。
引用此论文的Spaces0
没有Space链接到此论文
请在Space README.md 中引用 arxiv.org/abs/2605.31159 以从该页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从该页面链接。
相似文章
信任区域策略蒸馏
信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。
Trust Region On-Policy Distillation
本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。
大规模并行在策略强化学习的信任区域扩散策略
介绍了TruDi,一种通过使用信任区域优化规则来强制KL散度约束,从而在大规模并行在策略强化学习中训练扩散策略的方法,在73个任务中取得了强劲性能。
传递接力棒:轨迹中继在策略蒸馏
提出中继在策略蒸馏(Relay-OPD),通过在检测到的交接触发点让教师短暂接管以纠正推理轨迹,解决了在策略蒸馏中的前缀失败问题。在数学推理基准上实现一致改进,并将训练轨迹长度减少超过50%。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。