通过变分策略蒸馏从语言反馈中学习

Hugging Face Daily Papers 论文

摘要

变分策略蒸馏(VPD)将语言反馈学习形式化为一个变分期望最大化问题,通过协同训练教师网络和学生网络,改进基于可验证奖励的强化学习中的策略学习。在代码生成和科学推理任务上,该方法相较于基线方法表现出持续改进。

基于可验证奖励的强化学习(RLVR)面临稀疏的结果信号问题,在复杂推理任务上造成了严重的探索瓶颈。最近的在线策略自蒸馏方法试图通过利用语言反馈生成密集的、令牌级别的监督来缓解这一问题。然而,这些方法依赖于固定的、被动的教师来解读反馈。随着学生策略的提升,教师的零样本评估能力趋于平稳,最终阻碍了进一步的学习。为解决这一问题,我们提出了变分策略蒸馏(VPD),该框架将语言反馈学习形式化为一个变分期望最大化(EM)问题。VPD共同演化两个策略:在E步中,教师通过自适应信任域更新在轨迹结果上被积极优化,将文本反馈转化为动态改进的目标令牌分布。在M步中,学生在其自身在线策略展开中内化这种密集的分布指导。通过持续提升教师从文本批评中提取可操作信号的能力,VPD克服了被动蒸馏的局限性。在科学推理和代码生成任务上,针对多种诊断反馈来源的评估表明,VPD持续优于标准RLVR和现有的自蒸馏基线。最后,通过在严格的数学推理和冷启动场景下对我们的框架进行压力测试,我们揭示了与纯环境驱动RL相比,反馈驱动自蒸馏的基本界限。
查看原文
查看缓存全文

缓存时间: 2026/05/21 22:12

论文页面 - Learning from Language Feedback via Variational Policy Distillation

Source: https://huggingface.co/papers/2605.15113 变分策略蒸馏 (VPD) 解决了基于可验证奖励的强化学习 (RLVR) 的一个关键局限:二元奖励信号丢弃了所有接近成功失败的信息。一个代码方案在 50 个测试中只失败 1 个,得到的奖励却与随机噪声相同,尽管编译器错误明确告诉了你哪里出了问题。

VPD 将语言反馈(编译器错误、LLM 反馈、自我纠正)的学习形式化为变分 EM 问题。与之前将反馈条件教师视为冻结函数的自蒸馏方法不同,VPD 在交替循环中共同训练教师和学生:

  • E 步:通过偏好优化精炼教师解读反馈的能力
  • M 步:将改进后的教师在其自身 rollout 上蒸馏给学生

两者共享同一个网络,因此完全无需额外内存开销。

我们在 3 个模型系列(Qwen3-4B、Qwen3-8B、Llama-3.1-8B)上进行了评估,涵盖代码生成(LiveCodeBench)和科学推理(SciKnowEval)。VPD 在 GRPO 和自蒸馏基线基础上持续提升,并且训练动态显著更稳定。我们还分析了该方法存在局限的场景——在错误反馈信息量不多的严格数学推理中,标准强化学习仍更具优势。

欢迎讨论——期待反馈!

相似文章

带可验证奖励的策略内蒸馏

Hugging Face Daily Papers

论文介绍了OPDVR,这是一种结合策略内蒸馏与可验证奖励的方法,使用ReLU门控重配来增强大型语言模型的推理能力,无需额外超参数,在六个基准测试上优于标准方法。

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

自监督视觉在线策略蒸馏

Hugging Face Daily Papers

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。