通过变分策略蒸馏从语言反馈中学习
摘要
变分策略蒸馏(VPD)将语言反馈学习形式化为一个变分期望最大化问题,通过协同训练教师网络和学生网络,改进基于可验证奖励的强化学习中的策略学习。在代码生成和科学推理任务上,该方法相较于基线方法表现出持续改进。
查看缓存全文
缓存时间: 2026/05/21 22:12
论文页面 - Learning from Language Feedback via Variational Policy Distillation
Source: https://huggingface.co/papers/2605.15113 变分策略蒸馏 (VPD) 解决了基于可验证奖励的强化学习 (RLVR) 的一个关键局限:二元奖励信号丢弃了所有接近成功失败的信息。一个代码方案在 50 个测试中只失败 1 个,得到的奖励却与随机噪声相同,尽管编译器错误明确告诉了你哪里出了问题。
VPD 将语言反馈(编译器错误、LLM 反馈、自我纠正)的学习形式化为变分 EM 问题。与之前将反馈条件教师视为冻结函数的自蒸馏方法不同,VPD 在交替循环中共同训练教师和学生:
- E 步:通过偏好优化精炼教师解读反馈的能力
- M 步:将改进后的教师在其自身 rollout 上蒸馏给学生
两者共享同一个网络,因此完全无需额外内存开销。
我们在 3 个模型系列(Qwen3-4B、Qwen3-8B、Llama-3.1-8B)上进行了评估,涵盖代码生成(LiveCodeBench)和科学推理(SciKnowEval)。VPD 在 GRPO 和自蒸馏基线基础上持续提升,并且训练动态显著更稳定。我们还分析了该方法存在局限的场景——在错误反馈信息量不多的严格数学推理中,标准强化学习仍更具优势。
欢迎讨论——期待反馈!
相似文章
授之以渔而非授之以鱼:面向多模态策略优化的特权引导式蒸馏
本文提出PTD-PO,一种特权引导式蒸馏框架,可在多模态推理任务中为基于可验证奖励的强化学习提供密集的token级监督,且不暴露答案。该框架利用结构化提示和Top-K JS散度目标以稳定训练,在2B-8B LVLMs上持续优于现有方法。
带可验证奖励的策略内蒸馏
论文介绍了OPDVR,这是一种结合策略内蒸馏与可验证奖励的方法,使用ReLU门控重配来增强大型语言模型的推理能力,无需额外超参数,在六个基准测试上优于标准方法。
OPD-V:具有模态平衡的视觉在策略自蒸馏
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
自监督视觉在线策略蒸馏
本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。
基于噪声学生在线策略自蒸馏的自增强视觉语言模型
提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。