variational-policy-distillation

标签

Cards List
#variational-policy-distillation

通过变分策略蒸馏从语言反馈中学习

Hugging Face Daily Papers · 2026-05-18 缓存

变分策略蒸馏(VPD)将语言反馈学习形式化为一个变分期望最大化问题,通过协同训练教师网络和学生网络,改进基于可验证奖励的强化学习中的策略学习。在代码生成和科学推理任务上,该方法相较于基线方法表现出持续改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈