标签
STRIDE提出了一种训练框架,使用可学习的逐步语言反馈而非标量奖励来提升LLM推理能力,在多种基准测试上取得了最先进的结果。
变分策略蒸馏(VPD)将语言反馈学习形式化为一个变分期望最大化问题,通过协同训练教师网络和学生网络,改进基于可验证奖励的强化学习中的策略学习。在代码生成和科学推理任务上,该方法相较于基线方法表现出持续改进。