language-feedback

标签

Cards List
#language-feedback

STRIDE:面向LLM推理的可学习逐步语言反馈

arXiv cs.LG · 2026-05-20

STRIDE提出了一种训练框架,使用可学习的逐步语言反馈而非标量奖励来提升LLM推理能力,在多种基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#language-feedback

通过变分策略蒸馏从语言反馈中学习

Hugging Face Daily Papers · 2026-05-18 缓存

变分策略蒸馏(VPD)将语言反馈学习形式化为一个变分期望最大化问题,通过协同训练教师网络和学生网络,改进基于可验证奖励的强化学习中的策略学习。在代码生成和科学推理任务上,该方法相较于基线方法表现出持续改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈