token-level-reward

标签

Cards List
#token-level-reward

@wu_taiqiang:如何最大化OPD性能?一个重要的事情是预热。然后学生采样的序列在 t… 中定义良好。

X AI KOLs Following · 2026-08-13 缓存

作者讨论了一篇论文,该论文揭示了OPD(可能是在线策略蒸馏)的预热过程,解释了预热如何使学生采样的序列定义良好,并使来自教师的token级密集奖励具有教育意义。

0 人收藏 0 人点赞
#token-level-reward

SyRuP:在大语言模型解码中通过奖励引导预测增强系统提示遵从

arXiv cs.CL · 2026-07-28 缓存

介绍SyRuP,一种解码时框架,它训练一个交叉注意力奖励头来为系统提示生成令牌级别的遵从分数,无需模型调优即可提高大语言模型对复杂提示的遵从性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈