prompt-sampling

标签

Cards List
#prompt-sampling

LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR

arXiv cs.CL · 昨天 缓存

本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈