boundary-prompts

标签

Cards List
#boundary-prompts

当RLVR缩小推理边界:诊断Pass@k反转

arXiv cs.LG · 2026-07-24 缓存

本文诊断了可验证奖励强化学习(RLVR)中的“pass@k反转”现象:训练提高了单次准确率,但在重复采样下降低了性能,尤其是在正确轨迹稀少的边界提示上。提出了一种基于每个问题的基础锚定(PBA)方法来缓解这一问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈