不仅关乎位置,更关乎时机:RLVR中的时间调度
摘要
提出了在可验证奖励的强化学习(RLVR)中为信用分配标准引入时间调度,表明调度学习信号的施加时机可改善策略演化与稳定性。
查看缓存全文
缓存时间: 2026/06/02 15:37
论文页面 - 不仅在哪里,而且何时:RLVR的时间调度
来源:https://huggingface.co/papers/2605.25381
摘要
在带可验证奖励的强化学习中,对信用分配准则进行时间调度能够通过优先处理目标令牌并逐步转向通用优化,从而改进策略演化与学习稳定性。
带可验证奖励的强化学习(https://huggingface.co/papers?q=Reinforcement%20learning%20with%20verifiable%20rewards)(RLVR) 已成为大型语言模型(LLM)后训练的核心技术。虽然策略优化(https://huggingface.co/papers?q=policy%20optimization)由所有采样令牌在全局广播标量奖励的驱动下进行,但轨迹中呈现的异质策略行为在很大程度上未被区分对待。现有工作通过信用分配(https://huggingface.co/papers?q=credit%20allocation),包括令牌级优势重新加权(https://huggingface.co/papers?q=token-level%20advantage%20reweighting)和选择性令牌优化(https://huggingface.co/papers?q=selective%20token%20optimization)来解决这一问题,然而,这些分配准则在整个训练过程中基本保持不变,限制了策略的韧性演化。在这项工作中,我们认为,学习信号的调度时机与它们在令牌间的分配位置同样重要,并引入了时间维度,在 RLVR 优化过程中对信用分配(https://huggingface.co/papers?q=credit%20allocation)准则进行调度。我们发现,优先处理那些被特定策略行为所强调的目标令牌,并逐渐向通用优化衰减,能够带来更稳定高效的学习动态。此外,我们表明简单的轨迹百分位数(https://huggingface.co/papers?q=trajectory%20percentiles)为区分策略行为提供了自然的视角,并与时间调度(https://huggingface.co/papers?q=temporal%20scheduling)配合良好。我们的分析揭示,标准优化在同时容纳异质行为时会显著牺牲策略熵(https://huggingface.co/papers?q=policy%20entropy),而时间调度(https://huggingface.co/papers?q=temporal%20scheduling)则产生更健康的策略演化动态。跨数学和通用推理基准的实验表明了一致的改进,表明时间调度(https://huggingface.co/papers?q=temporal%20scheduling)构成了一个有前景的优化维度。
查看 arXiv 页面(https://arxiv.org/abs/2605.25381)查看 PDF(https://arxiv.org/pdf/2605.25381)GitHub1(https://github.com/Jinghaoleven/RLVR-Schedule)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.25381)
在您的代理中获取此论文:
hf papers read 2605\.25381
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.25381 即可从此页面链接。
引用该论文的数据集 1
JingHaoZ/OpenReasoning 查看器 • 更新于 3 天前 • 30.2k • 12(https://huggingface.co/datasets/JingHaoZ/OpenReasoning)
引用该论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2605.25381 即可从此页面链接。
包含该论文的收藏 0
没有收藏包含此论文
将这篇论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
面向长程语言智能体可验证强化学习的策略条件化反事实信用
提出了CVT-RL,一种带有策略条件化反事实贡献估计和可验证奖励的约束策略梯度算法,提高了长程语言智能体的可靠性并减少了奖励篡改。
早期判决,更优预算:面向计算高效RLVR的顺序自适应rollout分配
本文提出SARA,一种面向RLVR的顺序自适应rollout分配方法,该方法提前放弃饱和组并重新分配预算,相比动态采样,在rollout数量减少22%的情况下达到相当精度,若与之结合则可节省高达67%。
寻找思考的时间:实时强化学习中的规划预算学习
本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。