不仅关乎位置,更关乎时机:RLVR中的时间调度

Hugging Face Daily Papers 论文

摘要

提出了在可验证奖励的强化学习(RLVR)中为信用分配标准引入时间调度,表明调度学习信号的施加时机可改善策略演化与稳定性。

基于可验证奖励的强化学习(RLVR)已成为大型语言模型(LLMs)后训练的核心技术。尽管策略优化是由全局广播的标量奖励驱动所有采样令牌进行的,但轨迹中展现出的异构策略行为在很大程度上被忽视而未加以区分。现有工作通过信用分配来应对这一问题,包括令牌级优势重新加权和选择性令牌优化,然而,分配标准在整个训练过程中基本保持不变,限制了策略的鲁棒演化。在本工作中,我们认为学习信号何时被调度与其在令牌间的分配位置同等重要,并引入了时间维度,即在RLVR优化过程中对信用分配标准进行调度。我们发现,优先关注被特定策略行为强化的目标令牌,并逐渐向通用优化衰减,会带来更稳定高效的学习动态。此外,我们表明简单的轨迹百分位数为区分策略行为提供了自然视角,并与时间调度配合良好。我们的分析表明,标准优化在同时容纳异构行为时显著牺牲了策略熵,而时间调度则产生了更健康的策略演化动态。在数学和通用推理基准上的实验展示了持续的改进,表明时间调度是一个有前景的优化维度。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:37

论文页面 - 不仅在哪里,而且何时:RLVR的时间调度

来源:https://huggingface.co/papers/2605.25381

摘要

在带可验证奖励的强化学习中,对信用分配准则进行时间调度能够通过优先处理目标令牌并逐步转向通用优化,从而改进策略演化与学习稳定性。

带可验证奖励的强化学习(https://huggingface.co/papers?q=Reinforcement%20learning%20with%20verifiable%20rewards)(RLVR) 已成为大型语言模型(LLM)后训练的核心技术。虽然策略优化(https://huggingface.co/papers?q=policy%20optimization)由所有采样令牌在全局广播标量奖励的驱动下进行,但轨迹中呈现的异质策略行为在很大程度上未被区分对待。现有工作通过信用分配(https://huggingface.co/papers?q=credit%20allocation),包括令牌级优势重新加权(https://huggingface.co/papers?q=token-level%20advantage%20reweighting)和选择性令牌优化(https://huggingface.co/papers?q=selective%20token%20optimization)来解决这一问题,然而,这些分配准则在整个训练过程中基本保持不变,限制了策略的韧性演化。在这项工作中,我们认为,学习信号的调度时机与它们在令牌间的分配位置同样重要,并引入了时间维度,在 RLVR 优化过程中对信用分配(https://huggingface.co/papers?q=credit%20allocation)准则进行调度。我们发现,优先处理那些被特定策略行为所强调的目标令牌,并逐渐向通用优化衰减,能够带来更稳定高效的学习动态。此外,我们表明简单的轨迹百分位数(https://huggingface.co/papers?q=trajectory%20percentiles)为区分策略行为提供了自然的视角,并与时间调度(https://huggingface.co/papers?q=temporal%20scheduling)配合良好。我们的分析揭示,标准优化在同时容纳异质行为时会显著牺牲策略熵(https://huggingface.co/papers?q=policy%20entropy),而时间调度(https://huggingface.co/papers?q=temporal%20scheduling)则产生更健康的策略演化动态。跨数学和通用推理基准的实验表明了一致的改进,表明时间调度(https://huggingface.co/papers?q=temporal%20scheduling)构成了一个有前景的优化维度。

查看 arXiv 页面(https://arxiv.org/abs/2605.25381)查看 PDF(https://arxiv.org/pdf/2605.25381)GitHub1(https://github.com/Jinghaoleven/RLVR-Schedule)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.25381)

在您的代理中获取此论文:

hf papers read 2605\.25381

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2605.25381 即可从此页面链接。

引用该论文的数据集 1

JingHaoZ/OpenReasoning 查看器 • 更新于 3 天前 • 30.2k • 12(https://huggingface.co/datasets/JingHaoZ/OpenReasoning)

引用该论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2605.25381 即可从此页面链接。

包含该论文的收藏 0

没有收藏包含此论文

将这篇论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

寻找思考的时间:实时强化学习中的规划预算学习

arXiv cs.LG

本文引入了可变延迟实时强化学习,其中智能体决定在环境持续运行的情况下需要多长时间的思考,并提出了一种轻量级的门控策略来选择基于状态的规划预算,在多个实时游戏中优于固定预算和启发式基线。

超越可验证的RL(8分钟阅读)

TLDR AI

本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。