超越舒适区的助推:面向RLVR的高效策略引导探索
摘要
NudgeRL是一个框架,通过引入结构化探索和策略助推来增强带有可验证奖励的强化学习(RLVR),相比暴力扩展方法,它能更高效地提升大语言模型的推理性能。
查看缓存全文
缓存时间: 2026/05/18 06:24
论文页面 - 超越舒适区的助推:RLVR的高效策略引导探索
来源:https://huggingface.co/papers/2605.15726
摘要
NudgeRL框架通过结构化探索和策略引导,增强了基于可验证奖励的强化学习,从而提升大型语言模型的推理能力。
基于可验证奖励的强化学习(https://huggingface.co/papers?q=基于可验证奖励的强化学习)(RLVR)已成为提升大型语言模型推理能力的可扩展范式。然而,其有效性从根本上受限于探索(https://huggingface.co/papers?q=探索):策略只能改进已采样的轨迹。虽然增加展开(https://huggingface.co/papers?q=展开)次数可以缓解这一问题,但这种暴力缩放计算成本高昂,且现有的修改优化目标的方法对探索内容的控制有限。本文提出NudgeRL,一个用于RLVR中结构化、多样性驱动的探索(https://huggingface.co/papers?q=探索)框架。我们的方法引入了策略引导(Strategy Nudging),通过将每次展开条件化于轻量级的策略级上下文(https://huggingface.co/papers?q=策略级上下文)来诱导多样化的推理轨迹,而无需依赖昂贵的专家监督(https://huggingface.co/papers?q=专家监督)。为了从这种结构化的探索(https://huggingface.co/papers?q=探索)中有效学习,我们进一步提出一个统一目标,将奖励信号分解为上下文间和上下文内组件,并引入蒸馏目标(https://huggingface.co/papers?q=蒸馏目标)将发现的行为迁移回基础策略。实验表明,NudgeRL在五个具有挑战性的数学基准测试中,平均性能优于标准GRPO(https://huggingface.co/papers?q=GRPO)最多8倍的展开预算,同时优于基于专家引导的RL基线。这些结果表明,结构化的、上下文驱动的探索(https://huggingface.co/papers?q=探索)可以作为暴力缩放展开和基于特权信息的可行性导向方法的有效且可扩展的替代方案。我们的代码可在 https://github.com/tally0818/NudgeRL 获取。
查看arXiv页面(https://arxiv.org/abs/2605.15726)查看PDF(https://arxiv.org/pdf/2605.15726)GitHub2(https://github.com/tally0818/NudgeRL)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15726)
在你的智能体中获取此论文:
hf papers read 2605\.15726
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型关联此论文
在模型README.md中引用arxiv.org/abs/2605.15726以在此页面建立关联。
引用此论文的数据集0
尚无数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2605.15726以在此页面建立关联。
引用此论文的Spaces0
尚无Space关联此论文
在Space README.md中引用arxiv.org/abs/2605.15726以在此页面建立关联。
包含此论文的收藏集0
尚无收藏集包含此论文
将本论文添加至收藏集(https://huggingface.co/new-collection)以在此页面建立关联。
相似文章
LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR
本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
ExpRL:面向LLM中期训练的探索式强化学习
ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
叛逆的学生:通过自蒸馏 RLVR 反转教师信号以进行推理探索
本文介绍了 RLRT,这是一种在自蒸馏过程中反转教师信号的方法,旨在强化学生模型成功的偏离行为,从而增强大语言模型的推理探索能力。