超越舒适区的助推:面向RLVR的高效策略引导探索

Hugging Face Daily Papers 论文

摘要

NudgeRL是一个框架,通过引入结构化探索和策略助推来增强带有可验证奖励的强化学习(RLVR),相比暴力扩展方法,它能更高效地提升大语言模型的推理性能。

具有可验证奖励的强化学习(RLVR)已成为一种可扩展的范式,用于提升大语言模型的推理能力。然而,其有效性从根本上受到探索的限制:策略只能改进它已经采样过的轨迹。虽然增加rollout数量可以缓解这个问题,但这种暴力扩展计算成本高昂,而现有修改优化目标的方法对探索内容的控制有限。在这项工作中,我们提出了NudgeRL,一个用于RLVR中结构化和多样性驱动的探索框架。我们的方法引入了策略助推(Strategy Nudging),它将每个rollout置于轻量级的策略级上下文条件下,以诱导多样化的推理轨迹,而无需依赖昂贵的oracle监督。为了有效从这种结构化探索中学习,我们进一步提出了一个统一的目标,它将奖励信号分解为上下文间和上下文内成分,并引入一个蒸馏目标将发现的行为迁移回基础策略。实验上,NudgeRL在标准GRPO上以多达8倍的rollout预算下表现更优,同时在五个具有挑战性的数学基准上平均优于oracle引导的RL基线。这些结果表明,结构化的、上下文驱动的探索可以作为暴力扩展rollout和基于特权信息的可行性导向方法的有效且可扩展的替代方案。我们的代码可在 https://github.com/tally0818/NudgeRL 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:24

论文页面 - 超越舒适区的助推:RLVR的高效策略引导探索

来源:https://huggingface.co/papers/2605.15726

摘要

NudgeRL框架通过结构化探索和策略引导,增强了基于可验证奖励的强化学习,从而提升大型语言模型的推理能力。

基于可验证奖励的强化学习(https://huggingface.co/papers?q=基于可验证奖励的强化学习)(RLVR)已成为提升大型语言模型推理能力的可扩展范式。然而,其有效性从根本上受限于探索(https://huggingface.co/papers?q=探索):策略只能改进已采样的轨迹。虽然增加展开(https://huggingface.co/papers?q=展开)次数可以缓解这一问题,但这种暴力缩放计算成本高昂,且现有的修改优化目标的方法对探索内容的控制有限。本文提出NudgeRL,一个用于RLVR中结构化、多样性驱动的探索(https://huggingface.co/papers?q=探索)框架。我们的方法引入了策略引导(Strategy Nudging),通过将每次展开条件化于轻量级的策略级上下文(https://huggingface.co/papers?q=策略级上下文)来诱导多样化的推理轨迹,而无需依赖昂贵的专家监督(https://huggingface.co/papers?q=专家监督)。为了从这种结构化的探索(https://huggingface.co/papers?q=探索)中有效学习,我们进一步提出一个统一目标,将奖励信号分解为上下文间和上下文内组件,并引入蒸馏目标(https://huggingface.co/papers?q=蒸馏目标)将发现的行为迁移回基础策略。实验表明,NudgeRL在五个具有挑战性的数学基准测试中,平均性能优于标准GRPO(https://huggingface.co/papers?q=GRPO)最多8倍的展开预算,同时优于基于专家引导的RL基线。这些结果表明,结构化的、上下文驱动的探索(https://huggingface.co/papers?q=探索)可以作为暴力缩放展开和基于特权信息的可行性导向方法的有效且可扩展的替代方案。我们的代码可在 https://github.com/tally0818/NudgeRL 获取。

查看arXiv页面(https://arxiv.org/abs/2605.15726)查看PDF(https://arxiv.org/pdf/2605.15726)GitHub2(https://github.com/tally0818/NudgeRL)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15726)

在你的智能体中获取此论文:

hf papers read 2605\.15726

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

尚无模型关联此论文

在模型README.md中引用arxiv.org/abs/2605.15726以在此页面建立关联。

引用此论文的数据集0

尚无数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2605.15726以在此页面建立关联。

引用此论文的Spaces0

尚无Space关联此论文

在Space README.md中引用arxiv.org/abs/2605.15726以在此页面建立关联。

包含此论文的收藏集0

尚无收藏集包含此论文

将本论文添加至收藏集(https://huggingface.co/new-collection)以在此页面建立关联。

相似文章

ExpRL:面向LLM中期训练的探索式强化学习

Hugging Face Daily Papers

ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。