基于重试的策略梯度强化学习中探索的涌现
摘要
本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。
arXiv:2606.00151v1 公告类型:新的
摘要:在强化学习(RL)中,智能体从探索中受益仅因为它们反复遇到相似的状态:尝试不同动作可以改善性能或减少不确定性;没有这样的重试,贪心策略是最优的。我们用ReMax形式化了这一直觉,该目标函数通过基于$M$个样本($M$为正整数)的期望最大回报来评估策略,同时考虑回报不确定性。优化该目标函数将随机探索作为涌现属性引入,无需显式的奖励项。为了高效策略优化,我们推导了ReMax的新策略梯度公式,并引入了ReMax PPO(RePPO),一种PPO变体,它优化ReMax的同时将离散重试次数$M$推广为连续参数$m>0$,实现了对探索的细粒度控制。实验上,RePPO在MinAtar和Craftax基准测试上促进了探索,无需任何显式探索奖励。
查看缓存全文
缓存时间: 2026/06/02 15:39
# 通过重试机制在策略梯度强化学习中涌现探索行为
来源:https://arxiv.org/html/2606.00151
Paavo Parmas,Sotetsu Koyamada,Tadashi Kozuno,Toshinori Kitamura,Shin Ishii,Yutaka Matsuo
###### 摘要
在强化学习(RL)中,智能体之所以能从*探索*中获益,仅仅是因为它们会反复遇到相似的状态:尝试不同的动作可以改善性能或降低不确定性;如果没有这种重试机会,贪婪策略就已经是最优的。我们将这一直觉形式化为 ReMax 目标函数,该目标函数通过期望在 \(M\) 次采样(\(M \in \mathbb{N}\))中的最大回报来评估策略,同时考虑了回报的不确定性。优化这一目标函数会使随机探索作为涌现特性自然出现,无需显式的奖励附加项。为了实现高效的策略优化,我们推导了 ReMax 的新策略梯度公式,并引入了 ReMaxPPO(RePPO),这是一种 PPO 变体,它在优化 ReMax 的同时,将离散的重试次数 \(M\) 推广为连续参数 \(m > 0\),从而实现了探索的精细控制。实验表明,RePPO 在 MinAtar 和 Craftax 基准测试中——无需任何显式探索奖励附加项——就能促进探索。官方代码见 https://github.com/nissymori/remax-rl。
机器学习,ICML
## 1 引言
探索是强化学习(RL)中的一个核心问题,并已被广泛研究 \(Sutton and Barto, 2018 (https://arxiv.org/html/2606.00151#bib.bib1); Haarnoja et al., 2018 (https://arxiv.org/html/2606.00151#bib.bib30); Ziebart et al., 2008 (https://arxiv.org/html/2606.00151#bib.bib34); Mnih et al., 2016 (https://arxiv.org/html/2606.00151#bib.bib28)\)。主流方法通过在环境奖励中添加附加项(如熵 \(Haarnoja et al., 2018 (https://arxiv.org/html/2606.00151#bib.bib30); Ziebart et al., 2008 (https://arxiv.org/html/2606.00151#bib.bib34)\) 或基于计数的附加项 \(Bellemare et al., 2016 (https://arxiv.org/html/2606.00151#bib.bib10); Ostrovski et al., 2017 (https://arxiv.org/html/2606.00151#bib.bib46)\))来显式鼓励探索。另一类工作通过集成或贝叶斯网络 \(Osband et al., 2016 (https://arxiv.org/html/2606.00151#bib.bib38), 2018 (https://arxiv.org/html/2606.00151#bib.bib39), 2019 (https://arxiv.org/html/2606.00151#bib.bib40)\) 实现后验采样 \(Thompson, 1933 (https://arxiv.org/html/2606.00151#bib.bib58)\)。
我们研究了一种通过贪婪奖励最大化来驱动探索的独特机制。RL 的目标不是在当前试验中最大化奖励,而是学习在多次试验后最大化奖励。探索之所以重要,是因为它能在后续试验中获得更高的奖励。如果没有重试机会,探索就是不必要的:理性的选择是当前被认为能产生最高奖励的动作。环境不确定性也激励探索,鼓励尝试其他动作以获取信息。如果不存在不确定性,我们就不需要探索:问题退化为纯粹的优化。
基于这一原则——*决策者在不确定性下进行重试*——我们提出了 ReMax 目标函数,它将探索形式化为不确定性下的奖励最大化。我们首先在赌博机设置中介绍 ReMax,并将其与标准 RL 目标进行比较。
ReMax 目标(赌博机)。设 \(K \geq 2\) 为动作数量,\(\mu = (\mu_1, \ldots, \mu_K)\) 表示每个动作的价值,\(\Pi\) 是 \(\mu\) 上的一个分布(例如,智能体当前对未知价值的信念/后验)。对于策略 \(\pi \in \Delta^{K-1}\)(\(\Delta^{K-1}\) 是 \(K\) 个动作的概率单纯形),\(M \in \mathbb{N}\) 且 \([M] \coloneq \{1, \ldots, M\}\),
\[
J_{\mathrm{RL}}(\pi) := \mathbb{E}_{A \sim \pi}\left[ \mu_A \right], \tag{1}
\]
\[
J_{\mathrm{ReMax}}^{M}(\pi) := \mathbb{E}_{\boldsymbol{\mu \sim \Pi}} \left[ \mathbb{E}_{\boldsymbol{A_{[M]} \sim \pi}} \left[ \boldsymbol{\max_{m \in [M]}} \mu_{A_m} \mid \mu \right] \right]. \tag{2}
\]
蓝色表示*重试*:我们通过 \(M\) 次抽取中的最佳结果来给策略评分。对于 \(M=1\) 且奖励固定,\(J_{\mathrm{ReMax}}^{M}\) 退化为 \(J_{\mathrm{RL}}(\pi)\),最优策略是确定性的 \(Sutton and Barto, 2018 (https://arxiv.org/html/2606.00151#bib.bib1)\);对于 \(M \geq 2\),最优策略可以是随机的 \(第2节 (https://arxiv.org/html/2606.00151#S2)\)。红色表示关于 \(\mu\) 的(认知)不确定性 \(Ghosh et al., 2021 (https://arxiv.org/html/2606.00151#bib.bib2)\)——这是由数据有限而非固有随机性引起的不确定性,会在探索过程中演变;我们通过显式建模 \(Osband et al., 2016 (https://arxiv.org/html/2606.00151#bib.bib38)\) 或从非平稳回报估计中采样 \(Moalla et al., 2024 (https://arxiv.org/html/2606.00151#bib.bib72)\) 来处理它。
相比之下,一种经典的探索方法是通过基于好奇心的附加项来增强奖励,包括伪计数法 \(Bellemare et al., 2016 (https://arxiv.org/html/2606.00151#bib.bib10); Lobel et al., 2023 (https://arxiv.org/html/2606.00151#bib.bib47)\) 和基于预测误差的方法 \(Pathak et al., 2017 (https://arxiv.org/html/2606.00151#bib.bib12); Burda et al., 2019 (https://arxiv.org/html/2606.00151#bib.bib21)\)。虽然这些方法在 ALE 游戏领域已被证明有效,但它们通常需要额外的模型来估计构建附加项所需的统计量,从而增加了算法复杂度和额外的计算开销。与添加显式附加项的方法不同,ReMax 通过优化一个纯粹基于奖励的目标函数来*无需*附加项地诱导探索。
近期与我们工作相关/并行的研究,在针对推理任务的 LLM 训练中,研究了类似重试风格的目标函数,如 pass@K \(Walder and Karkhanis, 2025 (https://arxiv.org/html/2606.00151#bib.bib36); Tang et al., 2025a (https://arxiv.org/html/2606.00151#bib.bib37)\),这些共享了我们类似的思想。¹ 关键区别在于,ReMax 明确考虑了奖励的不确定性,而 LLM 推理任务通常假设奖励是固定且可验证的。更广泛的讨论及与相关工作的联系,见附录A (https://arxiv.org/html/2606.00151#A1)。
在本文中,我们致力于解决以下问题:能否通过在 RL 中优化 ReMax,在不添加显式附加项的情况下促进探索?为了回答这个问题,我们按如下步骤组织本文。
步骤1:赌博机中的实证研究。我们通过实证说明 ReMax(在公式 (1) (https://arxiv.org/html/2606.00151#S1.E1) 中定义)如何在第2节 (https://arxiv.org/html/2606.00151#S2) 的赌博机设置中诱导有效的探索。随着重试参数 \(M\) 的增加,最优策略变得更加探索性,并且 ReMax 会根据奖励不确定性的规模调整探索强度;在后验赌博机设置中,它表现出*经验上*的次线性遗憾(如我们的实验中观察到的那样)。
步骤2:RL 中的 ReMax。我们在第3节 (https://arxiv.org/html/2606.00151#S3) 中定义了 RL 的 ReMax 目标函数。与赌博机不同,状态转换阻碍了从同一状态重试多个动作来观察回报,因此我们通过查询 \(Q\) 函数来模拟重试,并讨论了 ReMax 在 RL 中可能的实例化方式。
步骤3:ReMax 的策略梯度。为了优化 ReMax,我们在第4节 (https://arxiv.org/html/2606.00151#S4) 中开发了一种实用的策略梯度(PG)方法。我们推导了一个可从轨迹回报中估计的新 PG 公式,并将整数抽样次数 \(M\) 推广为正实数参数 \(m > 0\),从而实现对探索-利用权衡的更精细控制。基于这个公式,我们引入了 ReMaxPPO (RePPO),一种基于 PPO 的深度演员-评论家算法 \(Schulman et al., 2017 (https://arxiv.org/html/2606.00151#bib.bib35)\)。
步骤4:实验。最后,我们在第5节 (https://arxiv.org/html/2606.00151#S5) 的 MinAtar \(Young and Tian, 2019 (https://arxiv.org/html/2606.00151#bib.bib52)\) 和 Craftax \(Matthews et al., 2024 (https://arxiv.org/html/2606.00151#bib.bib73)\) 上评估了 RePPO。RePPO 优化 ReMax 时不使用探索附加项,取得了更好的性能,并且相比于带熵附加项的 PPO 保持了更高的策略熵;峰值性能出现在 \(m = 1.2\)–\(1.4\) 附近。在 Craftax(一个更大规模的开放式 RL 环境)上,RePPO 达到了与经过调参的熵正则化 PPO 相当的性能,尽管没有使用探索附加项。总体而言,ReMax 作为强化学习中一个富有前景的探索目标函数正在崭露头角。
请参考图注
请参考图注
请参考图注
图 1:赌博机问题。(左)二元赌博机的 ReMax 目标函数。标准强化学习目标(\(M=1\))具有确定性最优策略(\(p^*=1\));相反,增加重试次数 \(M \geq 2\) 会使最优策略转向随机探索,以对冲奖励不确定性。(中)最优策略随奖励方差变化的曲线。Softmax 在方差变化时保持不变,而 ReMax 会随着奖励不确定性(尺度 \(\alpha_1\))增大而自动增加探索,瞄准罕见的高奖励结果。(右)固定确定性奖励向量下的 ReMax 目标函数。连续参数 \(m\) 重塑了目标函数的曲率。\(m > 1\) 的值会使梯度平缓,从而减慢收敛并维持探索,而 \(m < 1\) 则会加速更新。
## 2 赌博机中的 ReMax:一项实证研究
本节建立关于 ReMax(公式 (1) (https://arxiv.org/html/2606.00151#S1.E1))如何通过重试和不确定性促进探索的直观理解。我们首先设计简单的奖励分布来说明 ReMax 的最优解(第2.1节 (https://arxiv.org/html/2606.00151#S2.SS1)),然后转向后验更新的赌博机,其中 \(\Pi\) 是从数据中学习的(即,与 Thompson 采样类似的标准贝叶斯赌博机学习设置;第2.2节 (https://arxiv.org/html/2606.00151#S2.SS2))。
### 2.1 热身:ReMax 的性质
#### ReMax 的最优解产生随机策略。
这个例子展示了重试如何诱导随机策略。考虑一个双臂赌博机,臂的索引为 \(a \in \{0, 1\}\)(因此 \(\mu = (\mu_0, \mu_1)\)):\(\mu = (0, 1)\) 概率为 0.75,\(\mu = (1, 0)\) 概率为 0.25。对于 RL 目标,最优策略是确定性的,总是选择臂 1。对于 ReMax(公式 (1) (https://arxiv.org/html/2606.00151#S1.E1)),最优策略是随机的:在臂之间混合以对冲哪个臂是奖励性的(重复同一个臂无法改善在 \(M\) 次中的最大值)。由于 \(\mu = (0, 1)\) 的可能性更大,有限的重试预算 \(M\) 仍然会将大部分概率质量分配给臂 1,以避免错过它。随着 \(M\) 增长,策略可以更频繁地探索臂 0,最优解变得越来越具有探索性。
图1 (https://arxiv.org/html/2606.00151#S1.F1) 左图绘制了 \(J_{\mathrm{ReMax}}^{M}(p)\) 相对于 \(p := \pi(a=1)\) 的曲线,其中 \(M = 1, \dots, 5\)(解析值;见附录C.1 (https://arxiv.org/html/2606.00151#A3.SS1))。点标记了最大值点 \(p^*\):\(M=1\) 时 \(p^* = 1\)(值 0.75),而对于 \(M \geq 2\),随着值趋近于 1,最优解转向探索。因此,重试机制在不确定性存在时诱导了随机行为。
#### ReMax 使探索适应奖励不确定性。
前面的例子表明 ReMax 通过重试机制诱导随机行为;这里我们展示它还能适应奖励不确定性的幅度。我们考虑一个双臂伯努利赌博机,其中 \(\mu_i = \alpha_i X_i\),\(X_i \sim \mathrm{Bernoulli}(p_i)\),且 \(\mathbb{E}[\mu_i] = \alpha_i p_i\)。我们固定 \(p_0 = 1\) 和 \(\alpha_0 = 2\),并将 \(\alpha_1\) 从 1 变化到 10,同时调整 \(p_1\) 使得 \(\alpha_1 p_1 = 1\) 保持不变(固定均值,方差变化)。图1 (https://arxiv.org/html/2606.00151#S1.F1) 中图显示了在 \(M=2\) 时选择臂 1 的最优概率 \(\pi^*(a=1)\),以及 softmax 策略(这是带熵附加项的 RL 目标的解析最优解;附录C.2 (https://arxiv.org/html/2606.00151#A3.SS2))。当 \(\alpha_1 \leq 2\) 时,臂 1 永远不会被选择,因为它的最大值不可能超过臂 0 的最大值。随着 \(\alpha_1\) 增加到超过 2,ReMax 越来越倾向于臂 1,体现了其对罕见但高奖励结果的适应性。相比之下,Softmax 在 \(\alpha_1 \in [1, 10]\) 上保持平坦,因为它只依赖于均值,而均值是固定的。
#### 确定性奖励下的 ReMax。
前面的例子集中于随机奖励下的 ReMax。现在我们转向确定性设置,并展示,*即使奖励固定*,ReMax 也会重塑目标函数的几何形状,从而通过重试参数调节收敛。考虑一个二元赌博机,奖励固定为 \(\mu = (0, 1)\),令 \(p := \pi(a=1) \in [0, 1]\)。在这种情况下,ReMax 目标函数有闭式解:对于 \(m > 0\),\(J_{\mathrm{ReMax}}^{\,m}(p) = 1 - (1-p)^m\),其中 \(m\) 可以是整数或正实数。图1 (https://arxiv.org/html/2606.00151#S1.F1) 右图绘制了 \(J_{\mathrm{ReMax}}^{\,m}(p)\) 对于 \(m = 0.5, 0.75, 1, 1.5, 2\) 的曲线,为我们第3节 (https://arxiv.org/html/2606.00151#S3) 和第4节 (https://arxiv.org/html/2606.00151#S4) 中的连续 \(m\) 公式做了铺垫。对于所有 \(m\),最大值点仍然是 \(p^\star = 1\),这表明在充分探索消除了认知不确定性后,策略将收敛到最优策略。然而,高 \(p\) 附近的局部几何形状强烈依赖于 \(m\):较大的 \(m\) 使目标函数变平缓并减小梯度幅度,而较小的 \(m\) 则使曲率变尖锐并放大梯度。因此,调整 \(m\) 即使在确定性设置中也能控制收敛:\(m > 1\) 减慢更新(鼓励探索),而 \(m < 1\) 加速更新,缓解了 softmax 策略中常见的收敛缓慢问题 \(Hennes et al., 2020 (https://arxiv.org/html/2606.00151#bib.bib61)\)。此外,非整数 \(m\) 自然地插值在整数重试次数之间(例如,\(m=1.5\) 介于 \(m=1\) 和 \(m=2\) 之间),从而实现了更精细的控制。
### 2.2 带后验的赌博机:经验性次线性遗憾
在前一节中,我们有意设计了奖励上的分布 \(\Pi\) 来说明 ReMax 的性质。在实践中,这个分布是*估计*出来的,并随着智能体探索环境而从观测数据中更新。为了在这种更现实的设置中验证 ReMax,我们考虑一个 \(K\) 臂赌博机,进行后验更新,利用不断演变的后验 \(Thompson, 1933 (https://arxiv.org/html/2606.00151#bib.bib58)\) 中的样本来优化 ReMax,并评估累积遗憾。
问题设置。在每次运行中,抽取均值 \((\mu_1, \ldots, \mu_K) \sim \Pi^*\) 并固定它们,令 \(\mu^* = \max_i \mu_i\)。在第 \(t \in [T]\) 轮,相似文章
安全探索者:一种针对带有恢复干预的强化学习的无偏策略梯度
安全探索者(SafeExplorer)引入了一种用于带有恢复干预的强化学习的无偏策略梯度估计器,在机器人任务上显著减少了训练期间的跌倒次数,同时达到或超过了标准PPO的最终奖励。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。
提示驱动探索
本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。
关于通过元强化学习学习探索的一些思考
OpenAI研究人员引入了E-MAML和E-RL²两种元强化学习算法,旨在改进需要大量探索来发现最优策略的任务中的探索性能。该工作展示了这些算法在包括Krazy World和迷宫任务在内的新颖环境中的有效性。