Agentic Monte Carlo: 为黑盒智能体模拟强化学习
摘要
提出了Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛方法对黑盒大语言模型智能体进行强化学习风格的优化,无需访问模型参数。
arXiv:2606.05296v1 公告类型:新
摘要:大语言模型智能体运行在两种不同的模式下:可采用强化学习(RL)进行优化的开放权重智能体,以及必须在测试时纯粹通过行为控制的黑盒智能体。尽管黑盒智能体通常由最先进的商业大语言模型支持,但仅通过API访问无法进行参数级优化,这使得大多数RL方法无法应用。为解决这一限制,我们转向RL与贝叶斯推理之间的已知等价关系。我们提出Agentic Monte Carlo (AMC),直接从黑盒智能体的最优策略中采样,而非通过RL训练该策略。最优策略是关于轨迹的后验分布,我们将先验定义为固定的黑盒大语言模型智能体。我们采用序贯蒙特卡洛方法,通过学习价值函数来引导智能体,同时保持底层黑盒模型不变。我们在AgentGym基准测试的三个不同环境中验证了AMC,结果表明,与提示基线相比有显著改进,并且随着测试时计算量的扩展,甚至优于分组相对策略优化(GRPO)。AMC展示了在原则上对黑盒大语言模型智能体进行RL风格优化的可行性。代码可在https://github.com/layer6ai-labs/Agentic-Monte-Carlo获取。
查看缓存全文
缓存时间: 2026/06/05 08:10
# 基于智能体的蒙特卡洛方法:面向黑盒智能体的强化学习模拟
来源:https://arxiv.org/html/2606.05296
Raunaq Suri, Valentin Villecroze, Anthony L. Caterini, Jesse C. Cresswell, Noël Vouitsis, Brendan Leigh Ross
###### 摘要
LLM智能体运行在两种不同的模式下:适用于强化学习(RL)的开放权重智能体,以及必须在测试时纯粹通过行为控制的黑盒智能体。尽管黑盒智能体通常由最先进的专有LLM支撑,但仅通过API访问使得无法进行参数级优化,导致大多数RL方法不适用。为解决这一限制,我们利用RL与贝叶斯推断之间已知的等价关系。我们提出基于智能体的蒙特卡洛方法(Agentic Monte Carlo, AMC),直接从黑盒智能体的最优策略中采样,而非通过RL训练该策略。最优策略是轨迹的后验分布,其先验定义为固定的黑盒LLM智能体。我们采用顺序蒙特卡洛方法,通过学习一个值函数来引导智能体,同时保持底层黑盒模型不变,从而从该后验中采样。我们在AgentGym基准测试的三个不同环境中验证了AMC,结果表明其显著优于提示基线,并且随着我们方法测试时计算量的增加,甚至超越了群体相对策略优化(GRPO)。AMC证明了在理论上对黑盒LLM智能体执行原则性RL风格优化的可行性。
¹¹代码见 https://github.com/layer6ai-labs/Agentic-Monte-Carlo
智能体、大语言模型、强化学习、顺序蒙特卡洛
## 1 引言
参考图标题
图1:AMC与其他智能体范式的比较。AMC通过学习轻量级值函数实现黑盒LLM策略的任务特异性。而通过RL训练白盒模型则对基础策略的选择和规模施加了限制。
大语言模型(LLMs)已从被动的文本生成器演变为能够进行多步推理和与环境交互的主动自主智能体(Yao 等人,2023;Schick 等人,2023)。为了将这些智能体投入应用,强化学习(RL)(Sutton 等人,1998;Christiano 等人,2017;Ziegler 等人,2019)通过近端策略优化(PPO)(Schulman 等人,2017;Ouyang 等人,2022)以及最近的群体相对策略优化(GRPO)(Shao 等人,2024)等方法,已成为主导的训练范式。这些算法已被证明对开放权重模型非常有效,能够实现从复杂数学推理到软件工程等多种能力(Wang 等人,2025;Pennino 等人,2025)。然而,这些方法依赖于一个基本假设:即能够白盒访问模型参数以计算策略梯度。这一要求对最先进的能力最强的模型(如 GPT-5(OpenAI, 2025a)、Gemini 3(Google, 2025)和 Claude 4.6(Anthropic, 2026))构成了根本性障碍——这些模型通常仅作为黑盒API提供。因此,试图优化由这些专有模型支持的智能体的研究人员往往局限于提示工程或微调开放权重替代模型,这两种方法都无法对目标黑盒模型执行基于RL的优化。
为弥补这一差距,我们重新审视RL与贝叶斯推断之间已知的对偶关系(Levine, 2018;Korbak 等人, 2022)。该框架将使用RL最大化奖励的目标视为对智能体最优策略的概率推断。在这里,最优策略被定义为智能体轨迹上的贝叶斯后验分布。具体而言,该后验正比于一个先验分布(由预训练的黑盒模型给出)乘以一个表示获得高奖励(即最优)概率的似然项。这种表述对黑盒智能体特别有吸引力,因为它重构了学习问题:我们无需更新先验的参数(我们无法访问),而只需从后验分布中采样即可恢复最优行为。然而,对于黑盒智能体而言,精确采样最优后验是不可能的,因为其完整对数概率通常不可获取;即使对于白盒智能体,由于智能体环境中固有的高维动作空间和长时域,精确采样也是棘手的。
在这项工作中,我们提出Agentic Monte Carlo(AMC),这是一个利用顺序蒙特卡洛(SMC)方法(一种应用于序列数据的重要性采样形式(Doucet 等人, 2001))使这种采样变得可行的新框架。在智能体轨迹的每一步,AMC直接从黑盒先验中采样动作,并基于预期奖励对其进行重新加权。为了预测预期奖励,我们训练一个单独的值函数,以有效引导智能体走向最优,而无需修改底层黑盒语言模型。正如我们在图1中强调的那样,AMC在提示静态黑盒智能体与微调较小白盒智能体之间提供了一个有用的插值。
我们使用AgentGym基准(Xi 等人, 2025a)验证AMC,在三个不同环境中评估性能:WebShop(电子商务)、SciWorld(科学实验)和TextCraft(类似Minecraft的合成)。我们的实验表明,AMC始终优于提示基线,并且随着我们方法测试时计算量的增加,甚至超越了需要完全参数访问的GRPO基线。我们的主要贡献如下:
1. 1.我们通过贝叶斯推断的视角将黑盒智能体的RL问题形式化,将最优策略定义为轨迹上的贝叶斯后验,该后验结合了黑盒先验与编码最优智能体行为的似然项。
2. 2.我们提出Agentic Monte Carlo,一种使用带有顺序重要性重采样的SMC从该最优策略中采样的算法。我们推导出一个权重更新规则,利用学习到的值函数将黑盒智能体的行为引导向最优。
3. 3.我们通过实验验证了与提示和RL基线相比我们方法的有效性,证明严格的RL概念可以在没有梯度访问的情况下应用于闭源智能体。这些结果使得AMC与黑盒模型的组合在GPU受限场景中成为基于梯度的RL的可行替代方案。
## 2 Agentic Monte Carlo
本节逐步构建我们的方法,从强化学习的基础知识开始。在第2.1节中,我们介绍强化学习设置并将其形式化为贝叶斯推断问题。我们在第2.2节中概述了如何使用顺序蒙特卡洛(SMC)作为解决该问题的工具。然后,在第2.3节和第2.4节中,我们描述Agentic Monte Carlo(AMC):我们通过学习辅助值函数将SMC应用于潜在黑盒智能体的方法。
### 2.1 强化学习与贝叶斯推断
s₀^{(1)} s₀^{(2)} s₀^{(3)} 1/N 1/N 1/N
s₁^{(i)} ~ π(s₁ | s₀^{(i)})
s₁^{(1)} s₁^{(2)} s₁^{(3)}
w₁^{(1)} V_θ(·) w₁^{(2)} V_θ(·) w₁^{(3)} V_θ(·)
s₂^{(i)} ~ π(s₂ | s₁^{(i)})
s₂^{(1)} s₂^{(2)} s₂^{(3)}
w₂^{(1)} V_θ(·) w₂^{(2)} V_θ(·) w₂^{(3)} V_θ(·)
s₃^{(i)} ~ π(s₃ | s₂^{(i)})
s₃^{(1)} s₃^{(2)} s₃^{(3)}
w₃^{(1)} V_θ(·) w₃^{(2)} V_θ(·) w₃^{(3)} V_θ(·)
重采样步骤
w₃^{(2)} > w₃^{(3)} > w₃^{(1)}
s₃^{(1)} s₃^{(2)} s₃^{(3)}
1/N 1/N 1/N
图2:N=3条轨迹时AMC的可视化表示。重要性权重 w_t^{(i)} 由值函数 V_θ 确定,其中权重较低的轨迹(如 s^{(1)})在重采样期间比权重较高的轨迹(s^{(2)}, s^{(3)})更可能被剪枝。
我们从标准强化学习设置开始:智能体由策略 π 定义,在时刻 t 观察到状态 s_t ∈ S,并产生动作 a_t ~ π(a_t | s_t),a_t ∈ A。所选动作导致新状态 s_{t+1} ~ p(s_{t+1} | s_t, a_t),由智能体环境的转移动态决定。我们假设离散状态和动作空间。对状态的偏好由环境给出的标量奖励函数 r(s_t) ∈ ℝ 编码,奖励越高越好。在时间跨度 T 上,智能体 π 产生一条轨迹 s_{0:T} ~ π(s_{0:T})。
最优智能体应产生具有较大累积奖励值的轨迹,记为 r(s_{0:T}) = Σ_{t=0}^{T} r(s_t)。对于许多感兴趣的任务和环境,使用预训练LLM初始化策略已成为标准做法,因为它们具有丰富的语义理解和广泛的世界知识。因此,我们的目标是为特定环境微调一个LLM智能体。策略梯度方法(Williams, 1992)已成为LLM的主导训练范式:训练策略以最大化期望奖励,通常带有相对于参考策略的KL散度惩罚项(Ouyang 等人, 2022;Shao 等人, 2024),
π_* = argmax_{π_θ} 𝔼_{π_θ(s_{0:T})} [ r(s_{0:T}) ] - β KL[ π_θ ∥ π ], (1)
其中 π_θ 是正在训练的策略,π 是由预训练LLM给出的参考模型,β 是正则化系数。尽管 π_θ 通常从 π 初始化,但下标 θ 表示 π_θ 是一个具有可训练参数的独立模型,而 π 本身保持固定。正如 Korbak 等人(2022)所强调的,方程(1)可以理解为执行变分推断以近似以下(难处理的)后验:
π_*(s_{0:T}) ∝ π(s_{0:T}) e^{r(s_{0:T})/β}. (2)
方程(2)将KL正则化RL视为一个贝叶斯推断问题,其中参考策略的概率 π(s_{0:T})(作为先验)通过与编码高奖励轨迹的似然 e^{r(s_{0:T})/β} 相乘来调整。注意,计算方程(1)和方程(2)的右侧得到相同的最优策略:后验 π_*。通过将KL正则化RL视为贝叶斯推断,我们可以超越变分推断,探索更广泛的贝叶斯工具。变分推断(标准方法)通过训练参数化策略 π_θ 来估计后验,而蒙特卡洛方法提供了一种基于采样的替代方案,可以完全绕过策略优化,即使当 π 是黑盒时也能模拟强化学习。我们利用这种视角的转变来证明,通过一个简单的辅助模型引导静态先验策略 π,可以估计 π_*。这种方法为在微调参考策略 π 难以或不可能实现的场景下进行强化学习提供了一条可行路径。
### 2.2 通过顺序蒙特卡洛进行贝叶斯推断
顺序蒙特卡洛(SMC;Gordon 等人, 1993;Doucet 等人, 2001)是一组蒙特卡洛方法,用于估计以逐步观测为条件的序列演化系统的后验。状态转移 π(s_{t+1} | s_t) 的序列性质使得SMC特别适合第2.1节中描述的RL设置。例如,Piché 等人(2019)使用SMC结合训练好的策略和值函数进行规划,Zhao 等人(2024)使用SMC结合学习到的“扭曲”函数进行LLM约束文本生成。由于许多数字环境的性质允许我们并行模拟智能体轨迹,我们可以使用SMC直接构建一个运行最优策略 π_* 的智能体的蒙特卡洛模拟。
最标准的SMC方法是bootstrap滤波器(Gordon 等人, 1993;Doucet 等人, 2001),即顺序重要性重采样(SIR)。在高层次上,SIR提供了一种原则性的方法,通过并行运行我们(黑盒或其他难以处理的)先验 π,同时间歇性地进行*重采样*:随机剪枝最差的轨迹并增殖最好的轨迹,从而将整体样本引导向后验 π_*,来并行采样多条轨迹 {s_{0:T}^{(i)}}_{i=1}^N。从根本上说,SIR是一种重要性采样算法,重要性权重将用于指导这些重采样步骤。
考虑一个*粒相似文章
灰盒仿真模型的代理校准:一种LLM驱动的替代方案
本文介绍了一种代理校准方法,该方法使用大型语言模型作为优化器,用于成本效益分析中灰盒仿真模型的校准。与Nelder-Mead和贝叶斯优化等传统方法相比,这种LLM驱动的方法在显著更少的模型评估次数下实现了具有竞争性的性能。
基于代理增强自动研究的智能体贝叶斯优化
本文介绍了智能体贝叶斯优化,其中LLM智能体作为贝叶斯后端支持的贝叶斯优化循环中的核心决策者,能够实现在线策略修订和问题重构。作者在Sara和lenz中实现了这一理念,展示了相比标准贝叶斯优化和基于LLM的基线方法的可靠性和性能提升。
超越静态评估:构建用于可扩展智能体强化学习的仿真环境
介绍AgenticAI-Supervisor,一个基于API和UI驱动的仿真环境,用于LLM智能体的可扩展强化学习,通过可验证的执行结果和奖励塑造来缓解奖励破解。
ClawGym II:基于代理工具的黑箱强化学习探索
本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。
AEM:用于多轮智能体强化学习的自适应熵调制
本文介绍了AEM,这是一种用于智能体强化学习的无监督方法,通过在响应级别自适应调整熵动态来改善探索与利用之间的平衡。通过在ALFWorld和SWE-bench等基准测试上展示性能提升,该方法将不确定性估计与动作粒度对齐。