元强化学习的拟蒙特卡洛初始化
摘要
本文探讨了在元强化学习中使用拟蒙特卡洛(QMC)方法进行权重初始化,与正交初始化相比,在类似的控制任务中显示出改进的收敛性。
arXiv:2607.21637v1 公告类型:新
摘要:本文探讨了在现代基准环境中,拟蒙特卡洛(QMC)权重初始化对元强化学习的有效性。使用多种采样方法限制基于种群的搜索,并从一组基线任务中聚合出最优先验。当外推到相似的未见过的连续控制环境时,与现有的正交(SB3)默认值相比,QMC元先验在训练收敛性上表现出改进。在不相似的任务中,对于无偏搜索,正交方向全局上更优。
查看缓存全文
缓存时间: 2026/07/27 07:40
# 准蒙特卡洛初始化用于元强化学习
来源:https://arxiv.org/html/2607.21637
###### 摘要
本文探讨了准蒙特卡洛(QMC)权重初始化在现代基准环境中用于元强化学习的有效性。采用多种采样方法对基于种群的搜索进行约束,并从基线任务集中聚合出最优先验。当外推到相似的未见连续控制环境时,QMC元先验 `\theta_{i}^{*}` 在训练收敛性上相比现代正交(SB3)默认值有所改进。在非相似任务中,正交定向在无偏搜索中全局表现更优。
## 1. 引言
强化学习(RL)受模型初始条件影响极大(Kwok等, 2025)。本研究采用多种准蒙特卡洛(QMC)采样方法(图1):Sobol、拉丁超立方采样(LHS)和超椭球密度采样(HDS)(Soltes, 2026),来创建欧几里得和非欧几里得搜索空间 `\Omega_{i}`,并从中采样初始模型权重 `\theta_{i} \in \Omega_{i}`。通过对该样本群体进行高效的一步训练扫描,识别出最优元先验 `\theta_i^{*}`,以加速在相似未见环境中的应用。
准蒙特卡洛序列通常用于单次优化问题(Bossek等, 2020)。外推到元强化学习,本研究结果显示,利用型HDS、低差异Sobol和高分层LHS元先验 (`\theta_{H}^{*}, \theta_{S}^{*}, \theta_{L}^{*}`) 在初始化具有相似运动学特征的未见环境时,能改善训练性能。
 图1. 代表性二维样本群体。
## 2. 方法
实验配置采用现代RL架构(第2.1节)。通过一步适应(第2.2节)和零样本迁移(第2.3节)识别并评估最优元先验(`\theta_{i}^{*}`)。
### 2.1. 实验设置
实验试验使用近端策略优化(PPO),通过StableBaseline3 (SB3) (Raffin等, 2021)在各种Gymnasium (Towers等, 2024)环境下进行。准蒙特卡洛样本使用 `hdim_opt v1.4.7` 生成。所有试验在16个随机种子迭代上自助采样,通过秩和检验获得统计显著结果(p<0.05)。每个配置的随机种子相对于实验试验迭代定义,以确保可重复性。
#### 2.1.1. RL架构
演员网络和评论家网络配置为多层感知机,包含两个32神经元层,以防止对初始搜索环境的过拟合或欠拟合;为跨任务泛化,初始样本权重仅注入这些网络,绕过环境特定的输出层。注入的样本权重通过LeCun/Xavier初始化内部动态缩放(∝ 1/√D) (Glorot和Bengio, 2010)。
观测空间填充至27维(Gymnasium的Ant-v5中位置和速度状态的总数),以考虑不同环境之间观测形状的差异。这种相对低维度的额外好处是减少网络对一步搜索环境的过拟合。
### 2.2. 一步适应
使用HDS、Sobol、LHS和随机基线生成了权重群体 N=2^10 (图1)。每个样本注入策略网络和价值网络的躯干部分,并在三个基线搜索环境中评估:HalfCheetah-v5、BipedalWalker-v3和Hopper-v5。
PPO在每个搜索环境中训练一个时间步,使用Huber损失(平滑L1)和梯度范数裁剪(||g||₂ ≤ 1.0)来稳定随机梯度下降更新,探索学习率为0.01。得到的适应分数 `\mathcal{A}` 量化为动作分布均值的欧几里得偏移,经Z分数归一化并在三个搜索环境上取平均。具有最高分数 `\mathcal{A}^{+}` 的样本权重 `\theta_i` 被提取为零样本迁移的最优元先验 `\theta_i^{*}`,在不同样本量 N ∈ {2², ..., 2¹⁰} 下测试(图2),以可视化 `\mathcal{A}^{+}` 作为N的函数。
 图2. 不同群体大小下的最佳适应分数 `\mathcal{A}^{+}`。
### 2.3. 零样本迁移
PPO注入最优元先验 `\theta_i^{*}`,并在三个相似(以及两个非相似)未见连续控制环境中训练10⁶个时间步:Ant-v5、Walker2d-v5、BipedalWalkerHardcore-v3、Swimmer-v5和LunarLander-v3。后两个环境用于评估 `\theta_i^{*}` 在与搜索环境具有不同特征的任务上的表现。结果与使用SB3 PPO默认初始化('正交'和'随机')的训练进行比较。
## 3. 结果
结果证实了假设:QMC元先验在具有相似运动学特征的环境中提升了性能,而在非相似任务中显示出负面效果。
全局收敛训练性能在所有评估环境上汇总,并在表1中展示,其中p值表示与默认SB3正交相比的性能差异。
表1. 零样本迁移性能,在所有评估环境上Z归一化。p值相对于SB3正交基线计算。
### 3.1. 相似任务
与SB3随机和正交初始化相比,`\theta_i^{*}` 在相似任务上表现提升,统计显著性程度不一(表1)。SB3正交在Ant-v5上表现低于所有方法;其最佳任务是Walker2d,在此任务中仅被Sobol `\theta_{S}^{*}` 略微超过且不显著(p≈0.87)。虽然所有QMC元先验全局上优于SB3正交,但仅Sobol `\theta_{S}^{*}` 显示出统计显著提升(p<0.05)。
 图3. 元先验在相似环境中的聚合性能。
### 3.2. 非相似任务
非相似任务中,`\theta_i^{*}` 相比SB3正交表现出全局性能下降,数学上无偏的初始定向在陌生环境中证明更优(p<0.001)。由于欠过拟合,均匀QMC元先验(Sobol `\theta_{S}^{*}` 和LHS `\theta_{L}^{*}`)在这些环境中相比非欧几里得的HDS `\theta_{H}^{*}` 保留了更高性能。
 图4. 元先验在非相似环境中的聚合收敛性能。
## 4. 结论
结果验证了准蒙特卡洛采样方法作为元强化学习中零样本权重初始化的有效搜索几何。通过高效一步搜索识别出的最优元先验 `\theta_i^{*}` 在初始化相似未见环境时能加速训练。对于非相似任务,SB3正交初始化的无偏几何显示出全局优越性能。
###### 致谢
作者感谢Mike Busch博士在强化学习架构方面的持续指导。Monet一如既往是灵感来源。
## 附录
 图5. 元先验在相似环境中的逐环境性能。
 图6. 元先验在非相似环境中的逐环境性能。
## 参考文献
- J. Bossek, C. Doerr, P. Kerschke, A. Neumann, and F. Neumann (2020) Evolving sampling strategies for one-shot optimization tasks. In Parallel Problem Solving from Nature – PPSN XVI, T. Bäck, M. Preuss, A. Deutz, H. Wang, C. Doerr, M. Emmerich, and H. Trautmann (Eds.), Cham, pp. 111–124. External Links: ISBN 978-3-030-58112-1 Cited by: §1.
- X. Glorot and Y. Bengio (2010) Understanding the difficulty of training deep feedforward neural networks. In Proceedings of the thirteenth international conference on artificial intelligence and statistics, pp. 249–256. Cited by: §2.1.1.
- D. Kwok, G. S. Altıntaş, C. Raffel, and D. Rolnick (2025) The butterfly effect: neural network training trajectories are highly sensitive to initial conditions. In International Conference on Machine Learning, Note: arXiv:2506.13234 External Links: Link Cited by: §1.
- A. Raffin, A. Hill, A. Gleave, A. Kanervisto, M. Ernestus, and N. Dormann (2021) Stable-baselines3: reliable reinforcement learning implementations. Journal of Machine Learning Research 22(268), pp. 1–8. External Links: Link Cited by: §2.1.
- J. G. Soltes (2026) Hyperellipsoid density sampling: exploitative sequences to accelerate high-dimensional numerical optimization. External Links: 2511.07836, Link Cited by: §1.
- M. Towers, J. Terry, J. Kwiatkowski, J. U. Balis, M. de Cola, T. Deleu, M. Gouläo, A. Kallinteris, A. Krimmel, A. KG, R. Perez-Hidalgo, and A. Rassledov (2024) Gymnasium: a standard interface for reinforcement learning environments. arXiv preprint arXiv:2407.17032. Cited by: §2.1.相似文章
探索起点并不足够:Monte Carlo探索起点的反例与修正
本文展示了反例,表明在表格强化学习中,Monte Carlo Exploring Starts可能收敛到次优解,并提供了一种修改方法,通过将学习率与更新频率成反比缩放,保证收敛到最优性。
Agentic Monte Carlo: 为黑盒智能体模拟强化学习
提出了Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛方法对黑盒大语言模型智能体进行强化学习风格的优化,无需访问模型参数。
Muon何时有助于智能体强化学习?
本文研究了Muon优化器在强化学习后训练中的应用,发现在ALFRED任务中,将Muon应用于隐藏权重矩阵相比AdamW显著提高了成功率,且结果依赖于优势估计器和学习率。
@ADarmouni:https://arxiv.org/pdf/2607.13988 微软研究院的一篇优秀的强化学习工作,成功提升了Qwen3小型MoE模型的性能……
本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。
基于贝叶斯优化的节能强化学习样本高效帕累托前沿建模
本文提出了一种多目标贝叶斯优化方法,用于自动化强化学习中的权重选择以实现节能控制,并在物理Quanser Aero 2测试平台上展示了优于网格搜索的样本效率。