策略感知模拟器学习的理论基础与高效算法
摘要
本文提出了一种用于基于模型的强化学习中模拟器学习的策略鲁棒性目标,将其建模为模型玩家与对抗性策略玩家之间的极小极大博弈。提供了理论保证和可证明收敛的算法,实验表明预测误差在关键区域降低1.5-2.2倍,并提升了策略从模拟到真实世界的迁移效果。
arXiv:2605.29032v1 公告类型: 新论文
摘要: 基于模型的强化学习(MBRL)智能体通常通过最小化预测损失来学习世界模型。然而,强大的RL优化器不可避免地会利用细微的模型不准确之处,导致模拟器被过度利用,并出现现实差距——策略在模拟中成功但在真实世界中失败。我们提出,学习模拟器的目标应当是策略鲁棒性而非预测准确性,并将其建模为模型玩家与对抗性策略玩家之间的零和极小极大博弈。我们提供了全面的理论分析:(1)在线学习保证,表明该博弈是可学习的且具有亚线性遗憾界;(2)一种基于评论家的可处理简化,通过局部评论家的损失来约束全局策略价值差距;(3)误差-MDP对偶性,证明寻找最坏情况策略在形式上与一个标准RL问题对偶,其中奖励为单步评论家误差。这一对偶性产生了一个可证明收敛的主动数据选择算法。在连续控制任务上的实验表明,我们的方法将策略重要区域的预测误差降低了 $1.5$-$2.2\times$,并且使得仅在模拟中训练的策略能够匹配接近最优的真实世界性能。
查看缓存全文
缓存时间: 2026/05/29 09:15
# 策略感知模拟器学习的理论基础与有效算法 来源:https://arxiv.org/abs/2605.29032 查看 PDF(https://arxiv.org/pdf/2605.29032) > 摘要:基于模型的强化学习(MBRL)智能体通常通过最小化预测损失来学习世界模型。然而,强大的强化学习优化器不可避免地会利用微小的模型不准确性,导致模拟器被利用,并产生现实差距——策略在模拟中成功,但在真实世界中失败。我们提出,学习模拟器的目标应该是策略鲁棒性而非预测准确性,并将其形式化为一个模型玩家与对抗性策略玩家之间的零和最小最大博弈。我们提供了全面的理论分析:(1)一个在线学习保证,表明该博弈是可学习的,具有次线性后悔界;(2)一个易于处理的基于价值批评家的简化,将全局策略价值差距限定为局部批评家的损失;(3)一个误差-马尔可夫决策过程对偶性,证明寻找最坏情况策略在形式上等价于一个标准强化学习问题,其中奖励是一步批评家误差。这种对偶性产生了一个可证明收敛的主动数据选择算法。在连续控制任务上的实验表明,我们的方法在策略重要区域将预测误差降低了1.5-2.2倍,并使完全在模拟中训练的策略能够匹配接近最优的真实世界性能。 ## 提交历史 来自:Christoph Dann [查看邮箱(https://arxiv.org/show-email/7ee4cd9e/2605.29032)] **\[v1\]** 2026年5月27日星期三 19:31:37 UTC(1,093 KB)
相似文章
注意仿真与现实的差距,并像科学家一样思考
本文研究在序贯决策问题中,规划者何时以及如何用真实实验补充预训练模拟器,提出Fisher-SEP以最小化目标策略值的后验方差。
SimFoundry:模块化与自动化场景生成用于策略学习与评估
SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。
基础模型体的模拟-现实差距:统一的MDP视角
本文将基础模型体的模拟-现实差距形式化为马尔可夫决策过程问题,提出了统一的研究议程,以适应如领域随机化等经典解决方案,从而提升智能体在真实部署中的鲁棒性和可靠性。
通过世界模型从人类偏好和理由中学习安全智能体行为
本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。
面向稀疏奖励强化学习的不确定性感知LLM引导策略塑形
提出ULPS,一种将校准的LLM集成到RL训练中的框架,通过不确定性调制的引导和基于A*的符号轨迹,在MiniGrid-UnlockPickup上实现了更高的成功率和样本效率。