simulator-learning

标签

Cards List
#simulator-learning

策略感知模拟器学习的理论基础与高效算法

arXiv cs.LG · 2026-05-29 缓存

本文提出了一种用于基于模型的强化学习中模拟器学习的策略鲁棒性目标,将其建模为模型玩家与对抗性策略玩家之间的极小极大博弈。提供了理论保证和可证明收敛的算法,实验表明预测误差在关键区域降低1.5-2.2倍,并提升了策略从模拟到真实世界的迁移效果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈