robust-mdp

标签

Cards List
#robust-mdp

Multichain鲁棒平均奖励Markov决策过程的向量Bellman理论

arXiv cs.LG ↗ · 5天前 缓存

本文介绍了用于鲁棒平均奖励Markov决策过程的向量Bellman理论,通过有限模型可解性和近似移位的Halpern规划算法,实现了在转移不确定性下的最优性能。

0 人收藏 0 人点赞
#robust-mdp

隐藏拜占庭攻击下的多智能体系统在线安全学习

arXiv cs.LG ↗ · 2026-08-10 缓存

本文研究隐藏拜占庭攻击下多智能体系统的在线协同控制,建立了信息论极限,并提出了一种具有可证明遗憾界的稳健估计到决策学习器。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈