标签
本文提出一种新颖的基于模型的强化学习算法,该算法利用贝叶斯方法和线性时序逻辑规范,在未知环境中实现高效的策略合成,与传统方法相比,显示出更高的样本效率和安全性。
本文提出了一种新颖框架,通过整合采样、自动机学习和模型检测,为部分可观察马尔可夫决策过程(POMDPs)合成有限状态控制器。该方法为现有形式化合成工具难以解决的阈值安全问题提供了形式化保证。