policy-synthesis

标签

Cards List
#policy-synthesis

基于时间逻辑规范的高效贝叶斯自适应强化学习

arXiv cs.LG · 19小时前 缓存

本文提出一种新颖的基于模型的强化学习算法,该算法利用贝叶斯方法和线性时序逻辑规范,在未知环境中实现高效的策略合成,与传统方法相比,显示出更高的样本效率和安全性。

0 人收藏 0 人点赞
#policy-synthesis

POMDP策略合成:通过学习融合采样与模型检测

arXiv cs.AI · 2026-05-15 缓存

本文提出了一种新颖框架,通过整合采样、自动机学习和模型检测,为部分可观察马尔可夫决策过程(POMDPs)合成有限状态控制器。该方法为现有形式化合成工具难以解决的阈值安全问题提供了形式化保证。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈