BitTide
菜单
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
cmdp
标签
Cards
List
#cmdp
CSPO:面向安全强化学习的约束敏感策略优化
arXiv cs.AI
↗
· 2026-06-15
缓存
本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交