flow-policies

标签

Cards List
#flow-policies

πR^2:反应式实时流策略

Hugging Face Daily Papers · 2026-07-28 缓存

πR^2 提出了一种面向机器人操作的反应式实时流策略,将条件输入分为快速通道和慢速通道,并采用延迟自适应流调度,使得闭环重规划速度比基线策略快约4倍,成功率最高提升30%。

0 人收藏 0 人点赞
#flow-policies

信任区域Q伴随匹配

Hugging Face Daily Papers · 2026-05-26 缓存

信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈