标签
πR^2 提出了一种面向机器人操作的反应式实时流策略,将条件输入分为快速通道和慢速通道,并采用延迟自适应流调度,使得闭环重规划速度比基线策略快约4倍,成功率最高提升30%。
信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。