diffusion-policies

标签

Cards List
#diffusion-policies

ReGuide:从测试时引导到自改进扩散策略

arXiv cs.LG · 2026-06-30 缓存

ReGuide 提出了一种面向扩散策略的自改进框架,利用测试时引导生成纠正性轨迹,然后在该数据上微调策略,在 Robomimic 任务上实现了 1.3–7.7 倍的成功率提升。

0 人收藏 0 人点赞
#diffusion-policies

大规模并行在策略强化学习的信任区域扩散策略

arXiv cs.LG · 2026-06-16 缓存

介绍了TruDi,一种通过使用信任区域优化规则来强制KL散度约束,从而在大规模并行在策略强化学习中训练扩散策略的方法,在73个任务中取得了强劲性能。

0 人收藏 0 人点赞
#diffusion-policies

QPILOTS: 面向流策略的高效测试时Q引导

arXiv cs.LG · 2026-06-16 缓存

QPILOTS是一种方法,通过使用从噪声中间状态投影的评论家梯度,在推理时引导流策略,在离线到在线强化学习基准上实现了最先进的性能,并在不修改基础策略的情况下改进了预训练的VLA模型。

0 人收藏 0 人点赞
#diffusion-policies

WarmPrior: 利用时间先验拉直流匹配策略

arXiv cs.LG · 2026-05-15 缓存

介绍了WarmPrior,该方法将流匹配策略中的标准高斯源替换为来自近期动作历史的时间约束先验,通过生成更直的路径概率,持续提升机器人操控任务的成功率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈