offline-rl

标签

Cards List
#offline-rl

通过扩散策略优化扩展世界模型强化学习

arXiv cs.LG · 2026-05-27 缓存

提出模型基扩散策略优化(MBDPO)框架,该框架通过扩散策略表示统一了世界模型中的搜索与策略优化,在离线与在线强化学习任务中实现一致的扩展行为和卓越性能。

0 人收藏 0 人点赞
#offline-rl

利用局部动态规律实现离线分层强化学习中的可复用技能

arXiv cs.AI · 2026-05-27 缓存

本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。

0 人收藏 0 人点赞
#offline-rl

生成式OOD正则化的基于模型的策略优化

arXiv cs.LG · 2026-05-26 缓存

介绍 GORMPO,一种密度正则化的离线强化学习算法,使用生成式密度建模将策略更新限制在高密度区域,在真实世界医疗数据集上实现17%的提升,并超越最先进的基线模型。

0 人收藏 0 人点赞
#offline-rl

ACSAC:基于因果 Transformer Q 网络的自适应 Chunk Size Actor-Critic 方法

arXiv cs.LG · 2026-05-13 缓存

本文介绍了 ACSAC,一种强化学习方法,它使用带有因果 Transformer Q 网络的自适应 Chunk Size Actor-Critic 算法来处理长期限、稀疏奖励任务。通过根据状态需求动态调整动作 Chunk Size,该方法在操控任务中展示了最先进的性能。

0 人收藏 0 人点赞
#offline-rl

用于分布强化学习的路径耦合贝尔曼流

arXiv cs.LG · 2026-05-12 缓存

本文介绍了路径耦合贝尔曼流(PCBF),这是一种连续时间的分布强化学习方法,它使用流匹配来建模回报分布,而无需启发式投影。它通过将当前回报流和后续回报流通过共享的基础噪声耦合在一起,解决了以往基于流的方法中存在的边界不匹配和高方差问题。

0 人收藏 0 人点赞
#offline-rl

离线到在线强化学习的自适应 Q 分块

arXiv cs.LG · 2026-05-08 缓存

本文介绍了自适应 Q 分块(AQC),这是一种强化学习方法,能够动态选择动作分块大小,以平衡反应式控制与长期规划。该方法在 OGBench 和 Robomimic 上取得了最先进的结果,提升了大规模 VLA 模型在机器人任务中的性能。

0 人收藏 0 人点赞
#offline-rl

基于价值梯度流的强化学习

Hugging Face Daily Papers · 2026-04-15 缓存

价值梯度流(VGF)提出了一种可扩展的行为正则化强化学习方法,将其构建为通过离散梯度流求解的最优传输问题,在离线强化学习和大型语言模型强化学习基准测试中取得了最先进的成果。该方法消除了显式的策略参数化,同时通过控制传输预算实现了自适应的测试时缩放。

0 人收藏 0 人点赞
#offline-rl

论SFT的泛化:强化学习视角与奖励修正

Papers with Code Trending · 2025-08-07 缓存

本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈