offline-rl

标签

Cards List
#offline-rl

真实世界强化学习中的离线超参数选择动力学模型

arXiv cs.LG · 2026-08-13 缓存

本文首次将校准模型应用于真实工业场景中的离线超参数选择,以市政水处理厂为例,展示了这些模型能够生成逼真的轨迹并恢复超参数敏感性趋势。

0 人收藏 0 人点赞
#offline-rl

凸包邻域平滑对偶泛化:控制离线强化学习中的局部修正传播

arXiv cs.LG · 2026-08-05 缓存

本文提出CSDG,一种离线强化学习方法,将Bellman备份表示为样本内目标加上凸包邻域局部修正,从而控制OOD动作估计误差并提高价值稳定性。

0 人收藏 0 人点赞
#offline-rl

@svlevine:在经历了一点音视频故障后,现在开始!ASEM Ballroom 203,不见不散 :) 演讲内容将涵盖如何构建……

X AI KOLs Following · 2026-07-10 缓存

Sergey Levine 宣布将在 ICML 2026 离线数据集决策研讨会发表演讲,内容涵盖从基于模型的优化到离线强化学习的数据驱动决策基础。

0 人收藏 0 人点赞
#offline-rl

NFTR:从可证明的模式平均到离线目标条件强化学习中的测地线子目标选择

arXiv cs.LG · 2026-07-10 缓存

本文提出NFTR,一种用于离线目标条件强化学习的方法,该方法使用归一化流作为子目标策略,并采用三角松弛重新加权以解决层次隐式Q学习中的乐观偏差和模式坍缩问题。

0 人收藏 0 人点赞
#offline-rl

使用离线强化学习控制LLM Agent执行框架

arXiv cs.LG · 2026-07-08 缓存

本文通过一个使用离线强化学习训练的Harness MDP,将LLM Agent周围的执行框架形式化为一个可学习的控制层,展示了在多个领域中的验证行为和最终质量的改进。

0 人收藏 0 人点赞
#offline-rl

AETDICE:用于非线性多目标强化学习的统一框架与离线优化

arXiv cs.LG · 2026-07-01 缓存

AETDICE 提出了一种用于离线场景下非线性多目标强化学习的统一框架,通过密度比估计桥接了 SER 和 ESR 两种范式。

0 人收藏 0 人点赞
#offline-rl

RS-Diffuser: 风险敏感的扩散规划与分布值引导

arXiv cs.LG · 2026-06-29 缓存

RS-Diffuser 提出了一种风险敏感的离线扩散规划框架,结合扩散轨迹生成和分布值批评器,通过尾部感知目标在推理时灵活调整风险偏好,在安全关键任务中提升了回报和鲁棒性。

0 人收藏 0 人点赞
#offline-rl

面向可扩展多任务强化学习的大决策模型

arXiv cs.LG · 2026-06-25 缓存

本文介绍了LDM-v0,一个在来自数千个多样强化学习环境的轨迹上离线训练的大决策模型,证明了单一的Transformer策略可以在机器人、自动驾驶、库存管理、网络安全、交易和视频游戏等领域匹配特定任务策略的性能。

0 人收藏 0 人点赞
#offline-rl

离线推理训练中的权重空间几何

arXiv cs.LG · 2026-06-24 缓存

本文研究了不同的离线强化学习损失函数(RFT、RIFT、DFT、Offline GRPO、DPO)在推理蒸馏中是否会在小型语言模型中产生机制上不同的权重更新。使用相同的数学展开和受控设置(Qwen3-4B 和仅注意力的 LoRA),他们发现 SFT、RFT 和 RIFT 的权重增量几乎共线,而 DPO 位于一个近乎正交的子空间中,并取得了最高的准确率。

0 人收藏 0 人点赞
#offline-rl

@svlevine: 一种使用扩散进行离策略强化学习的新方法:如果我们有离策略数据,我们需要找出扩散后期…

X AI KOLs Following · 2026-06-18 缓存

一种新的离策略强化学习方法,使用扩散模型,通过反转扩散过程来处理离策略数据。

0 人收藏 0 人点赞
#offline-rl

@seohong_park: RQL 是一种新的、简洁的(离线)流强化学习算法!其主要思想是将流步骤视为MDP步骤,并使用“反向”流来生成后见之明的轨迹…

X AI KOLs Following · 2026-06-17 缓存

RQL是一种用于离线流强化学习的新算法,它将流步骤视为MDP步骤,并使用反向流来生成后见之明轨迹。

0 人收藏 0 人点赞
#offline-rl

@aditya_oberai: 如果我们把流程步骤视为 RL 动作?结合我们的“流反转”技术,这产生了一个非常简洁且……

X AI KOLs Timeline · 2026-06-17 缓存

提出将流程步骤视为 RL 动作,并结合“流反转”技术用于流程离线强化学习。

0 人收藏 0 人点赞
#offline-rl

Reversal Q-Learning

arXiv cs.LG · 2026-06-17 缓存

本文提出了Reversal Q-Learning(RQL),一种离线强化学习算法,它利用扩展马尔可夫决策过程框架和技术训练流策略,无需随时间反向传播即可实现离策略强化学习。该算法在具有挑战性的模拟机器人任务上达到了最先进的性能。

0 人收藏 0 人点赞
#offline-rl

轨迹级监督何时允许高效离线强化学习?

Hugging Face Daily Papers · 2026-06-16 缓存

本文为基于轨迹级结果监督的离线强化学习建立了统计理论,提出了OPAC算法,并刻画了在此类监督下何时能够实现高效学习,以及何时存在根本性障碍。

0 人收藏 0 人点赞
#offline-rl

在自回归强化学习策略中注入LTLf约束的神经符号方法

arXiv cs.AI · 2026-06-09 缓存

提出一种神经符号框架,通过可微自动机表示和基于逻辑的损失函数,将LTLf约束注入基于Transformer的强化学习策略中,在保持竞争性回报的同时提高约束满足度。

0 人收藏 0 人点赞
#offline-rl

UNIQ:面向离线强化学习的共形校准自适应保守性方法

arXiv cs.LG · 2026-06-09 缓存

UNIQ引入了一种用于离线强化学习的共形校准方法,该方法基于不确定性对每个状态自适应调整保守性,在部分D4RL基准测试上优于IQL,同时保持内存效率。

0 人收藏 0 人点赞
#offline-rl

Dual Advantage Fields

arXiv cs.LG · 2026-06-04 缓存

Dual Advantage Fields (DAF) 是一种用于离线目标条件强化学习的策略提取方法,它将双线性对偶价值模型转化为局部优势信号,通过学习预测特征位移的动作效应模型,并根据位移与目标方向的对齐程度对动作进行评分。该方法被 ICML 2026 决策研讨会接收,在 OGBench 的移动、操控和谜题任务中展示了改进的性能。

0 人收藏 0 人点赞
#offline-rl

基于强化学习的经验驱动式LLM动态退出策略

arXiv cs.CL · 2026-06-03 缓存

介绍了LEDE,一个利用离线强化学习动态选择退出层和推测长度的框架,用于LLM的自推测解码,相较于自回归解码实现了高达2.7倍的加速。

0 人收藏 0 人点赞
#offline-rl

矩匹配Q学习

arXiv cs.LG · 2026-05-29 缓存

矩匹配Q学习(MoMa QL)利用最大均值差异来匹配所有阶矩统计量,实现离线强化学习中的分布级收敛,在D4RL任务上兼具计算效率和强劲性能。

0 人收藏 0 人点赞
#offline-rl

Return-to-Go 不仅仅是数字:用于返回条件监督学习的 Q 引导对齐

arXiv cs.LG · 2026-05-29 缓存

本文提出了 Q-align DT 框架,该框架将 return-to-go 与 Q 值对齐,以提高离线强化学习中的可控性和性能,在 D4RL 基准上取得了优异的结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈