标签
本文首次将校准模型应用于真实工业场景中的离线超参数选择,以市政水处理厂为例,展示了这些模型能够生成逼真的轨迹并恢复超参数敏感性趋势。
本文提出CSDG,一种离线强化学习方法,将Bellman备份表示为样本内目标加上凸包邻域局部修正,从而控制OOD动作估计误差并提高价值稳定性。
Sergey Levine 宣布将在 ICML 2026 离线数据集决策研讨会发表演讲,内容涵盖从基于模型的优化到离线强化学习的数据驱动决策基础。
本文提出NFTR,一种用于离线目标条件强化学习的方法,该方法使用归一化流作为子目标策略,并采用三角松弛重新加权以解决层次隐式Q学习中的乐观偏差和模式坍缩问题。
本文通过一个使用离线强化学习训练的Harness MDP,将LLM Agent周围的执行框架形式化为一个可学习的控制层,展示了在多个领域中的验证行为和最终质量的改进。
AETDICE 提出了一种用于离线场景下非线性多目标强化学习的统一框架,通过密度比估计桥接了 SER 和 ESR 两种范式。
RS-Diffuser 提出了一种风险敏感的离线扩散规划框架,结合扩散轨迹生成和分布值批评器,通过尾部感知目标在推理时灵活调整风险偏好,在安全关键任务中提升了回报和鲁棒性。
本文介绍了LDM-v0,一个在来自数千个多样强化学习环境的轨迹上离线训练的大决策模型,证明了单一的Transformer策略可以在机器人、自动驾驶、库存管理、网络安全、交易和视频游戏等领域匹配特定任务策略的性能。
本文研究了不同的离线强化学习损失函数(RFT、RIFT、DFT、Offline GRPO、DPO)在推理蒸馏中是否会在小型语言模型中产生机制上不同的权重更新。使用相同的数学展开和受控设置(Qwen3-4B 和仅注意力的 LoRA),他们发现 SFT、RFT 和 RIFT 的权重增量几乎共线,而 DPO 位于一个近乎正交的子空间中,并取得了最高的准确率。
一种新的离策略强化学习方法,使用扩散模型,通过反转扩散过程来处理离策略数据。
RQL是一种用于离线流强化学习的新算法,它将流步骤视为MDP步骤,并使用反向流来生成后见之明轨迹。
提出将流程步骤视为 RL 动作,并结合“流反转”技术用于流程离线强化学习。
本文提出了Reversal Q-Learning(RQL),一种离线强化学习算法,它利用扩展马尔可夫决策过程框架和技术训练流策略,无需随时间反向传播即可实现离策略强化学习。该算法在具有挑战性的模拟机器人任务上达到了最先进的性能。
本文为基于轨迹级结果监督的离线强化学习建立了统计理论,提出了OPAC算法,并刻画了在此类监督下何时能够实现高效学习,以及何时存在根本性障碍。
提出一种神经符号框架,通过可微自动机表示和基于逻辑的损失函数,将LTLf约束注入基于Transformer的强化学习策略中,在保持竞争性回报的同时提高约束满足度。
UNIQ引入了一种用于离线强化学习的共形校准方法,该方法基于不确定性对每个状态自适应调整保守性,在部分D4RL基准测试上优于IQL,同时保持内存效率。
Dual Advantage Fields (DAF) 是一种用于离线目标条件强化学习的策略提取方法,它将双线性对偶价值模型转化为局部优势信号,通过学习预测特征位移的动作效应模型,并根据位移与目标方向的对齐程度对动作进行评分。该方法被 ICML 2026 决策研讨会接收,在 OGBench 的移动、操控和谜题任务中展示了改进的性能。
介绍了LEDE,一个利用离线强化学习动态选择退出层和推测长度的框架,用于LLM的自推测解码,相较于自回归解码实现了高达2.7倍的加速。
矩匹配Q学习(MoMa QL)利用最大均值差异来匹配所有阶矩统计量,实现离线强化学习中的分布级收敛,在D4RL任务上兼具计算效率和强劲性能。
本文提出了 Q-align DT 框架,该框架将 return-to-go 与 Q 值对齐,以提高离线强化学习中的可控性和性能,在 D4RL 基准上取得了优异的结果。