标签
本文开发了用于连续时间跳跃马尔可夫决策过程强化学习的无模型Q学习算法,并应用于网络动态定价,展示了优于基准方法的性能。
本文介绍了QWM,一个将世界模型与Q学习相结合的框架,通过使用想象轨迹进行动作选择来增强强化学习中的样本效率,而不影响在真实数据上的训练。在操作基准测试上,它展示了相比最先进方法的显著改进。
本文重新审视了大规模离散动作空间下Q-learning中的过估计偏差问题,提出了一种动作交集策略,该策略能够在两个Q函数之间实现半解耦,从而平衡过估计与欠估计。在表格方法和深度强化学习设置中的实验表明,该方法在多个基线上均取得了改进的性能。
This paper studies decentralized multi-player Q-learning in episodic Markov decision processes under three forms of information asymmetry, proposing algorithms that achieve regret bounds matching the single-agent Q-learning rate up to logarithmic factors.
本文提出了RL2C,一种基于Q-learning的算法,用于优化光学薄膜的激光切割参数(焦距、激光功率),以减少锥度尺寸和材料浪费。实验表明,与现有强化学习方法相比,其优化步骤最多减少12.5%,处理时间最多减少81.8%。
This paper proposes an adaptive training controller for CVaR risk-aware Q-learning, improving finite-budget behavior, reducing Bellman residuals by ~85%, and yielding better risk-adjusted performance in daily Bitcoin trading.
本文提出SADQ,一种对Q学习的改进,利用动力学模型的一步轨迹预测来正则化TD目标聚合,减少自举引起的过估计,并在多个基准上提高训练稳定性。
介绍了门控Q学习(Gated Q-learning),一种新的Q(λ)框架,能够在Watkins和Peng的Q学习之间平滑插值,以权衡离策略偏差和多步信用分配。提供了理论保证以及在随机游走环境中的实证验证。
介绍了一种名为VRDQ的分布式Q学习算法,用于在静态和时变网络上进行多智能体强化学习,该算法具有有限时间收敛保证,在样本复杂度上实现线性加速,且仅需Õ(1)次通信。
本文介绍了DiPS,一个Q学习框架,它能够动态选择适用于高风险场景(如野火疏散)的说服策略,相比零样本LLM和RAG基线方法,实现了更高的成功率。
本文提出了一种量子退火增强的Q-learning框架,用于剩余使用寿命预测,利用D-Wave系统求解QUBO公式以进行动作选择。在NASA C-MAPSS和预测维护数据集上,它优于经典和量子基线。
本文提出了Reversal Q-Learning(RQL),一种离线强化学习算法,它利用扩展马尔可夫决策过程框架和技术训练流策略,无需随时间反向传播即可实现离策略强化学习。该算法在具有挑战性的模拟机器人任务上达到了最先进的性能。
矩匹配Q学习(MoMa QL)利用最大均值差异来匹配所有阶矩统计量,实现离线强化学习中的分布级收敛,在D4RL任务上兼具计算效率和强劲性能。
本文提出FedQHD,一种新颖的联邦Q学习方法,使用超维随机特征状态编码器和线性读出器实现闭式函数空间聚合,解决了异构客户端编码器导致的联邦差距。
本文针对恒定步长Q学习,开发了一种符号分离的有限时间误差分析,将误差分解为负部和正部,并提供了揭示与过估计相关的不对称性的界。
本文提出了一种针对使用线性函数逼近的Q学习的切换系统理论,利用联合谱半径分析了在确定性、独立同分布(i.i.d.)及马尔可夫观测下的收敛稳定性。
该论文介绍了 MemQ,这是一种通过将 Q 学习整合到自演化记忆智能体中来解决情节记忆检索中的信用分配问题的方法,具体做法是利用基于来源有向无环图的资格迹。
本文介绍了 DR.Q 算法,该算法通过最大化互信息并采用淡出优先经验回放,改善了 Q-learning 的模型化表示,从而减少了连续控制任务中的偏差和过拟合。
OpenAI提出了一种针对深度强化学习的新型探索策略,使用具有上置信界(UCB)的Q函数集合,在Atari基准上展现了显著的性能提升。
# 策略梯度与软Q学习之间的等价性 来源:[https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/](https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/) OpenAI ## 摘要 策略梯度方法和Q学习方法是无模型强化学习中两种主要方法。Q学习方法在有效时样本效率很高,但目前还不太清楚它们为什么能够工作