重新审视Q-learning的过估计偏差问题:通过动作交集解决大规模离散动作空间
摘要
本文重新审视了大规模离散动作空间下Q-learning中的过估计偏差问题,提出了一种动作交集策略,该策略能够在两个Q函数之间实现半解耦,从而平衡过估计与欠估计。在表格方法和深度强化学习设置中的实验表明,该方法在多个基线上均取得了改进的性能。
arXiv:2608.12912v1 公告类型:新
摘要:本文考虑了大动作空间设置下Q-learning的过估计偏差问题,旨在缓解现有方法的瓶颈。我们发现,大的动作空间增加了Q值估计的随机性。这种随机性使得主导过估计问题主要文献的两种范式各有其瓶颈:耦合范式,即最优动作及其Q值使用同一个Q函数进行估计,总是具有正偏差。这是因为随机性导致某些动作的估计值异常高于其真实值,而耦合方法偏好这些动作。解耦范式,即最优动作及其Q值使用两个独立的Q函数进行估计,总是具有负偏差。这是因为随机性增加了同一动作的两个独立Q表之间的估计差距。本文表明,动作交集可以是一种简单而强大的策略来缓解这些瓶颈。动作交集策略通过两种设计实现半解耦:(1)它允许两个Q函数共享一定比例的轨迹数据;(2)如果数据样本被共享,则每个Q函数使用耦合范式更新;否则,使用解耦范式更新。两个性质使得动作交集策略强大:(1)获得较大的偏差范围,即通过改变数据共享比例,估计偏差从欠估计变化到过估计;(2)粒度精细:动作交集的大小可以任意细化,以实现更精细的控制。我们考虑了两种实验设置,即表格方法和深度强化学习,深度强化学习实验表明,我们的方法大幅优于多个SOTA基线;表格实验则揭示了我们的方法为何能取得优越性能。
查看缓存全文
缓存时间: 2026/08/14 09:32
# 重访Q-learning的过估计偏差问题:通过动作交集解决大规模离散动作空间 来源:https://arxiv.org/html/2608.12912 Pu Li(重庆绿色智能技术研究院,重庆,中国),Tao Tan,Hong Xie,Xiaoyu Shi,Mingsheng Shang ###### 摘要 本文考虑在大型动作空间场景下Q-learning的过估计偏差问题,以缓解现有方法的瓶颈。我们发现,大型动作空间增加了Q值估计的随机性。这种随机性使得驱动过估计问题主要文献的两种范式各自存在瓶颈:耦合范式(即使用同一个Q函数估计最优动作及其Q值)总是存在正偏差。这是因为随机性导致某些动作的估计值异常高于其真实值,而耦合方法偏好这些动作。解耦范式(即使用两个独立的Q函数估计最优动作及其Q值)总是存在负偏差。这是因为随机性增加了两个独立Q表对同一动作的估计差距。本文表明,动作交集可以成为一种简单而强大的策略来缓解这些瓶颈。动作交集策略通过两种设计实现半解耦:(1)它允许两个Q函数共享一定比例的轨迹数据;(2)如果某个数据样本被共享,则每个Q函数使用耦合范式更新;否则,使用解耦范式更新。动作交集策略之所以强大,有两个特性:(1)获得较大的偏差范围,即通过改变数据共享比例,估计偏差从低估连续变化到高估;(2)细粒度:动作交集大小可以任意细化,以实现更精细的控制。我们考虑了两种实验设置,即表格型和深度RL,深度RL实验表明我们的方法显著优于若干SOTA基线;表格实验揭示了我们的方法为何能够取得优越性能。我们相信我们的工作为缓解Q-learning的过估计偏差打开了新的大门。 ###### 关键词 耦合范式,解耦范式,半解耦范式,动作交集 ## 1 引言 Q-learning [29](https://arxiv.org/html/2608.12912#bib.bib6) 是最广泛采用和研究的强化学习(RL)算法之一 [5](https://arxiv.org/html/2608.12912#bib.bib22) [32](https://arxiv.org/html/2608.12912#bib.bib24) [35](https://arxiv.org/html/2608.12912#bib.bib23)。然而,Q-learning 存在过估计偏差 [25](https://arxiv.org/html/2608.12912#bib.bib25) [8](https://arxiv.org/html/2608.12912#bib.bib4)。先前的工作表明,在Q-learning中,函数逼近器会在输出预测中引入噪声
相似文章
重新审视复杂动作空间中的动作分解
本文提出了一项横断面研究,比较了在混合离散-连续动作空间中三种强化学习算法家族(PPO、SAC、DQN)上的各种动作分解方法(独立网络、共享编码器、VDN、QPLEX、联合、自回归),并引入了两个新的轻量级环境以及变体VDN-PPO和PPO-MIX。
用于样本高效连续控制的无偏模型化表示
本文介绍了 DR.Q 算法,该算法通过最大化互信息并采用淡出优先经验回放,改善了 Q-learning 的模型化表示,从而减少了连续控制任务中的偏差和过拟合。
通过Q集合进行UCB探索
OpenAI提出了一种针对深度强化学习的新型探索策略,使用具有上置信界(UCB)的Q函数集合,在Atari基准上展现了显著的性能提升。
重访不确定性下Q学习中的TD目标聚合
本文提出SADQ,一种对Q学习的改进,利用动力学模型的一步轨迹预测来正则化TD目标聚合,减少自举引起的过估计,并在多个基准上提高训练稳定性。
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。