deep-rl

标签

Cards List
#deep-rl

重新审视Q-learning的过估计偏差问题:通过动作交集解决大规模离散动作空间

arXiv cs.LG ↗ · 2026-08-14 缓存

本文重新审视了大规模离散动作空间下Q-learning中的过估计偏差问题,提出了一种动作交集策略,该策略能够在两个Q函数之间实现半解耦,从而平衡过估计与欠估计。在表格方法和深度强化学习设置中的实验表明,该方法在多个基线上均取得了改进的性能。

0 人收藏 0 人点赞
#deep-rl

Big 2中不完美信息下的自我对弈强化学习

arXiv cs.LG ↗ · 2026-05-29 缓存

本文提出了一个针对四人制不完美信息纸牌游戏Big 2的自我对弈强化学习框架,比较了策略梯度和基于价值的方法,并发现带有熵正则化的PPO优于其他方法。

0 人收藏 0 人点赞
#deep-rl

近似下一策略采样:在深度强化学习中替代保守目标策略更新

arXiv cs.LG ↗ · 2026-05-08 缓存

本文引入了近似下一策略采样(ANPS)作为深度强化学习中保守策略更新的替代方案。它提出了稳定值近似策略迭代(SV-API)和 SV-RL,通过将训练数据与下一策略的状态分布对齐,从而实现更大且更安全的策略更新。

0 人收藏 0 人点赞
#deep-rl

什么是 MDP?我们该如何求解?

ML at Berkeley ↗ · 2021-02-23 缓存

本文通过一个关于大学生日常决策的教学示例,解释了马尔可夫决策过程(MDP)的基础知识,这是深度强化学习中的核心框架。

0 人收藏 0 人点赞
#deep-rl

OpenAI Five击败Dota 2世界冠军

OpenAI Blog ↗ · 2019-04-15 缓存

OpenAI Five成为首个击败世界冠军电竞职业选手的AI,在OpenAI Five总决赛中连胜OG两局。这一突破是通过前所未有的训练计算规模扩展实现的,而非新型算法,团队计划停用OpenAI Five同时宣布将其部署用于公开网络对战。

0 人收藏 0 人点赞
#deep-rl

使用动作相关分解基线的策略梯度方差缩减

OpenAI Blog ↗ · 2018-03-20 缓存

# 使用动作相关分解基线的策略梯度方差缩减 来源: [https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/](https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/) OpenAI## 摘要 策略梯度方法在深度强化学习中取得了巨大成功,但梯度估计的方差很高。高方差问题特别

0 人收藏 0 人点赞
#deep-rl

学习建模他人思维

OpenAI Blog ↗ · 2017-09-14 缓存

OpenAI 和牛津大学研究人员提出了 LOLA(Learning with Opponent-Learning Awareness),这是一种强化学习方法,使智能体能够建模并考虑其他智能体的学习,在迭代囚徒困境和硬币游戏等多智能体博弈中发现合作策略。

0 人收藏 0 人点赞
#deep-rl

通过Q集合进行UCB探索

OpenAI Blog ↗ · 2017-06-05 缓存

OpenAI提出了一种针对深度强化学习的新型探索策略,使用具有上置信界(UCB)的Q函数集合,在Atari基准上展现了显著的性能提升。

0 人收藏 0 人点赞
#deep-rl

用于分层强化学习的随机神经网络

OpenAI Blog ↗ · 2017-04-10 缓存

OpenAI 研究人员提出了一个使用随机神经网络进行分层强化学习的框架,该框架通过代理奖励引导预训练有用的技能,然后利用这些技能在稀疏奖励或长期视界的下游任务中加速学习。

0 人收藏 0 人点赞
#deep-rl

#探索:深度强化学习中基于计数的探索方法研究

OpenAI Blog ↗ · 2016-11-15 缓存

OpenAI研究人员展示了一种使用哈希码的简单计数型探索方法,在高维深度强化学习基准测试中可以达到近似最优性能,这挑战了计数型方法无法扩展到连续状态空间的传统假设。

0 人收藏 0 人点赞
#deep-rl

RL²:通过缓慢强化学习实现快速强化学习

OpenAI Blog ↗ · 2016-11-09 缓存

RL²将快速强化学习算法编码为循环神经网络的权重,通过缓慢的通用强化学习来学习,使智能体能够像生物学习一样通过少量试验快速适应新任务。该方法在小规模老虎机问题和大规模基于视觉的导航任务上都展现了强大性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈