actor-critic

标签

Cards List
#actor-critic

流经状态:用于强化学习的神经ODE正则化

arXiv cs.LG · 5天前 缓存

本文提出了一种基于神经ODE的正则化方法,该方法强制强化学习智能体中的潜在嵌入遵循一致的ODE流,使表示学习与环境动态对齐,并在Atari和网格世界基准上取得了性能提升。

0 人收藏 0 人点赞
#actor-critic

使用悲观评论家的协作加权方法缓解离策略强化学习中的过估计

arXiv cs.LG · 2026-07-30 缓存

提出了一种协作加权演员-评论家(CWAC)框架,该框架使用分布式评论家和协作加权机制来缓解离策略强化学习中的过估计偏差。

0 人收藏 0 人点赞
#actor-critic

解构Actor-Critic:面向实践者的设计组件大规模实证研究

arXiv cs.LG · 2026-07-16 缓存

本文分析了超过33,000次关于Actor-Critic算法设计组件的实验,发现诸如高斯动作分布等常见默认配置并不可靠,而具有自适应更新计划的有界分布则表现出鲁棒性,为实践者提供了实用指导。

0 人收藏 0 人点赞
#actor-critic

演员-评论家强化学习中评论家复杂性的评估、度量与控制

arXiv cs.LG · 2026-07-02 缓存

本文引入频谱有效秩熵作为度量指标,用于在演员-评论家强化学习中测量和控制评论家复杂性,并在TD3和PPO实验中证明了其可测量性和可控性。

0 人收藏 0 人点赞
#actor-critic

EVOM: 智能体元进化中的Actor-Critic架构强化学习方法

arXiv cs.LG · 2026-06-26 缓存

介绍了EVOM,一种基于LLM的设计智能体的智能体元进化框架,用于自动发现高性能的Actor-Critic架构,在连续控制任务上优于手动基线方法和先前方法。

0 人收藏 0 人点赞
#actor-critic

轨迹级监督何时允许高效离线强化学习?

Hugging Face Daily Papers · 2026-06-16 缓存

本文为基于轨迹级结果监督的离线强化学习建立了统计理论,提出了OPAC算法,并刻画了在此类监督下何时能够实现高效学习,以及何时存在根本性障碍。

0 人收藏 0 人点赞
#actor-critic

从离散到连续:连续环境中神经强化学习的动力学

arXiv cs.LG · 2026-06-04 缓存

本文提出了一个用于连续环境中深度强化学习的理论框架,利用随机控制理论将其建模为连续时间随机过程。作者刻画了在两层网络无限宽极限下的演员-评论家算法的动力学,并推导了一个在极小的学习率下状态分布无穷小变化的方程。

0 人收藏 0 人点赞
#actor-critic

熵正则化演员-评论家方法的精细分析

arXiv cs.LG · 2026-05-26 缓存

本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。

0 人收藏 0 人点赞
#actor-critic

表征优先于路由:克服多时间尺度PPO中的代理劫持

Hugging Face Daily Papers · 2026-05-21 缓存

本文指出了代理劫持和时间不确定性是多时间尺度强化学习中的失败模式,并提出了一种目标解耦架构,该架构从Actor中移除路由,利用Critic进行辅助表征学习。该方法消除了LunarLander-v2基准上的策略崩溃,并稳定地超越了'环境已解决'阈值,而无需超参数劫持。

0 人收藏 0 人点赞
#actor-critic

ACSAC:基于因果 Transformer Q 网络的自适应 Chunk Size Actor-Critic 方法

arXiv cs.LG · 2026-05-13 缓存

本文介绍了 ACSAC,一种强化学习方法,它使用带有因果 Transformer Q 网络的自适应 Chunk Size Actor-Critic 算法来处理长期限、稀疏奖励任务。通过根据状态需求动态调整动作 Chunk Size,该方法在操控任务中展示了最先进的性能。

0 人收藏 0 人点赞
#actor-critic

批判性反馈在何时能提升人工智能辅助的理论物理研究?SCALAR:用于智能体推理的结构化批评者-执行者循环

arXiv cs.AI · 2026-05-11 缓存

本文引入了 SCALAR 框架,这是一个结构化的批评者-执行者循环框架,旨在评估人工智能智能体之间不同的交互模式如何提升理论物理问题的推理能力。

0 人收藏 0 人点赞
#actor-critic

用于基于图像的机器人学习的非对称演员-评论家方法

OpenAI Blog · 2017-10-18 缓存

OpenAI 提出了一种用于机器人学习的非对称演员-评论家方法,该方法利用模拟器中的完全状态可观性来训练在部分观察(RGBD 图像)上运行的策略,无需真实世界的训练数据即可实现有效的仿真到现实的转移。

0 人收藏 0 人点赞
#actor-critic

OpenAI Baselines: ACKTR & A2C

OpenAI Blog · 2017-08-18 缓存

OpenAI 发布 ACKTR 和 A2C 算法作为其 Baselines 库的一部分,其中 ACKTR 通过自然梯度下降展示了改进的样本复杂度,同时保持了与一阶方法相当的计算效率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈