标签
本文分析了深度强化学习中的评估与设计范式,揭示了性能排名在不同数据范围下并非单调递增,且常见的低数据范围基准可能导致错误结论。
本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。
本文提出了一种基于近端策略优化(PPO)的深度强化学习框架,用于仓库中自主移动机器人的动态电池充电,与基线方法相比,最高可实现6%的订单完成率提升。
本文分析了深度强化学习中的评估与设计范式,展示了经典范式可能导致错误结论,并提供了关于扩展性、容量和复杂性的见解。
本文作为一项进展中研究,提出将可微物理模型嵌入PPO策略损失函数,以惩罚强化学习中预期的安全违规行为,并在模拟的单自由度直升机系统上进行评估。物理信息软正则化在保持可靠目标跟踪的同时,显著减少了约束违反。
本文介绍了PASE,一个神经符号框架,利用LLM为云系统生成结构化的恢复计划,并通过神经符号世界模型进行验证,可减少超过40%的恢复时间。
一个三阶段深度强化学习系统,用于个性化投资组合管理,解决了股票代码锁定、单一目标和静态用户模型的问题,使用了通过自监督学习预训练的跨资产编码器以及Chronos时间序列基础模型,通过混合专家模型和PPO进行微调,并通过LoRA实现个性化。
本文提出了一种用于主动流动控制的新型离线强化学习框架,采用带有点注意力层的传感器位置条件架构来处理变化的传感器配置,从而无需昂贵的在线交互即可实现数据驱动的策略提取。
介绍了A3M,一个结合自适应深度强化学习、对抗性推理和多目标奖励设计的框架,用于重复拍卖中的战略投标,实现了30-40%的遗憾降低。
本文介绍了CARLOS,一种深度强化学习算法,它利用聚合深度神经网络学习美式期权的连续时间最优停止规则,有效缩小了百慕大与美国期权之间的价值差距,并具有较高的计算效率。
介绍了一种基于Transformer的调度策略,该策略通过强化学习训练,用于开放车间调度问题,展示了在小规模实例上训练的模型能够泛化到更大规模的问题,并与经典调度启发式算法竞争。
本文指出了深度强化学习中传统不确定性估计的局限性,并提出基于百分位数的统计量和可视化方法,以更好地评估运行间性能变异。案例研究展示了该方法在PPO、SAC、TD-MPC、DQN和Rainbow算法上的应用。
本文认为,表示学习(而非基于模型的规划)是可扩展多任务深度强化学习的关键。文章介绍了MR.Q,一种简单的无模型算法,通过辅助预测目标,在多种连续控制任务上优于之前基于世界模型的方法。
提出了一种统一Python框架,采用基于PPO的深度强化学习来优化带经济器逻辑与CO2约束通风的暖通空调控制,展示了比传统PID控制器更优的能效和温度稳定性。
Hugging Face提供了一门含实践练习的深度强化学习课程,目前处于低维护状态,但仍然是学习理论和实践DRL的有用资源。
OpenAI宣布完成其2018年秋季Fellows计划,并对研究员们的研究贡献表示赞赏。该组织还开源了部分教学课程,包括《Spinning up in Deep RL》,这是一份用于学习强化学习的教育资源。
OpenAI 于 2 月 2 日举办了首届「深度强化学习入门」研讨会,约 90 名现场参与者和 300 名直播观众通过讲座、导师指导和实践项目,学习了深度强化学习、机器人技术和 AI 安全方面的知识。
# Spinning Up in Deep RL 来源:[https://openai.com/index/spinning-up-in-deep-rl/](https://openai.com/index/spinning-up-in-deep-rl/) 在 OpenAI,我们相信深度学习——特别是深度强化学习——将在强大 AI 技术的发展中扮演核心角色。虽然有很多资源可以让人们快速入门深度学习,但深度强化学习的学习曲线更陡峭。我们设计了 Spinning Up 来帮助人们