标签
本文提出了一项横断面研究,比较了在混合离散-连续动作空间中三种强化学习算法家族(PPO、SAC、DQN)上的各种动作分解方法(独立网络、共享编码器、VDN、QPLEX、联合、自回归),并引入了两个新的轻量级环境以及变体VDN-PPO和PPO-MIX。
# OpenAI Baselines: DQN 来源: [https://openai.com/index/openai-baselines-dqn/](https://openai.com/index/openai-baselines-dqn/) 在将屏幕图像转换为灰度图时,我们对绿色通道的系数标定错误,导致鱼消失了。发现这个bug后,我们调整了色值,算法才能再次识别到鱼。为了在未来调试类似问题,Gym现在包含一个[play\(在新窗口中打开\)](https://gith