标签
本文提出了一种使用内在好奇心进行内生探索的强化学习框架,适用于非平稳环境,在如LunarLander-v2和BipedalWalker-v3等基准测试上,与PPO和ICM等算法相比,达到了具有竞争力的性能。