标签
本综述探讨了非平稳环境下的上下文强化学习(ICRL),其中预训练决策模型通过累积的上下文进行适应,无需参数更新。它围绕变化的内容、变化的方式以及变化的可观测性来组织文献,并指出了诸如陈旧上下文压力测试和自适应遗忘等研究空白。