标签
Introduces CODS, an iterative critic-guided data selection method for offline reinforcement learning that retains task performance at low data budgets by selecting high-residual transitions over multiple rounds.
本文介绍了一种名为Inverter的神经启发式框架,该框架利用逆学习(Inverse Learning, IL)实现快速高效的规划与控制,在D4RL基准测试和量子门合成上取得了显著改进,推理计算量降低了数个数量级。