标签
提出一个GRPO训练动力学的闭式降阶模型,将其简化为阻尼振荡器,并推导出关于稳定性、组大小不变性和损失曲率的预测。在多个模型和基准上进行了验证。
本文提出了信念空间动力学中可容许学习率步长的闭式上界,为机器人或控制领域的优化提供了理论结果。