标签
StructRL 引入了一个在线强化学习框架,该框架使用来自可验证子任务的结构化中间奖励,以增强长周期视觉-语言-动作任务,在 RoboCasa365 和 LIBERO-Long 等基准测试中展示了卓越性能。