structured-reward

标签

Cards List
#structured-reward

StructRL: 长周期视觉-语言-动作任务的在线结构化强化学习

Hugging Face Daily Papers ↗ · 2026-09-28 缓存

StructRL 引入了一个在线强化学习框架,该框架使用来自可验证子任务的结构化中间奖励,以增强长周期视觉-语言-动作任务,在 RoboCasa365 和 LIBERO-Long 等基准测试中展示了卓越性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈