automated-reward-design

标签

Cards List
#automated-reward-design

借助大语言模型发现强化学习接口

Hugging Face Daily Papers · 2026-05-05 缓存

本文介绍了 LIMEN,这是一个由大语言模型引导的演化框架,能够通过联合优化原始模拟器状态的观测映射与奖励函数,自动发现强化学习接口。该方法有效降低了人工设计成本,并证明了观测与奖励的协同设计优于单独优化其中任意单一组件。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈