exploration-strategies

标签

Cards List
#exploration-strategies

贪婪采样探索时:无eluder维度依赖的KL正则化上下文强盗

arXiv cs.LG · 昨天 缓存

本文研究了KL正则化的上下文强盗问题,并表明贪婪采样能够在奖励和偏好反馈下实现对数遗憾,而无需显式依赖于eluder维度。

0 人收藏 0 人点赞
#exploration-strategies

Dream-RSI: 通过进化世界的递归自我改进

Hugging Face Daily Papers · 2天前 缓存

Dream-RSI 是一个用于AI代理的可扩展递归自我改进框架,它利用历史发现树创建重放模拟器,用于离线策略评估,减少在线成本并提高发现效率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈