greedy-sampling

标签

Cards List
#greedy-sampling

贪婪采样探索时:无eluder维度依赖的KL正则化上下文强盗

arXiv cs.LG · 昨天 缓存

本文研究了KL正则化的上下文强盗问题,并表明贪婪采样能够在奖励和偏好反馈下实现对数遗憾,而无需显式依赖于eluder维度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈