sample-complexity

标签

Cards List
#sample-complexity

熵正则化演员-评论家方法的精细分析

arXiv cs.LG · 2026-05-26 缓存

本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。

0 人收藏 0 人点赞
#sample-complexity

带赌博机反馈的强化学习中良好策略的纯探索

arXiv cs.LG · 2026-05-25 缓存

本文介绍了强化学习中的良好策略识别(GPI),旨在找到满足奖励阈值而非最优策略的策略,并提出了具有近乎最优样本复杂度保证的BEE-GPI算法.

0 人收藏 0 人点赞
#sample-complexity

关于折扣强化学习中优化确定性等价的样本复杂度

arXiv cs.LG · 2026-05-22 缓存

本文研究了在生成模型下有限折扣MDP中的风险敏感强化学习,重点是在优化确定性等价(OCE)风险度量下学习最优值函数和策略的样本复杂度。文章给出了PAC可学习性的精确条件,分析了一种基于模型的方法,并建立了紧的下界,包括对CVaR风险参数的改进依赖关系。

0 人收藏 0 人点赞
#sample-complexity

分数匹配学习的有限样本界

arXiv cs.LG · 2026-05-15 缓存

本文首次为使用分数匹配学习多项式指数族提供了非渐近样本复杂度界,显示出对模型维度的多项式依赖。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈