标签
本文研究了添加正确标注数据可能损害模型性能的场景,引入了插入稳定性概念,并探讨了维度理论在机器学习泛化中的局限性。
本文回答了Hanneke、Moran和Waknine提出的一个开放问题,证明了直接和的不可知PAC学习曲线并非仅由单实例学习曲线和因子数量决定,从而提供了一种速率分离。
本文研究了在生成模型下有限折扣MDP中的风险敏感强化学习,重点是在优化确定性等价(OCE)风险度量下学习最优值函数和策略的样本复杂度。文章给出了PAC可学习性的精确条件,分析了一种基于模型的方法,并建立了紧的下界,包括对CVaR风险参数的改进依赖关系。