标签
本文证明,在海森兼容性条件下,在线梯度下降方法能够针对隐凸损失实现最优的√T遗憾值,解决了对抗性在线学习中的开放问题。同时,还将结果扩展至单点赌博机反馈,给出了T^{3/4}的期望遗憾界。
本文介绍了强化学习中的良好策略识别(GPI),旨在找到满足奖励阈值而非最优策略的策略,并提出了具有近乎最优样本复杂度保证的BEE-GPI算法.