标签
本文为无调度梯度下降和无调度随机梯度下降在非凸优化中提供了最坏情况收敛性分析,建立了最优速率和严格鞍点规避,从而从理论上证明了其实验成功。
本文研究了平均奖励弱耦合MDP和休止臂赌博机学习中的样本复杂度,利用一种新颖的基于Lyapunov的分析框架,确立了具有多项式复杂度的有限样本PAC保证。