标签
本文为异步点对点gossip学习网络中的知识蒸馏提供收敛理论,证明其能收缩函数不一致性,并分析理论收敛速率。
本文提出了一种用于部分可观察不休止赌博机中Whittle指数的t步前瞻阈值策略,证明了向精确指数的几何收敛并提高了数值精度。
本文提出了 LMO-IGT,这是一类新的随机优化方法,它利用隐式梯度传输来加速收敛,同时保持每次迭代仅计算一次梯度的结构。文中引入了一个统一的理论框架,并展示了相较于 Muon 等现有基于 LMO 的优化器,该方法具有更优的性能。