标签
本文分析了一种单循环、熵正则化的自然演员-评论家算法,并在随机和确定性环境下,针对线性函数逼近,证明了非正则化目标的加速收敛率。
本文提出了一种基于极化码的跨层联邦学习方案,以解决通信瓶颈和信道损伤问题,提供收敛分析和资源优化,并展示了相对于未编码和LDPC基准的性能提升。
本文提出ZeroLock,一种无反向传播的并发内存高效LLM训练算法,将模型更新解耦为独立的分块更新,与基于BP的基线相比,内存使用减少26.5%,吞吐量提高4.9%。
本文提出了一种并行架构,将静态梯度方法组合起来以实现随机梯度下降的自适应性,在简化收敛性分析的同时保留参数自适应性。
This paper proposes F2CTO, the first distributed first-order constrained trilevel optimization method for robust coreset selection over distributed networks, with a non-asymptotic convergence guarantee of O(ε^(-3/2)).
本文首次为有限时域马尔可夫决策过程中的自然策略梯度算法提供了有限时间收敛保证,证明了在不同步长策略下的次线性和线性收敛速度。
本文提出了一种自适应梯度下降方法,利用单侧赫尔德正则性根据方向曲率而非全梯度变化来控制步长,为非凸目标函数提供了收敛保证,并展示了实证优势。
本文首次对带动量的原始SGD在重尾噪声下(无需梯度裁剪或归一化)进行了全面的收敛性分析,揭示了其收敛速率劣于经过裁剪的变体,并在合成函数上进行了实验验证。
本文提出了STHTD-MP,一种行为诱导的Mirror-Prox时序差分方法,用于强化学习中的更快速离策略预测。该方法用行为策略贝尔曼矩阵替换协方差度量,并提供了收敛性分析和实验比较。
本文针对恒定步长Q学习,开发了一种符号分离的有限时间误差分析,将误差分解为负部和正部,并提供了揭示与过估计相关的不对称性的界。
本文提出了一种针对使用线性函数逼近的Q学习的切换系统理论,利用联合谱半径分析了在确定性、独立同分布(i.i.d.)及马尔可夫观测下的收敛稳定性。
本文通过提供一个反例解决了一个强化学习领域的开放性问题,表明在平均奖励设置下,尽管差分时序差分学习在使用局部时钟时能够收敛,但在使用全局时钟时可能会发散。