标签
本文提出了在 Hadamard 流形上针对 horospherical 凸函数的分布式黎曼在线梯度下降方法,其遗憾界与曲率无关,并实现与欧几里得优化相匹配的速率。
本文提出了一种用于在线逆线性优化的确定性算法,具有 O(d) 遗憾和每轮 O(d^2) 时间复杂度,这标志着此类算法中首个高效且适当的界,主要结果通过 Cogentic agentic 框架和 Gemini 3.1 Pro 获得。
本文提出了一种在线算法,用于在下闭凸约束下最大化非单调DR-次模函数,在全信息值查询模型中实现了已知最佳的离线近似因子0.401,且遗憾值亚线性。
本文表明,Bernstein CVaR-UCBVI算法在CVaR强化学习中实现了无回报律连续性假设的近极小极大领先阶遗憾界限。
This paper studies decentralized multi-player Q-learning in episodic Markov decision processes under three forms of information asymmetry, proposing algorithms that achieve regret bounds matching the single-agent Q-learning rate up to logarithmic factors.
本文为平均奖励强化学习遗憾界引入了一种常数感知的比较协议,为通信MDP导出了显式的有限下界证书,并改进了已发表的系数。
本文介绍了一种简单的基于 Dirichlet 的预测器,它实现了最优的同步多类 U 校准率,弥补了有界真损失遗憾界中已知的维度差距,并消除了光滑损失的额外加性项。
本文研究了具有不可操纵变量的上下文因果赌博机问题,提出了汤普森采样和信息导向采样(IDS)的因果变体,利用共享因果机制加速决策过程。理论遗憾界和合成任务实验表明,所提方法优于因果和非因果基线。
本文介绍了随机重置路径搜索(SRP),这是一个在已知有向图上的分段学习问题,图中边的成功概率未知且固定,失败会将智能体重置回起点。作者提出了PathUCB和PathTS算法,并给出了路径级遗憾界,在多个领域展示了实证性能。
本文提出了首个针对带压缩通信的分布式在线凸优化的FTRL型算法,与以往的OGD型方法相比,实现了优雅的理论保证和更优的遗憾界。
提出了在有限适应性下具有广义线性奖励的上下文Slate Bandit算法,实现了与非线性参数无关的遗憾界。批量式和少切换算法计算高效,且在经验上优于基线,包括在语言模型示例选择任务中。
本次论文更新提出了一种通用序列预处理方法,该方法利用二阶VAW算法和Faber多项式,为边际稳定线性动态系统实现了无维度遗憾界。
提出了GraphDR-LinUCB方法,一种面向具有图结构臂的上下文赌博机方法,该方法将特征投影到图的低频频谱子空间上。实现了首个基于频谱投影的上下文赌博机的遗憾界,并在真实数据集上相比全维度LinUCB实现了15倍的遗憾值降低。
本文正式定义了强化学习中的精确遗忘问题,提出了一种用于表格型MDP的ρ-TV-稳定强化学习算法,该算法能以重训练成本的一小部分高效移除用户数据影响,并实现了接近最小最大最优的遗憾界。该工作已被ICML接收,并建立了ρ-TV-稳定强化学习算法的上下界。
本文介绍了一种面向在线优化的曲率自适应跟随扰动的领导者(FTPL)算法,该算法采用时变扰动尺度,在非凸Lipschitz损失和强凸损失下均能实现最优遗憾界。
介绍了AdaWeather,一个自适应框架,它利用机器学习和专家混合来组合多个概率天气预报,相比最佳的静态专家混合实现了对数遗憾,并在温度预报方面展示了实证改进。
本文通过为私有随机决策理论在线学习提供最优间隔依赖遗憾算法,解决了COLT开放问题,达到了阶 (log K)/Δ_min + (log K)/ε 的下界。
本文证明,在海森兼容性条件下,在线梯度下降方法能够针对隐凸损失实现最优的√T遗憾值,解决了对抗性在线学习中的开放问题。同时,还将结果扩展至单点赌博机反馈,给出了T^{3/4}的期望遗憾界。
本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。