标签
This paper proposes FedCoMuon, a federated compositional Muon optimizer for matrix-wise models, along with a variance-reduced variant (FedCoMuon-VR). The authors provide convergence analysis under non-i.i.d. and non-convex settings, showing improved sample complexity over existing FedMuon algorithms, and demonstrate competitive performance on robust federated learning and task-distributed risk-sensitive meta learning.
本文研究来自随机运行的训练日志能否通过特定于臂的协变量调整来提高模型比较的精确度,发现简单的调整可以减少不确定性,但需要仔细选择协变量以避免噪声。
本文强化了LoRA的收敛性分析,将确定性预言机复杂度从指数级提升至O(epsilon^{-4}),并提出了随机变体LoRA-NSGDM和LoRA-STORM,其预言机复杂度分别改进为O(epsilon^{-8})和O(epsilon^{-6})。
本文提出了一种广义无分布半监督学习框架,通过线性组合组件风险构建无偏风险估计器,将PNU学习扩展到多类分类,同时实现更低方差并提供泛化界限。
研究人员提出了一种实用的方差缩减框架,将后分层与 CUPED 相结合,用于处理排序实验中的重尾变现指标。该框架已在 ShareChat 部署,可在减少 45% 流量的情况下达到同等统计置信度。本文已被 SIGIR 2026 收录。
GRZO是一种新颖的零阶优化方法,用于微调大语言模型,通过群组相对归一化降低方差,与MeZO相比实现了更高的准确性和内存效率。
提出了一种用于非对数凹分布的方差缩减零阶朗之万采样方法,建立了首个非渐近收敛保证,并将其应用于基于分数的生成先验的逆问题中。
本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。
本文提出了随机方差缩减估计的统一理论框架,通过新的Freedman不等式推导出高概率界,并改进了约束优化的预言机复杂度。
本文研究了Blum-Gladyshev噪声下的非凸随机优化,其中梯度方差随与初始点的距离增长。证明了带有动量的归一化SGD和方差缩减STORM方法的收敛性保证,在某些条件下达到了极小极大最优速率。
本文识别了当启发式价值函数在评估前未固定时AIVAT方差缩减技术的脆弱性,并展示了如何传播启发式不确定性以进一步减少方差,从而将得出统计结论所需的样本数量减少43%。
本文介绍了路径耦合贝尔曼流(PCBF),这是一种连续时间的分布强化学习方法,它使用流匹配来建模回报分布,而无需启发式投影。它通过将当前回报流和后续回报流通过共享的基础噪声耦合在一起,解决了以往基于流的方法中存在的边界不匹配和高方差问题。
提出了vOPD,通过引入强化学习中的控制变量基线,稳定了大语言模型的在策略蒸馏,实现了与昂贵全词表方法相当的性能,同时计算成本更低。
本文介绍了 POISE,一种通过利用模型自身内部状态来估计基线,从而在大型推理模型中实现稳定策略优化的方法,与 PPO 和 GRPO 相比,该方法降低了计算开销。
# 使用动作相关分解基线的策略梯度方差缩减 来源: [https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/](https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/) OpenAI## 摘要 策略梯度方法在深度强化学习中取得了巨大成功,但梯度估计的方差很高。高方差问题特别