Pion:一种通过正交等价变换保持谱的优化器
摘要
本文介绍了 Pion,这是一种用于大语言模型训练的的新型谱保持优化器。它利用正交等价变换在权重更新过程中维持奇异值,从而提供与标准优化器相当的稳定性能。
查看缓存全文
缓存时间: 2026/05/13 12:15
论文页面 - Pion:一种通过正交等价变换保持谱的优化器
来源:https://huggingface.co/papers/2605.12492
摘要
Pion 是一种用于大型语言模型训练的保谱优化器,它利用正交等价变换在权重更新过程中保持奇异值不变,从而提供与标准优化器相当的稳定性能。
我们提出了 Pion,一种基于正交等价变换(https://huggingface.co/papers?q=orthogonal%20equivalence%20transformation)的大型语言模型(LLM)训练保谱优化器。与 Adam(https://huggingface.co/papers?q=Adam)和 Muon(https://huggingface.co/papers?q=Moon)等加法优化器(https://huggingface.co/papers?q=additive%20optimizers)不同,Pion 通过左右正交变换(https://huggingface.co/papers?q=orthogonal%20transformations)更新每个权重矩阵,从而在整个训练过程中保持其奇异值(https://huggingface.co/papers?q=singular%20values)不变。这产生了一种优化机制(https://huggingface.co/papers?q=optimization%20mechanism),在固定权重矩阵(https://huggingface.co/papers?q=weight%20matrices)谱范数(https://huggingface.co/papers?q=spectral%20norm)的同时调节其几何结构。我们推导了 Pion 的更新规则,系统地审查了其设计选择,并分析了其收敛行为(https://huggingface.co/papers?q=convergence%20behavior)及几个关键属性。实证结果表明,Pion 为 LLM 预训练和微调提供了一种稳定且具有竞争力的标准优化器替代方案。
查看 arXiv 页面(https://arxiv.org/abs/2605.12492)查看 PDF(https://arxiv.org/pdf/2605.12492)项目页面(https://spherelab.ai/pion/)GitHub(https://github.com/Sphere-AI-Lab/pion)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.12492)
在您的代理中获取此论文:
hf papers read 2605\.12492
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.12492 即可从此页面建立链接。
引用此论文的数据集0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.12492 即可从此页面建立链接。
引用此论文的 Spaces0
没有链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2605.12492 即可从此页面建立链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏(https://huggingface.co/new-collection)即可从此页面建立链接。
相似文章
超越预训练重新思考Muon:VLA与RLVR的频谱失效与高通补救措施
本文介绍了Pion,一种新的优化器,它用高通NS迭代取代了Muon的频谱白化,以稳定低秩和低信噪比(low-SNR)条件下的训练,从而在VLA和RLVR任务中实现了更优的性能。
Orth-Dion: 消除分布式低秩谱优化中的几何失配
本文指出了Dion低秩谱优化器中的几何失配,并提出了Orth-Dion,该方案用QR正交化替换列归一化,以在相同通信成本下弥合与Muon等全秩方法的收敛差距,并在大规模语言模型预训练中进行了验证。
Dion3: Full-Stack Orthogonal Updates
Dion3 is a revised Muon optimizer that reduces computational and communication overhead via Gram Newton-Schulz, symmetric GEMM kernels, and megabatching, achieving up to 6x faster optimizer steps while matching or improving loss.
基于无调度频谱优化的随时训练
本文介绍了SF-NorMuon,一种无调度频谱优化器,在参数规模达7.72亿的语言模型上匹配或超越调优后的AdamW,并提供了平稳性和长期稳定性的理论保证。
Muon$^p$: 分数谱幂的Muon优化器
本文介绍了Muon^p,一种新颖的优化器,采用分数谱幂更新在Muon和梯度下降之间进行插值,提供了理论证明并在十亿参数规模的微调任务上取得了实证收益。