面向通信高效流水线并行的学习子空间压缩
摘要
本文介绍 MAPL,一种针对流水线并行中激活值进行学习型正交压缩的方法,通过 Stiefel 流形约束和逐阶段分解锚定嵌入,在保持性能的同时降低通信开销。
arXiv:2606.05484v1 Announce Type: new
摘要:流水线并行能够训练超出单设备内存的大型语言模型,但在低带宽网络上训练时,阶段间激活通信成为主要瓶颈。近期相关工作提出使用固定正交投影来压缩激活值,但这仍会导致显著的性能下降,并且需要大量非标准调整来约束优化过程。一个自然的替代方案是为每个流水线阶段学习低秩投影,然而在训练过程中保持这些投影器的正交性仍是一个挑战。我们提出流形感知投影学习(MAPL),该方法将阶段间压缩视为在显式 Stiefel 流形(正交矩阵)约束下的可学习正交投影。MAPL 不预设固定的全局子空间,而是通过流形约束最速下降法,让每个流水线阶段自主发现并持续调整其任务最优的压缩子空间。为了在阶段边界恢复令牌特定信号,我们引入了逐阶段分解的锚定嵌入,从而能够在几乎无通信开销的情况下实现满秩激活重建。此外,我们还展示了如何在投影后结合残差向量量化,并采用流式码本同步协议来摊销字典通信开销。在从 150M 到 1B 参数的 LLaMA 模型上,我们证明了 MAPL 可以轻松应用于现有流水线,并在性能与压缩的权衡上相比子空间网络实现了显著提升,实现高压缩率且性能退化极小。
查看缓存全文
缓存时间: 2026/06/05 08:11
# 面向通信高效管道并行性的学习子空间压缩 来源:https://arxiv.org/abs/2606.05484 查看PDF(https://arxiv.org/pdf/2606.05484) > 摘要:管道并行性使得对超出单设备内存的大型语言模型进行训练成为可能,然而在低带宽网络上训练时,跨阶段激活通信成为主要瓶颈。该领域最近的研究提出使用固定的正交投影来压缩激活。然而,这仍然会导致显著的性能下降,并且需要大量非标准适配来约束优化过程。一个自然的替代方案是为每个管道阶段学习一个低秩投影,但在训练过程中维护这些投影仪的必要正交性仍然是一个挑战。我们提出了流形感知投影学习(MAPL),该方法将跨阶段压缩视为显式Stiefel流形(正交矩阵)约束下的可学习正交投影。MAPL并非规定固定的全局子空间,而是让每个管道阶段通过流形约束最陡下降法自主发现并持续适应其任务最优的压缩子空间。为了在阶段边界恢复特定token的信号,我们引入了每阶段因子化锚嵌入,使得能够以极低的通信开销实现全秩激活重建。我们进一步展示了如何在投影之后结合残差向量量化,并采用一种流式码本同步协议来摊销字典通信。在从150M到1B参数的LLaMA模型上,我们证明MAPL可以轻松应用于现有管道,并能实现高压缩比和可忽略的性能下降,与子空间网络相比,在性能与压缩之间的权衡得到了显著改善。 ## 提交历史 作者:Paul Janson \[通过邮件查看(https://arxiv.org/show-email/b9761b3f/2606.05484)\] **\[v1\]** 2026年6月3日星期三 22:10:16 UTC(203 KB)
相似文章
通过激活聚合的提示压缩
本文提出通过中间层激活的学习加权和将指令提示压缩为单个激活向量,准确率下降低于2%,并揭示了对LLM激活空间结构的洞察。
OmniScope:全模态大语言模型的模态解耦令牌压缩
OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。
并行流形引导:通过残差能量塑形实现大型关联记忆的高效适应
本文提出H-Res,一种通过塑形关联记忆的能量景观来适应大型Transformer模型的方法,无需修改权重或添加提示,保留了记忆容量,且性能优于LoRA。
OmniPack:面向高效全模态大语言模型的统一令牌压缩
OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。
SHiPPO: 带传输多项式投影的循环记忆
SHiPPO 通过将多项式投影系数传输到移动通道框架中扩展了 HiPPO,使选择性状态空间模型能够恢复对顺序敏感的记忆信号。本文提供了支持其传输记忆先验的理论基础和诊断方法。