pipeline-parallelism

标签

Cards List
#pipeline-parallelism

Agora:集体化无许可的互联网规模大型语言模型预训练

arXiv cs.LG · 2026-07-16 缓存

Agora支持利用通过互联网连接的异构、可抢占的消费级GPU进行集体化、无许可的互联网规模大型语言模型预训练,成功使用330个节点的Pluralis-8B训练运行证明了这一点。

0 人收藏 0 人点赞
#pipeline-parallelism

@analogalok: 买不起2000美元的GPU这个借口已经彻底失效了。昨天我展示了如何解锁一块企业级16GB……

X AI KOLs Timeline · 2026-07-06 缓存

关于如何使用Kaggle免费的双Tesla T4 GPU(32GB显存)来运行大语言模型并支持超大上下文窗口的指南,涵盖llama.cpp中的多GPU并行策略。

0 人收藏 0 人点赞
#pipeline-parallelism

@YuvrajS9886: 在数据并行之后,我们转向模型并行,从流水线并行开始。论文:GPipe:使用微批处理轻松扩展…

X AI KOLs Timeline · 2026-07-06 缓存

本线程解释了GPipe,这是一篇关于使用微批处理和激活检查点技术跨多个GPU扩展大模型的流水线并行论文。

0 人收藏 0 人点赞
#pipeline-parallelism

关于在 4x5060 ti 分叉上排查 P2P 问题的发现

Reddit r/LocalLLaMA · 2026-06-27

关于 PCIe 分叉和 4 路 GPU 配置中 P2P 性能问题的详细发现,包括张量并行和流水线并行的解决方法及替代方案。

0 人收藏 0 人点赞
#pipeline-parallelism

@ickma2311: Efficient AI 第19讲:分布式训练(第一部分)这一讲让我更清楚地了解了自注意力……

X AI KOLs Timeline · 2026-06-10 缓存

第19讲高效AI分布式训练总结,涵盖数据、流水线、张量和序列并行方法,并附有关内存和通信瓶颈的说明。

0 人收藏 0 人点赞
#pipeline-parallelism

llama.cpp 中的流水线并行可能浪费你的显存

Reddit r/LocalLLaMA · 2026-06-08

测试表明,llama.cpp 默认的流水线并行浪费显存且无速度提升;通过编译时设置 GGML_SCHED_MAX_COPIES=1 可节省大量显存,同时保持相同推理速度。

0 人收藏 0 人点赞
#pipeline-parallelism

面向通信高效流水线并行的学习子空间压缩

arXiv cs.LG · 2026-06-05 缓存

本文介绍 MAPL,一种针对流水线并行中激活值进行学习型正交压缩的方法,通过 Stiefel 流形约束和逐阶段分解锚定嵌入,在保持性能的同时降低通信开销。

0 人收藏 0 人点赞
#pipeline-parallelism

推测性流水线解码:通过流水线并行实现更高准确度和零泡沫推测

arXiv cs.CL · 2026-06-01 缓存

本文提出推测性流水线解码(SPD),一种在单个LLM内部利用流水线并行实现并行令牌推测的框架,避免了传统推测解码中多令牌预测的延迟泡沫和准确度下降问题。

0 人收藏 0 人点赞
#pipeline-parallelism

SpaceX 即将完成内部 AI 训练栈 V1.0 的编写,使用 C 语言(2 分钟阅读)

TLDR AI · 2026-05-29

SpaceX 正在完成一个用 C 编写的自定义 AI 训练栈,利用流水线并行和 220k 个 GB300 GPU 实现了超过一个数量级的性能提升,并计划开发用于强化学习的推理栈。

0 人收藏 0 人点赞
#pipeline-parallelism

@levidiamode: Day 138/365 of GPU Programming 今年我最喜欢的讲座之一是斯坦福大学的CS336第7讲关于GPU…

X AI KOLs Timeline · 2026-05-21 缓存

一位学习者分享了对斯坦福大学CS336第7讲关于GPU并行性的热情,该讲座涵盖了基本操作,并将其连接到多GPU设置以及张量并行、数据并行和流水线并行等技术。

0 人收藏 0 人点赞
#pipeline-parallelism

在混合Blackwell/Ada集群上对vLLM、SGLang和llama.cpp进行基准测试

Reddit r/LocalLLaMA · 2026-05-17

本文在混合Blackwell/Ada GPU集群上对vLLM、SGLang和llama.cpp进行长上下文预填充基准测试,发现vLLM在异构设置上显著优于其他引擎,而SGLang由于FP4支持限制,在使用Ada显卡时会崩溃。

0 人收藏 0 人点赞
#pipeline-parallelism

ResBM:一种基于Transformer的新型架构,用于低带宽流水线并行训练,实现128倍激活压缩 [R]

Reddit r/MachineLearning · 2026-04-16

ResBM提出了一种基于Transformer的架构,采用残差编码器-解码器瓶颈用于流水线并行训练,在保持收敛的同时实现了128倍激活压缩。该工作通过减少阶段间通信开销,推进了去中心化、互联网级分布式训练的发展。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈