distributed-training

标签

Cards List
#distributed-training

通过 FLIP 实现跨洲联邦学习的可重复性:一项多应用研究

arXiv cs.LG ↗ · 15小时前 缓存

本文提出了 FLIP(联邦学习互操作性平台),这是一个开源的多应用平台,使医疗领域的跨洲联邦学习具备可重复性。研究通过在英国和泰国的节点上对合成胸部 X 光数据集进行联邦微调与评估,对其进行了验证。

0 人收藏 0 人点赞
#distributed-training

Nereus:LLM后训练的自适应并行处理

Hugging Face Daily Papers ↗ · 2天前 缓存

Nereus 是一个成本感知运行时,它将针对大型语言模型的强化学习后训练任务调整为高效执行计划,将延迟降低27.7%,并将吞吐量提升最多7.27倍,相比现有工具。

0 人收藏 0 人点赞
#distributed-training

DistribAI v2

Reddit r/LocalLLaMA ↗ · 4天前

DistribAI v2 是一个平台,用于在多个消费级设备上进行AI模型的分布式训练,提供改进的托管选项和强大的边界情况处理。

0 人收藏 0 人点赞
#distributed-training

AnDE分类器的联邦学习

arXiv cs.LG ↗ · 5天前 缓存

本文提出了一种用于AnDE分类器的联邦学习框架,通过避免传输语义上有意义的参数来增强隐私,并在离散数据集上证明了其有效性。

0 人收藏 0 人点赞
#distributed-training

在管道并行训练中模拟通过跳过阶段实现容错 [R]

Reddit r/MachineLearning ↗ · 2026-09-22

本文通过模拟管道并行训练中的阶段跳过来探讨分布式预训练中的容错性,展示了在故障发生时,健康的工作节点能够以最小的验证损失影响继续训练。

0 人收藏 0 人点赞
#distributed-training

@_michael_yu_: 我认为斯坦福的 CS336 是从零开始学习大语言模型(LLMs)的最佳材料之一。我刚完成学习(t…

X AI KOLs Timeline ↗ · 2026-09-22 缓存

Michael Yu 分享了他从斯坦福 CS336 课程中关于从零构建大语言模型的详细实现和学习心得,涵盖了分词器、Transformer、训练系统和对齐技术。

0 人收藏 0 人点赞
#distributed-training

面向高效分布式长上下文扩散语言模型训练的块并行方法

arXiv cs.LG ↗ · 2026-09-18 缓存

本文提出了块并行和上下文分片块并行(CSBP)方法,以高效训练长上下文扩散语言模型,在SWE-bench Verified等基准测试中显著提高了吞吐量和性能。

0 人收藏 0 人点赞
#distributed-training

WFM:复杂智能体推理的维基基础模型

arXiv cs.AI ↗ · 2026-09-17 缓存

本文提出了WFM,一种用于可扩展、原生智能体知识表示和检索的维基基础模型,展示了在复杂智能体推理任务中性能的提升,并实现了10.5倍的训练加速。

0 人收藏 0 人点赞
#distributed-training

@PyTorch: 更聪明地训练。从分布式训练到优化技术和基础模型,#PyTor…的训练专轨

X AI KOLs Following ↗ · 2026-09-11 缓存

本文介绍了PyTorch北美会议的训练专轨,其中包括分布式训练、优化技术和基础模型的实用会议,旨在提升AI系统的效率。

0 人收藏 0 人点赞
#distributed-training

@PyTorch: 在相同配置下,HyperParallel FSDP2 + Muon 的训练吞吐量显著高于 PyTor…

X AI KOLs Following ↗ · 2026-09-09

HyperParallel 是一个基于 PyTorch 的分布式加速库,专为 Ascend SuperPoD 优化,展示了比标准 PyTorch FSDP2 与 Muon 更高的训练吞吐量,同时保持损失收敛,如在 #PyTorchCon China 的演示中所展示。

0 人收藏 0 人点赞
#distributed-training

利用智能网络的分布式训练

arXiv cs.LG ↗ · 2026-08-28 缓存

本文提出了一种方法,通过利用多播技术和在线FPGA,以及同步调度的优化框架,来增强广域网上的分布式训练,以最大化信息交换并减少性能差距。

0 人收藏 0 人点赞
#distributed-training

@vllm_project: 这个权重传输引擎是vLLM原生的。任何基于Ray的训练器都可以通过单个WeightSource迭代器来采用它。…

X AI KOLs Following ↗ · 2026-08-26 缓存

vLLM引入了一个原生的分片权重传输引擎,使用Ray Direct Transport (RDT)来在大规模在线强化学习环境中进行高效的权重同步,从而提升像Kimi K2这样的模型的性能。

0 人收藏 0 人点赞
#distributed-training

YouTube本地LLM王者回归

Reddit r/LocalLLaMA ↗ · 2026-08-18 缓存

一位YouTube创作者在休整期后回归,教授从零开始构建分布式训练框架,专注于DeepSeek、MoE和MLA等高级AI主题,并强调培养解决问题的能力和自信心。

0 人收藏 0 人点赞
#distributed-training

联邦学习用于分布式CNC刀具磨损预测

arXiv cs.LG ↗ · 2026-08-13 缓存

本文研究了联邦学习在CNC刀具磨损预测中的应用,表明在分布式制造环境中,联邦模型的性能接近集中式学习,并显著优于本地客户端基线。

0 人收藏 0 人点赞
#distributed-training

使用 Data-Centric Parallel 训练可变长序列

arXiv cs.AI ↗ · 2026-08-11 缓存

介绍了 Data-Centric Parallel (DCP),一种通过在每批次动态调整运行时设置来训练变长序列深度学习模型的方法,在 32 个 H200 GPU 上实现了高达 2.88 倍的加速,仅需集成 10 行代码。

0 人收藏 0 人点赞
#distributed-training

SNI-GNN:SmartNIC辅助的全图GNN训练与网内嵌入预测

arXiv cs.LG ↗ · 2026-08-10 缓存

介绍了SNI-GNN,一种SmartNIC辅助的全图GNN训练系统,通过在网络内预测远端嵌入来减少节点间通信,实现了1.3–3.6倍的加速,且精度损失可忽略不计。

0 人收藏 0 人点赞
#distributed-training

DG-FedReuse: Proxy-Gradient-Gated Cached-Update Reuse with Matched Sparse Uplink Accounting

arXiv cs.LG ↗ · 2026-08-07 缓存

Presents DG-FedReuse, a federated learning mechanism that reuses age-decayed cached client updates under a proxy-gradient threshold to reduce uplink communication, achieving significant modeled savings with minimal accuracy loss on image classification benchmarks.

0 人收藏 0 人点赞
#distributed-training

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

arXiv cs.LG ↗ · 2026-08-03 缓存

This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.

0 人收藏 0 人点赞
#distributed-training

@PyTorch:PyTorch 2.13 为 Apple Silicon 带来 FlexAttention,借助 nn.Li… 将大词表模型的峰值内存最高削减 4×

X AI KOLs Following ↗ · 2026-07-31 缓存

PyTorch 2.13 发布版为 Apple Silicon 带来 FlexAttention,通过融合的 LinearCrossEntropyLoss 实现高达 12 倍加速,并将大词表模型的峰值内存降低 4 倍,同时还更新了分布式训练、编译和端侧推理。

0 人收藏 0 人点赞
#distributed-training

SLAI T-Rex: 在昇腾SuperPOD上对DeepSeek-V4系列进行全参数后训练

Hugging Face Daily Papers ↗ · 2026-07-22 缓存

本文介绍了SLAI T-Rex,一种面向昇腾NPU SuperPOD上万亿参数MoE模型的全参数后训练优化框架,实现了34.22%的MFU,并在运筹学任务上比GPT-5.4-Mini高出3.98个百分点。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈