tensor-parallelism

标签

Cards List
#tensor-parallelism

@Hikari_07_jp:本地LLM极其复杂。硬件选型、量化、工具集、引擎、张量并行、未修改的模……

X AI KOLs Timeline ↗ · 2026-05-22 缓存

一位用户反思运行本地LLM的复杂性和魅力,涉及硬件选型、量化和张量并行。

0 人收藏 0 人点赞
#tensor-parallelism

@levidiamode: Day 138/365 of GPU Programming 今年我最喜欢的讲座之一是斯坦福大学的CS336第7讲关于GPU…

X AI KOLs Timeline ↗ · 2026-05-21 缓存

一位学习者分享了对斯坦福大学CS336第7讲关于GPU并行性的热情,该讲座涵盖了基本操作,并将其连接到多GPU设置以及张量并行、数据并行和流水线并行等技术。

0 人收藏 0 人点赞
#tensor-parallelism

双GPU llama.cpp加速

Reddit r/LocalLLaMA ↗ · 2026-05-17

llama.cpp的一个分支修复了量化KV缓存中的--split-mode tensor问题,在双GPU配置上实现高达40%的速度提升,且无质量损失。

0 人收藏 0 人点赞
#tensor-parallelism

@PyTorch: At #PyTorchCon Europe 2026, @ezyang (@Meta) explains why many developers find tensor parallelism difficult to work with…

X AI KOLs Following ↗ · 2026-05-14 缓存

At PyTorchCon Europe 2026, Edward Yang explains PyTorch's new pre-compilation support for distributed training and SPMD type system to help developers write correct tensor parallelism code, addressing common pitfalls in gradient correctness.

0 人收藏 0 人点赞
#tensor-parallelism

llama.cpp b9095 发布!支持双 Blackwell PCIe 显卡无需 NCCL 的张量并行

Reddit r/LocalLLaMA ↗ · 2026-05-10

llama.cpp b9095 版本引入了针对双 Blackwell PCIe GPU 的免 NCCL 张量并行功能,使得在不依赖 NCCL 的情况下也能实现高效的多 GPU 推理。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈