tensor-parallelism

标签

Cards List
#tensor-parallelism

tp=6 在 vLLM 上也可行,只需填充补位

Reddit r/LocalLLaMA ↗ · 昨天

一位用户分享了一个变通方案:通过用零填充模型架构维度直到能被整除,让 vLLM 在六块 GPU 上实现张量并行(tp=6),从而在 Radeon 7900 XTX 显卡上运行 Qwen 27B 推理时获得更高的 KV cache 利用率。

0 人收藏 0 人点赞
#tensor-parallelism

@YRSM_Simon: 这是什么黑科技!测试了 @MiaAI_lab 更新的 DeepSeek V4.1 Flash 配方,4 台 DGX Sparks, TP4,改进…

X AI KOLs Timeline ↗ · 6天前 缓存

在 4 台 DGX Sparks 上测试更新的 DeepSeek V4.1 Flash 模型配方,显示出显著的性能提升,尤其是在冷预填充、代码生成和文本生成速度方面。

0 人收藏 0 人点赞
#tensor-parallelism

来自@exolabs的帖子:https://x.com/exolabs/status/2103617535765573959

X AI KOLs Timeline ↗ · 6天前 缓存

这篇文章是NVIDIA DGX Spark的手册,该设备专为本地AI推理设计,详细介绍了其规格、如何连接多台设备以提升性能,以及其针对运行混合专家模型的优化。

0 人收藏 0 人点赞
#tensor-parallelism

在 RTX 3060 + 5060 Ti 上成功运行 Qwen 3.8 27B EXL3

Reddit r/LocalLLaMA ↗ · 2026-09-20

一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。

0 人收藏 0 人点赞
#tensor-parallelism

(NInfer分支) 我为Qwen-3.8 27B在双5090显卡上实现1M上下文的尝试

Reddit r/LocalLLaMA ↗ · 2026-08-29

一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。

0 人收藏 0 人点赞
#tensor-parallelism

更多GPU还是更小缓存?张量并行与KV压缩在内存受限LLM服务中的比较

arXiv cs.AI ↗ · 2026-08-26 缓存

本文比较了张量并行和KV缓存压缩技术在内存受限LLM服务中的应用,发现压缩通常更经济,并讨论了基于模型大小与设备内存相对关系的决策规则。

0 人收藏 0 人点赞
#tensor-parallelism

FleetSieve:面向SLO感知LLM舰队配置的决策关键型分析方法

arXiv cs.LG ↗ · 2026-08-21 缓存

FleetSieve提出了一种针对SLO感知LLM舰队配置的决策关键型分析方法,通过精简测量来优化资源分配,实现了相比均匀分析更高的效率。

0 人收藏 0 人点赞
#tensor-parallelism

YouTube本地LLM王者回归

Reddit r/LocalLLaMA ↗ · 2026-08-18 缓存

一位YouTube创作者在休整期后回归,教授从零开始构建分布式训练框架,专注于DeepSeek、MoE和MLA等高级AI主题,并强调培养解决问题的能力和自信心。

0 人收藏 0 人点赞
#tensor-parallelism

为消费级Nvidia显卡启用PCI-E P2P将带来超乎你想象的收益

Reddit r/LocalLLaMA ↗ · 2026-08-08

通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。

0 人收藏 0 人点赞
#tensor-parallelism

NVLink 何时值得使用?

Hacker News Top ↗ · 2026-07-22 缓存

在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。

0 人收藏 0 人点赞
#tensor-parallelism

@superalesha: https://x.com/superalesha/status/2077437741915312221

X AI KOLs Timeline ↗ · 2026-07-15 缓存

作者分享了在四张RTX 3090本地设备上六个月的测量数据,结果表明对于适配较少显卡的模型,数据并行通常优于张量并行,吞吐量差异可达3.4倍。

0 人收藏 0 人点赞
#tensor-parallelism

双GPU下流水线与张量并行的llama.cpp中测量PCIe传输

Reddit r/LocalLLaMA ↗ · 2026-07-11

在双GPU下使用流水线和张量并行运行llama.cpp时的PCIe传输性能分析。

0 人收藏 0 人点赞
#tensor-parallelism

@analogalok: 买不起2000美元的GPU这个借口已经彻底失效了。昨天我展示了如何解锁一块企业级16GB……

X AI KOLs Timeline ↗ · 2026-07-06 缓存

关于如何使用Kaggle免费的双Tesla T4 GPU(32GB显存)来运行大语言模型并支持超大上下文窗口的指南,涵盖llama.cpp中的多GPU并行策略。

0 人收藏 0 人点赞
#tensor-parallelism

关于在 4x5060 ti 分叉上排查 P2P 问题的发现

Reddit r/LocalLLaMA ↗ · 2026-06-27

关于 PCIe 分叉和 4 路 GPU 配置中 P2P 性能问题的详细发现,包括张量并行和流水线并行的解决方法及替代方案。

0 人收藏 0 人点赞
#tensor-parallelism

vulkan: 使TP可行 · Pull Request #25051 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-06-26 缓存

此拉取请求使得在使用Vulkan后端时,llama.cpp中的张量并行(TP)变得可行,从而能够在多个GPU上进行分布式推理。

0 人收藏 0 人点赞
#tensor-parallelism

@ickma2311: Efficient AI 第19讲:分布式训练(第一部分)这一讲让我更清楚地了解了自注意力……

X AI KOLs Timeline ↗ · 2026-06-10 缓存

第19讲高效AI分布式训练总结,涵盖数据、流水线、张量和序列并行方法,并附有关内存和通信瓶颈的说明。

0 人收藏 0 人点赞
#tensor-parallelism

再加一张GPU就获得近乎线性的扩展?有点奇怪

Reddit r/LocalLLaMA ↗ · 2026-06-08

一位用户报告称,在使用Qwen模型进行推理时,添加第二张RTX 3090后实现了近乎线性的性能扩展,在没有NVLink的情况下,解码TPS提升了约1.8倍。

0 人收藏 0 人点赞
#tensor-parallelism

@gpusteve:你正在面试Anthropic的机器学习性能岗位,他们问:“你在8块GPU上运行一个70B参数的Transformer模型…”

X AI KOLs Timeline ↗ · 2026-06-08 缓存

一条推文解释了一个在Anthropic机器学习性能面试题中的正确答案:在8块GPU上运行70B参数的Transformer模型时,按列分割张量并行线性层与按行分割的延迟权衡,并强调尽管每块GPU的权重相等,但性能并不相似。

0 人收藏 0 人点赞
#tensor-parallelism

@ggerganov:强调 llama.cpp 在多GPU和张量并行支持方面的最新进展 过去几个月来,llama.cpp 取得了多项…

X AI KOLs Following ↗ · 2026-06-04

llama.cpp 维护者与 NVIDIA 工程师合作,显著提升了 ggml 中的多GPU性能,实现了硬件无关的张量并行,并在 RTX 系统上获得了显著的性能提升。

0 人收藏 0 人点赞
#tensor-parallelism

通过自适应张量并行加速同步RLHF训练中的长尾生成

arXiv cs.AI ↗ · 2026-05-26 缓存

本文提出PAT,一种自适应张量并行方法,在同步RLHF训练的生成长阶段动态重构TP配置,以缓解长尾生成瓶颈。在LLaMA3.1-8B和Qwen3-14B上的评估显示,生成延迟最多降低34.6%,端到端迭代延迟最多降低27.2%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈