标签
一位用户分享了一个变通方案:通过用零填充模型架构维度直到能被整除,让 vLLM 在六块 GPU 上实现张量并行(tp=6),从而在 Radeon 7900 XTX 显卡上运行 Qwen 27B 推理时获得更高的 KV cache 利用率。
在 4 台 DGX Sparks 上测试更新的 DeepSeek V4.1 Flash 模型配方,显示出显著的性能提升,尤其是在冷预填充、代码生成和文本生成速度方面。
这篇文章是NVIDIA DGX Spark的手册,该设备专为本地AI推理设计,详细介绍了其规格、如何连接多台设备以提升性能,以及其针对运行混合专家模型的优化。
一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。
一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。
本文比较了张量并行和KV缓存压缩技术在内存受限LLM服务中的应用,发现压缩通常更经济,并讨论了基于模型大小与设备内存相对关系的决策规则。
FleetSieve提出了一种针对SLO感知LLM舰队配置的决策关键型分析方法,通过精简测量来优化资源分配,实现了相比均匀分析更高的效率。
一位YouTube创作者在休整期后回归,教授从零开始构建分布式训练框架,专注于DeepSeek、MoE和MLA等高级AI主题,并强调培养解决问题的能力和自信心。
通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。
在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。
作者分享了在四张RTX 3090本地设备上六个月的测量数据,结果表明对于适配较少显卡的模型,数据并行通常优于张量并行,吞吐量差异可达3.4倍。
在双GPU下使用流水线和张量并行运行llama.cpp时的PCIe传输性能分析。
关于如何使用Kaggle免费的双Tesla T4 GPU(32GB显存)来运行大语言模型并支持超大上下文窗口的指南,涵盖llama.cpp中的多GPU并行策略。
关于 PCIe 分叉和 4 路 GPU 配置中 P2P 性能问题的详细发现,包括张量并行和流水线并行的解决方法及替代方案。
此拉取请求使得在使用Vulkan后端时,llama.cpp中的张量并行(TP)变得可行,从而能够在多个GPU上进行分布式推理。
第19讲高效AI分布式训练总结,涵盖数据、流水线、张量和序列并行方法,并附有关内存和通信瓶颈的说明。
一位用户报告称,在使用Qwen模型进行推理时,添加第二张RTX 3090后实现了近乎线性的性能扩展,在没有NVLink的情况下,解码TPS提升了约1.8倍。
一条推文解释了一个在Anthropic机器学习性能面试题中的正确答案:在8块GPU上运行70B参数的Transformer模型时,按列分割张量并行线性层与按行分割的延迟权衡,并强调尽管每块GPU的权重相等,但性能并不相似。
llama.cpp 维护者与 NVIDIA 工程师合作,显著提升了 ggml 中的多GPU性能,实现了硬件无关的张量并行,并在 RTX 系统上获得了显著的性能提升。
本文提出PAT,一种自适应张量并行方法,在同步RLHF训练的生成长阶段动态重构TP配置,以缓解长尾生成瓶颈。在LLaMA3.1-8B和Qwen3-14B上的评估显示,生成延迟最多降低34.6%,端到端迭代延迟最多降低27.2%。