multi-gpu

标签

Cards List
#multi-gpu

运行Deepseek V4 Flash-0731 130-150 tks的基础方法:16x5060ti 16GB配置与2个PLX88096交换机

Reddit r/LocalLLaMA · 2天前

本文详细介绍了使用16个RTX 5060 Ti GPU和PLX交换机运行Deepseek V4 Flash模型的已验证硬件配置,实现了特定的上下文处理和吞吐量性能指标。

0 人收藏 0 人点赞
#multi-gpu

花了3天在搭载40GB显存笔记本+TB4外置显卡的独特组合上,对llama.cpp的各类标志参数进行基准测试。最终实现:生成速度提升70%、预填充速度提升40%、上下文容量增加6万token,并向llama项目提交了关于MTP的技术问题报告。以下是实践中的关键发现。

Reddit r/LocalLLaMA · 2天前

作者在配备RTX 4090笔记本显卡和AMD XTX 7900外置显卡的混合GPU环境中对llama.cpp运行参数进行了基准测试,实现了生成速度提升70%、预填充速度提升40%,并在多GPU配置中发现了一个与MTP相关的错误。

0 人收藏 0 人点赞
#multi-gpu

打造预算型 32GB → 48GB 显存家用 AI 服务器:2-3 张 RX 9060 XT 16GB 对比 RTX 5060 Ti 16GB,AM5 还是二手 EPYC?

Reddit r/LocalLLaMA · 2026-08-08

一位用户正在寻求构建预算型家用 AI 服务器(32-48GB 显存)的建议,正在 AMD RX 9060 XT 和 Nvidia RTX 5060 Ti GPU 之间犹豫,并纠结于使用 AM5 还是二手 EPYC 平台来进行本地 LLM 推理和大型 MoE 模型卸载。

0 人收藏 0 人点赞
#multi-gpu

2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA · 2026-08-06

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。

0 人收藏 0 人点赞
#multi-gpu

@ycombinator:在我们的最新 YC Paper Club 上,研究人员和开发者介绍了多 GPU 内核、每瓦特智能、异构……

X AI KOLs Timeline · 2026-07-29 缓存

Y Combinator 举办了一场 Paper Club,研究人员展示了多 GPU 内核优化的创新,包括 ParallelKittens,这是一个简化重叠多 GPU 内核开发并在多种工作负载下实现显著加速的 CUDA 框架。

0 人收藏 0 人点赞
#multi-gpu

PSA:请勿使用 Intel 消费级平台进行多 GPU 配置

Reddit r/LocalLLaMA · 2026-07-25

测试表明,搭载Arrow Lake CPU的Intel消费级平台(如Z890)存在硬件/固件限制,阻碍了多GPU之间进行正常的PCIe点对点(P2P)通信。虽然通道数量充足,但这些平台仍不适合多GPU AI工作负载。

0 人收藏 0 人点赞
#multi-gpu

16块AMD MI50 32GB:GLM-5.2 Q4 在 llama.cpp RPC 上以 12.2 tok/s 运行

Reddit r/LocalLLaMA · 2026-07-22

描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。

0 人收藏 0 人点赞
#multi-gpu

在 550B Nemotron Ultra Q3_S 上使用 P40 与 MI50 以及 RPC

Reddit r/LocalLLaMA · 2026-07-22

用户分享了使用 RPC 在两台机器上运行 550B Nemotron Ultra 模型的基准测试结果,在较旧的 AMD MI50 和 Nvidia P40 GPU 上实现了令人印象深刻的吞吐量。

0 人收藏 0 人点赞
#multi-gpu

6块 MI50 直连 PCIE 与 4块 MI50 通过 PEX8749 交换机加 2块直连 PCIE 的对比

Reddit r/LocalLLaMA · 2026-07-11

一位用户在较老的 X99 主板上对 AMD MI50 GPU 在不同 PCIe 配置下进行基准测试,比较了直接 PCIe 连接与使用 PEX8749 交换机的情况。结果显示性能差异极小,令牌生成速度略有提升。

0 人收藏 0 人点赞
#multi-gpu

在4块RTX 5060 Ti上,使用P2P和PP=4,对新的unslooth/Qwen3.6-27B-NVFP4在并发数为1、4、8、12和16下的基准测试

Reddit r/LocalLLaMA · 2026-07-11

unslooth/Qwen3.6-27B-NVFP4模型在4块RTX 5060 Ti GPU上,使用点对点(P2P)和流水线并行(PP)在不同并发级别下的基准测试结果。

0 人收藏 0 人点赞
#multi-gpu

@analogalok:别再盲目信任本地 LLM 的默认多 GPU 设置了,你实际上正浪费 25% 的性能……

X AI KOLs Timeline · 2026-07-09 缓存

基准测试结果对比了 llama.cpp 中针对双 GPU 设置的层并行与张量并行:层模式在预填充(RAG 管道)中快 25%,而张量模式在解码(交互式聊天)中快 16%。

0 人收藏 0 人点赞
#multi-gpu

@analogalok: 买不起2000美元的GPU这个借口已经彻底失效了。昨天我展示了如何解锁一块企业级16GB……

X AI KOLs Timeline · 2026-07-06 缓存

关于如何使用Kaggle免费的双Tesla T4 GPU(32GB显存)来运行大语言模型并支持超大上下文窗口的指南,涵盖llama.cpp中的多GPU并行策略。

0 人收藏 0 人点赞
#multi-gpu

Wan-Streamer v0.2:更高分辨率,相同延迟

Hugging Face Daily Papers · 2026-07-05 缓存

Wan-Streamer v0.2 是一个保持延迟不变升级的端到端音视频交互模型,通过多GPU思考者-执行者架构将输出分辨率从192x336提高到640x368,同时维持约200毫秒的模型端延迟。

0 人收藏 0 人点赞
#multi-gpu

GLM5.2 在 5 块 Pro 6000 和一块 5090 上的昂贵旅程

Reddit r/LocalLLaMA · 2026-07-03

一篇关于在 5 块 AMD Radeon Pro 6000 GPU 和一块 NVIDIA RTX 5090 上运行 GLM5.2 语言模型的报告,详细介绍了高昂的成本和技术挑战。

0 人收藏 0 人点赞
#multi-gpu

@TheAhmadOsman: 自2023年以来,我的使命就是教导人们并帮助他们运行自己的AI。2026年6月将标志着…

X AI KOLs Following · 2026-06-28 缓存

Ahmad (@TheAhmadOsman) 宣布了一篇博客文章,涵盖 llama.cpp、vLLM 和 ExLlamaV2 等推理引擎,重点关注多 GPU 设置、张量并行以及批处理推理,以优化 AI 模型性能。

0 人收藏 0 人点赞
#multi-gpu

双Radeon R9700——在llama.cpp上运行Qwen 3.6 27B Q8 MTP

Reddit r/LocalLLaMA · 2026-06-21

关于在使用ROCm的llama.cpp上,于双AMD Radeon R9700配置下运行Qwen 3.6 27B Q8模型的技术报告,包括性能基准测试和配置详情。

0 人收藏 0 人点赞
#multi-gpu

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA · 2026-06-20

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

0 人收藏 0 人点赞
#multi-gpu

在本地运行GLM 5.x的最便宜方式(不使用统一内存系统)?

Reddit r/LocalLLaMA · 2026-06-17

关于以4位量化运行GLM 5.x及类似大小模型的最廉价本地硬件配置的讨论,包括仅CPU和多GPU选项。一位用户分享了其在5900X + 128GB DDR4 + 7900XT配置上运行Minimax 2.7和Qwen 3.6的经验。

0 人收藏 0 人点赞
#multi-gpu

我不知道居然可以同时编译llamacpp来运行CUDA和Vulkan..

Reddit r/LocalLLaMA · 2026-06-16

作者发现同时使用CUDA和Vulkan后端编译llama.cpp是可行的,解码速度提升了约10% tokens/秒。他们计划运行进一步基准测试来评估其优势。

0 人收藏 0 人点赞
#multi-gpu

我意外地用一条隐藏的PCIe 2.0 x4插槽削弱了4x RTX 3090 LLM设备的性能,修复后使Mistral 128B的性能翻倍。

Reddit r/LocalLLaMA · 2026-06-04

用户发现,Threadripper 工作站主板上一处隐藏的 PCIe 2.0 x4 电气限制导致四块 RTX 3090 中的一块性能受限,从而影响了多 GPU 大语言模型推理性能。通过调整插槽布局并切换至张量分裂模式,Mistral 128B 的吞吐量从约 11 tok/s 翻倍至约 24.7 tok/s。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈