标签
本文详细介绍了使用16个RTX 5060 Ti GPU和PLX交换机运行Deepseek V4 Flash模型的已验证硬件配置,实现了特定的上下文处理和吞吐量性能指标。
作者在配备RTX 4090笔记本显卡和AMD XTX 7900外置显卡的混合GPU环境中对llama.cpp运行参数进行了基准测试,实现了生成速度提升70%、预填充速度提升40%,并在多GPU配置中发现了一个与MTP相关的错误。
一位用户正在寻求构建预算型家用 AI 服务器(32-48GB 显存)的建议,正在 AMD RX 9060 XT 和 Nvidia RTX 5060 Ti GPU 之间犹豫,并纠结于使用 AM5 还是二手 EPYC 平台来进行本地 LLM 推理和大型 MoE 模型卸载。
技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。
Y Combinator 举办了一场 Paper Club,研究人员展示了多 GPU 内核优化的创新,包括 ParallelKittens,这是一个简化重叠多 GPU 内核开发并在多种工作负载下实现显著加速的 CUDA 框架。
测试表明,搭载Arrow Lake CPU的Intel消费级平台(如Z890)存在硬件/固件限制,阻碍了多GPU之间进行正常的PCIe点对点(P2P)通信。虽然通道数量充足,但这些平台仍不适合多GPU AI工作负载。
描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。
用户分享了使用 RPC 在两台机器上运行 550B Nemotron Ultra 模型的基准测试结果,在较旧的 AMD MI50 和 Nvidia P40 GPU 上实现了令人印象深刻的吞吐量。
一位用户在较老的 X99 主板上对 AMD MI50 GPU 在不同 PCIe 配置下进行基准测试,比较了直接 PCIe 连接与使用 PEX8749 交换机的情况。结果显示性能差异极小,令牌生成速度略有提升。
unslooth/Qwen3.6-27B-NVFP4模型在4块RTX 5060 Ti GPU上,使用点对点(P2P)和流水线并行(PP)在不同并发级别下的基准测试结果。
基准测试结果对比了 llama.cpp 中针对双 GPU 设置的层并行与张量并行:层模式在预填充(RAG 管道)中快 25%,而张量模式在解码(交互式聊天)中快 16%。
关于如何使用Kaggle免费的双Tesla T4 GPU(32GB显存)来运行大语言模型并支持超大上下文窗口的指南,涵盖llama.cpp中的多GPU并行策略。
Wan-Streamer v0.2 是一个保持延迟不变升级的端到端音视频交互模型,通过多GPU思考者-执行者架构将输出分辨率从192x336提高到640x368,同时维持约200毫秒的模型端延迟。
一篇关于在 5 块 AMD Radeon Pro 6000 GPU 和一块 NVIDIA RTX 5090 上运行 GLM5.2 语言模型的报告,详细介绍了高昂的成本和技术挑战。
Ahmad (@TheAhmadOsman) 宣布了一篇博客文章,涵盖 llama.cpp、vLLM 和 ExLlamaV2 等推理引擎,重点关注多 GPU 设置、张量并行以及批处理推理,以优化 AI 模型性能。
关于在使用ROCm的llama.cpp上,于双AMD Radeon R9700配置下运行Qwen 3.6 27B Q8模型的技术报告,包括性能基准测试和配置详情。
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
关于以4位量化运行GLM 5.x及类似大小模型的最廉价本地硬件配置的讨论,包括仅CPU和多GPU选项。一位用户分享了其在5900X + 128GB DDR4 + 7900XT配置上运行Minimax 2.7和Qwen 3.6的经验。
作者发现同时使用CUDA和Vulkan后端编译llama.cpp是可行的,解码速度提升了约10% tokens/秒。他们计划运行进一步基准测试来评估其优势。
用户发现,Threadripper 工作站主板上一处隐藏的 PCIe 2.0 x4 电气限制导致四块 RTX 3090 中的一块性能受限,从而影响了多 GPU 大语言模型推理性能。通过调整插槽布局并切换至张量分裂模式,Mistral 128B 的吞吐量从约 11 tok/s 翻倍至约 24.7 tok/s。