我比较了这里使用的主要GPU/机器的所有规格,因为带宽不是一切。你们有些人需要认清现实。
摘要
作者比较了用于LLM推理的各种GPU,批判了常见的基准测试,并强调了预填充性能比生成速度更重要,针对不同预算和使用场景给出了建议。
热门观点:\n- Mac studio是定价过高的树莓派,效率比人们想象的要低得多(大多数Mac也是如此)。M5 MBP搭配“tensor”矩阵MMA稍好一些,但提升有限。\n- Spark在仅售3-4k时还算不错。显然Strix现在要好得多。\n- 3090对于单流使用来说完全过剩,如果能找到便宜的V100s,性价比会高得多。P40非常小众,但如果你恰好需要48GB显存、运行MoE且买不起Mi50s或V100s,它们还算凑合。\n- P100s是被严重低估的入门级LLM GPU,很少有人提及。200美元(双卡)就能获得32GB显存、700GB/s带宽和M3 Ultra约70%的计算能力,这非常疯狂。\n我知道这个板块现在充斥着只会用设备跟动漫老婆搞ERP的玩家,但对于确实在高效工作的人来说,预填充依然非常重要,而这完全被大多数帖子或大型AI油管频道做的“生成1000字故事”基准测试所掩盖。尤其是在疯狂消耗上下文的多模态模型中。我还在为未来想做的预填充和生成图表收集数据……另外,我没找到太多可靠的功耗数据,如果能在评论区提供你们自己设备的数据,我会很感激。感谢聆听我的TED演讲。\n编辑:语法问题
相似文章
对15款“电子垃圾”GPU进行现代工作负载基准测试
对15款退役的NVIDIA Tesla GPU(K80、P100、V100)进行现代AI工作负载基准测试,展示它们在家庭实验室推理设置中的可行性和性价比。
比较 llama.cpp 行/张量分割与 ik_llama 图分割的双GPU推理速度
一位用户使用llama.cpp(行/张量切分)和ik_llama(图切分)在两张RTX 3080 20GB上对双GPU推理速度进行了基准测试,使用Qwen3.6-27B GGUF模型,比较了token生成和提示处理速度。
预算有限,为我的RX 6800提供购买建议
本帖子讨论在RX 6800基础上,为LLM推理选择预算GPU(Radeon VII vs 两块P100),重点分析MoE模型的VRAM与速度权衡。
在Strix Halo、RTX 3090和RTX 5070上运行相同模型,只为获得自己的数据
作者在Strix Halo、RTX 3090和RTX 5070上使用了多个后端,进行了55次推理基准测试。结果揭示,显存带宽主导解码速度,RTX 5070在小模型上击败RTX 3090,而推理模型因隐藏的推理内容看起来慢约5倍。
本地 AI 硬件内存带宽(2026 年版)
本文深入解析内存带宽作为本地 AI 硬件性能的关键指标,对比了 NVIDIA、Apple、AMD、Intel 等厂商在不同性能层级下的当前 GPU 与统一内存系统。