我比较了这里使用的主要GPU/机器的所有规格,因为带宽不是一切。你们有些人需要认清现实。

Reddit r/LocalLLaMA 新闻

摘要

作者比较了用于LLM推理的各种GPU,批判了常见的基准测试,并强调了预填充性能比生成速度更重要,针对不同预算和使用场景给出了建议。

热门观点:\n- Mac studio是定价过高的树莓派,效率比人们想象的要低得多(大多数Mac也是如此)。M5 MBP搭配“tensor”矩阵MMA稍好一些,但提升有限。\n- Spark在仅售3-4k时还算不错。显然Strix现在要好得多。\n- 3090对于单流使用来说完全过剩,如果能找到便宜的V100s,性价比会高得多。P40非常小众,但如果你恰好需要48GB显存、运行MoE且买不起Mi50s或V100s,它们还算凑合。\n- P100s是被严重低估的入门级LLM GPU,很少有人提及。200美元(双卡)就能获得32GB显存、700GB/s带宽和M3 Ultra约70%的计算能力,这非常疯狂。\n我知道这个板块现在充斥着只会用设备跟动漫老婆搞ERP的玩家,但对于确实在高效工作的人来说,预填充依然非常重要,而这完全被大多数帖子或大型AI油管频道做的“生成1000字故事”基准测试所掩盖。尤其是在疯狂消耗上下文的多模态模型中。我还在为未来想做的预填充和生成图表收集数据……另外,我没找到太多可靠的功耗数据,如果能在评论区提供你们自己设备的数据,我会很感激。感谢聆听我的TED演讲。\n编辑:语法问题
查看原文

相似文章

本地 AI 硬件内存带宽(2026 年版)

X AI KOLs

本文深入解析内存带宽作为本地 AI 硬件性能的关键指标,对比了 NVIDIA、Apple、AMD、Intel 等厂商在不同性能层级下的当前 GPU 与统一内存系统。