价值100美元的GPU以7.39 t/s运行Qwen 3.8 27b模型
摘要
一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。
Qwen 27b Q3_K_M 量化版,搭配两张RX 580 8GB GPU(在我的国家每张约50美元,极端情况下60美元),提供16GB显存。我们使用了一个现有的旧DDR3主板,带有两个GPU插槽(你可以以大约200美元购买,包括32GB DDR3内存、工作站级Xeon CPU和工作站主板,二手)。这不是最佳选项,但它使得许多人能够运行这个模型,甚至比系统内存更便宜。限制:处理速度非常低(仅14 t/s),意味着MTP模型会亏损,且高输入令牌数将是痛苦的体验。如果您在意使用便捷性,不推荐;如果您需要便宜能用的东西,不惜一切代价,强烈推荐。
相似文章
双RTX 4060 Ti上Qwen3.6 q4xl达到125 tok/s,性价比惊人
有用户报告称,在两张RTX 4060 Ti显卡上运行Qwen3.6 q4xl达到了每秒125个token,强调性价比出色,并想知道进一步优化是否能达到150 tok/s。
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。
在廉价 Radeon 7600 上运行 Qwen 3.6 35B A3B-Q8_0 gguf,速度 18 token/s * 更新后提升至 21 t/s
用户报告在 Radeon 7600 上使用 llama.cpp 和 ROCm 运行 Qwen 3.6 35B A3B-Q8_0 gguf,在显存超频后达到每秒 21 tokens,并提到一个与显示相关的性能 bug。
Qwen3-8B 2.4T 在 Nvidia GB300 NVL72 上达到 288k tokens/s
NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。
我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。