价值100美元的GPU以7.39 t/s运行Qwen 3.8 27b模型

Reddit r/LocalLLaMA 新闻

摘要

一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。

Qwen 27b Q3_K_M 量化版,搭配两张RX 580 8GB GPU(在我的国家每张约50美元,极端情况下60美元),提供16GB显存。我们使用了一个现有的旧DDR3主板,带有两个GPU插槽(你可以以大约200美元购买,包括32GB DDR3内存、工作站级Xeon CPU和工作站主板,二手)。这不是最佳选项,但它使得许多人能够运行这个模型,甚至比系统内存更便宜。限制:处理速度非常低(仅14 t/s),意味着MTP模型会亏损,且高输入令牌数将是痛苦的体验。如果您在意使用便捷性,不推荐;如果您需要便宜能用的东西,不惜一切代价,强烈推荐。
查看原文

相似文章