我称这个为Monstrosity。5块退役挖矿BC-250板卡运行Qwen3-Coder-Next Q4,速度达40 tok/s
摘要
用户使用五块退役挖矿BC-250板卡搭建了一个低成本设置,运行Qwen3-Coder-Next AI模型,在30k上下文中达到约40令牌/秒的速度,并计划扩展。
使用一个asrock 12单元机箱,一块板卡作为主机运行,其余无头运行。暴露约71GB的显存。目前在30k上下文中速度为40 tok/s,在100k上下文时下降至约30 tok/s。这一切都是通过板载的1gb以太网进行的。我还有两块这样的板卡,可能会让它们运行起来,看看3.8 flash next是否能以可用速度运行。这个设置在能效上极其低效,但花费不到800美元。
相似文章
我对本地AI的探索:使用两个BC-250前挖矿APU运行Qwen3.6-35B-A3B Q4_K_M,达到60 tok/s和64k上下文
用户分享了他们的本地AI配置,利用两个BC-250前挖矿APU和llama.cpp运行Qwen3.6-35B-A3B模型,实现60 tok/s和64k上下文,成本低于300美元。
双RTX 4060 Ti上Qwen3.6 q4xl达到125 tok/s,性价比惊人
有用户报告称,在两张RTX 4060 Ti显卡上运行Qwen3.6 q4xl达到了每秒125个token,强调性价比出色,并想知道进一步优化是否能达到150 tok/s。
使用旧电脑打造家庭服务器并升级GPU。Qwen3.8 27B以每秒约30个令牌运行。
一位用户使用改装的矿卡从旧电脑搭建家庭服务器,通过驱动补丁和硬件升级,实现了Qwen 3.8 27B AI模型每秒约30个令牌的推理速度。
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
@iotcoi:Qwen3.6-27B-FP8 + Dflash + DDTree,256k 上下文,10 个智能体,单颗 49W GB10 上峰值 200 tokens/s,平均解码 136 tokens/s
量化版 27B Qwen3.6 在单颗 49W GB10 GPU 上借助 Dflash+DDTree 优化,256k 上下文、10 智能体并发,峰值达 200 tok/s,平均 136 tok/s。