我用四块5060Ti为Qwen3.6-27B跑代码生成基准测试,所以你不必亲自做(效果真的很好)
摘要
作者详细介绍了使用四块5060Ti搭建的配置,运行Qwen3.6-27B(Q8量化、FP16 KV缓存、并启用MTP)进行代码生成基准测试,并得出结论:与双3090或改装3080等替代方案相比,该配置每美元性能表现良好。
怪异免责声明:以下内容并非由LLM撰写,直到你看到的GitHub仓库/网站部分——那些显然是你我共同的朋友克劳德里克君(Ser Claudric)拼凑的。所以如果读起来像ADHD大脑写的,那是因为——你猜对了——确实如此。在这样的帖子中反着写“不,我是人类,抱歉”的免责声明很奇怪,但现在是2026年中,所以我们只能这样。
需求:一段时间以来,我怀疑大约花2000美元买显卡,1000美元配其他部件(除非你已有现成机器),这可能是当前市场上在代码生成方面性价比最高的选择——尤其是在我们面临的推理环境中:在“我只有几千美元预算”的级别上,你要运行的可能是目前最先进且会持续领先一段时间的模型——Qwen3.6-27B。所以如果你针对该模型(再次强调,用于代码生成)做优化,需要考虑几个因素:尽可能接近最大上下文(原生256Kt)而不降质,这意味着要安全起见,使用Q8量化(测试表明各种Q6甚至Q5_K_XL基本一样?是的。我信吗?不太信,至少现在不信)。加上FP16 KV缓存(测试表明Q8 KV基本一样?是的。我信吗?不太信,至少现在不信)。并启用MTP(特别适合代码生成),对于单流单用户、批大小为1的情况,这应该能带来快速且准确的结果,但愿还能减少工具调用错误和无休止的思维链。(顺便说一句,我非常需要帮助,弄清楚需要哪些框架和插件集才能实现这一点。)我本职工作是HPC硬件和架构,所以对我来说,硬件难题就算不是简单的部分,至少也是相对容易的部分。
(可能的)解决方案:四块5060Ti能满足上述要求,具有以下特点:如果你决定出于某种原因需要多流多批处理,并想降到某种Q4,则支持Blackwell精度级别;总空闲功耗约14-16W;发热也很低;可以逐步组装,不过从2块卡升级到4块卡这一步骤(加上分叉硬件大概)需要额外花费1000美元,无论怎么分割都不太容易。
构建细节:本次基准测试在Vast AI实例上进行!我只拥有方案的一半——两块5060Ti运行在X570主板上,但很快就会扩展到四块。不过,如果你选择搭建类似系统,需要注意一点:PCI互连必须均匀。如果全新搭建,建议使用X570或X870E(若想全面支持PCIe 5.0以获得轻微延迟降低)主板,带有两个物理x16插槽且每个可做分叉。我想到的PCIe 5.0版本是ASRock TaiChi Lite:https://www.amazon.com/dp/B0DFNPK2MX 。当两个x16插槽都插上显卡时,它们会自动协商为x8模式,这没问题,因为分叉后每块卡得到x4通道,每卡双向16GB/s,这完全足够。即使X570运行在4.0模式下,仍能达到每卡双向8GB/s,而持续推理过程中卡间流量从未达到那么高。
其他考虑的硬件替代方案:
- 一对3090:48GB显存,内存带宽更大,CUDA核心更多,但贵约400美元,没有Blackwell特性,空闲功耗更高,显卡可能被加密货币矿工摧残过,而且无法在相同性能下使用相同量化。要么牺牲MTP,要么牺牲FP16 KV,要么无法以Q8_0运行模型。最终性能仅略超四块5060Ti。
- 一对20GB改装3080:优缺点同上,显存降至40GB,但一对卡从阿里巴巴购买约需800-900美元,确实很划算。
- STXH 128GB:适合其定位,Bosgame M5如今据说降到2800美元,但在处理类似稠密模型时性能较差。
- DGX Spark/GB10:5000美元,预填充出色,但稠密模型解码很慢,类似STXH,完全没有MTP。
- M5 Max Mac:最低6699美元起(至少128GB,预填充比旧款Mac合理,解码速度也不错)。
如果我漏掉了更多选择,请告诉我。
结论:https://github.com/jdkruzr/qwen36-27b-5060ti-bench (点击其中的“live report”链接可查看更漂亮的图表)。在Qwen3.6-27B上启用MTP、Q8量化、FP16 KV缓存的情况下,我得到冷启动预填充608t/s,解码52.2t/s,上下文长度为256Kt(实际255Kt,一个奇怪的小边界情况,我没花时间排查)。对我来说,这些数字对于2000美元硬件来说非常优秀,尤其是针对这个模型——该模型因让其他许多对MoE架构更友好的硬件组合难以招架而闻名。所以,我肯定遗漏了什么。如果有,是什么呢?
相似文章
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
有人在5070ti(16GB)上运行qwen 3.8 27b吗?
用户询问在配备16GB显存的5070ti GPU上使用量化运行Qwen 3.8 27b模型是否可行,主要用于智能体编码。
在 2x3090 NVLINK 上对 Qwen 3.6 27B MTP 进行基准测试
对 Qwen 3.6 27B MTP 在 4 张 RTX 3090 GPU 上的基准分析表明,基于 NVLink 的张量并行相较于 PCIe 配置可实现显著的吞吐量提升(最高达 +53%)。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
@Snixtp: https://x.com/Snixtp/status/2055734339346768225
某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。