标签
作者分享了在四张RTX 3090本地设备上六个月的测量数据,结果表明对于适配较少显卡的模型,数据并行通常优于张量并行,吞吐量差异可达3.4倍。
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
用户使用llama.cpp在RTX 3090上对Qwen3.6-27B进行基准测试,实现了35 tok/s的生成速度和1247 tok/s的提示处理速度。