在我的4x3060ti设置上获得了出乎意料的好结果
摘要
一位用户使用Exl3和vllm的张量并行技术优化了4x3060ti GPU配置,用于AI推理,在大型上下文窗口中实现了高达每秒120个令牌的处理速度。
大约一个月前,我患上了FOMO,差点把本不该花的钱花在新显卡上。不过,我决定用这笔钱买一块新主板和CPU,并尝试利用我从旧加密货币矿机上闲置的3060ti显卡。是的,我本可以卖掉这些显卡,但最多能拿多少钱?一千美元?连一块3090都买不起。所以,我组装了一个4 GPU的配置,并在过去几周里不断优化它,最终找到了一个相当不错的解决方案。关键在于张量并行。Lllama.cpp不支持张量并行,这让我发现了Turboderp在Exl3上的出色工作。我能在MTP+196k上下文中在这个模型上获得大约每秒70个令牌的速度,而且效果非常好:https://huggingface.co/erlidev/Swift-Qwen3.8-27B-EXL3/tree/SC_4.00bpw_H5_V6 然后我开始变得贪心,想知道是否有更好的方案。我发现了HyperQwen仓库,它专为Ampere显卡设计,而且幸好它支持TP=4 https://github.com/syv-ai/HyperQwen 因此,在我的新vllm设置中,我找到了这个模型,它是'syv-ai/qwen38-27b-rtx3090 fast-variant,基于ukisai/Swift-Qwen3.8-27b的形状(Qwen3.8-27B的'减少推理'微调),完全由Swift自己的权重和输出构建:' https://huggingface.co/liamwh/Swift-Qwen3.8-27B-W4A16-syv-fast 结果如何?在bf16下,我可以获得150k的上下文窗口,速度约为每秒120个令牌。如果我量化kv8,上下文窗口可以扩展到完整的262k,但速度下降到大约与我在Exl3上获得的速度相似,即每秒70个左右。总之,四块3060ti显卡,每块仅有8GB显存,功耗限制为110W,我可以实现要么一个代理以每秒120个令牌的速度飞速运行,要么两个并发代理拥有大上下文窗口。哦,而且并发几乎没有速度下降。感谢大家来听我的TED演讲。
相似文章
在 RTX 3060 + 5060 Ti 上成功运行 Qwen 3.8 27B EXL3
一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
@rohanpaul_ai: 我不得不亲自测试才相信这难以置信的推理速度。单个用户使用标准数据中心 GPU 达到 3000 tokens/s。…
Kog AI 在 8 块 AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8 块 NVIDIA H200 上达到 2100 tokens/s,利用了 GPU 令牌生成中隐藏的效率差距。
4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。