在 RTX 3060 + 5060 Ti 上成功运行 Qwen 3.8 27B EXL3
摘要
一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。
在这里分享我的成功经验。我的设置:RTX 5060 Ti 16GB(x16 PCIe 插槽)RTX 3060 12GB(x4 PCIe 插槽)内存:32GB CPU:Ryzen 5 5600 操作系统:Linux 所以我总共有 28GB 显存。平均令牌每秒:50,使用 MTP,所以在 40 到 60 之间波动,但主要稳定在 50 左右。不使用 MTP 时,降至 22 令牌每秒。推理引擎:通过 https://github.com/theroyallab/tabbyAPI 使用 exllamav3 模型:https://huggingface.co/turboderp/Qwen3.8-27B-exl3 以下是我的 config.yml 文件:
model: # https://huggingface.co/turboderp/Qwen3.8-27B-exl3
model_name: Qwen3.8-27B-exl3-5.0bpw
model_dir: /home/ccidral/ai/models
max_seq_len: 102400
cache_size: 102400
cache_mode: Q8
gpu_split_auto: true
tensor_parallel: true
tensor_parallel_backend: native
reasoning: true
reasoning_start_token: ""
reasoning_end_token: "</think>"
tool_format: qwen3_coder
draft_model:
draft_mode: mtp
draft_cache_mode: Q8
network:
host: 127.0.0.1
port: 5000
如你所见,它使用了张量并行。关于显存使用,3060 上还剩 1.3GB,5060 上还剩 0.6GB,这是我还在尝试通过手动调整 GPU 分割来修复的,但出于某些原因,推理引擎会失控并挂起。我认为平衡得不错,但我的桌面环境占用约 1GB 显存,我认为这导致了不平衡(我正考虑更换为带有集成显卡的 CPU)。我已经用它来编写了一个使用 ratatui 的小型 Rust TUI 应用。效果很好。我非常满意,但如果你看到任何改进空间或更经过实战检验的替代方案,请随时分享。也很乐意回答任何问题。
相似文章
我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。
Qwen 3.6 在双 RTX PRO 6000 上的基准测试
使用 VLLM 在双 RTX PRO 6000 GPU 上对 Qwen 3.6 27B 和 35B 模型进行基准测试,生成吞吐量高达每秒 3500 个令牌。
实验:Qwen3.8-2.4T-A95B 在 RTX 5090 + RTX 5060 Ti 上本地运行,约 0.80 tok/s
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。
@cniongolo: 我不确定大家是否已经意识到,你实际上可以在双 GPU 上运行 Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF…
演示了在双路 Nvidia RTX PRO 6000 Blackwell GPU 上,使用 Hugging Face Inference 运行自定义 Qwen 模型(Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF),达到每秒约 195 个 token 的处理速度。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。