在 RTX 3060 + 5060 Ti 上成功运行 Qwen 3.8 27B EXL3

Reddit r/LocalLLaMA 新闻

摘要

一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。

在这里分享我的成功经验。我的设置:RTX 5060 Ti 16GB(x16 PCIe 插槽)RTX 3060 12GB(x4 PCIe 插槽)内存:32GB CPU:Ryzen 5 5600 操作系统:Linux 所以我总共有 28GB 显存。平均令牌每秒:50,使用 MTP,所以在 40 到 60 之间波动,但主要稳定在 50 左右。不使用 MTP 时,降至 22 令牌每秒。推理引擎:通过 https://github.com/theroyallab/tabbyAPI 使用 exllamav3 模型:https://huggingface.co/turboderp/Qwen3.8-27B-exl3 以下是我的 config.yml 文件: model: # https://huggingface.co/turboderp/Qwen3.8-27B-exl3 model_name: Qwen3.8-27B-exl3-5.0bpw model_dir: /home/ccidral/ai/models max_seq_len: 102400 cache_size: 102400 cache_mode: Q8 gpu_split_auto: true tensor_parallel: true tensor_parallel_backend: native reasoning: true reasoning_start_token: "" reasoning_end_token: "</think>" tool_format: qwen3_coder draft_model: draft_mode: mtp draft_cache_mode: Q8 network: host: 127.0.0.1 port: 5000 如你所见,它使用了张量并行。关于显存使用,3060 上还剩 1.3GB,5060 上还剩 0.6GB,这是我还在尝试通过手动调整 GPU 分割来修复的,但出于某些原因,推理引擎会失控并挂起。我认为平衡得不错,但我的桌面环境占用约 1GB 显存,我认为这导致了不平衡(我正考虑更换为带有集成显卡的 CPU)。我已经用它来编写了一个使用 ratatui 的小型 Rust TUI 应用。效果很好。我非常满意,但如果你看到任何改进空间或更经过实战检验的替代方案,请随时分享。也很乐意回答任何问题。
查看原文

相似文章

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。