RetroCraft - Qwen 3.8 27B Q8,双路3090显卡单次运行提供精确性能数据。
摘要
以下是在双块英伟达3090显卡上运行Qwen 3.8 27B Q8模型的性能演示:通过单次指令生成名为RetroCraft的《我的世界》仿制游戏,包含详细的Token处理与生成速度分析。
以上演示视频仅使用 Qwen 3.8 27B Q8_K_XL 通过单条提示词生成。提示词要求:"创建一个名为RetroCraft的单页HTML/JS/CSS GeoCities风格、激光波效果、80年代复古风、Minecraft克隆游戏,并将其打包为可运行的单体Go二进制文件。"Opencode仅用几分钟就完成了编码,无需任何调整即运行成功。今天将展示大量内容和演示,但我想先公布完整运行过程的性能数据:提示处理速度、生成速度及输入/输出token数。llama-swap提供了基础性能轨迹数据,可见不同轮次在提示处理和生成阶段存在性能差异:
| ID | 缓存提示 | 提示速度 | 生成速度 | 耗时 | 备注 |
|------|----------|----------|----------|---------|-------------------|
| 251 | 43,473 | 142.46 t/s | 48.76 t/s | 2.76s | 最终版本 |
| 250 | 43,186 | 128.22 t/s | 43.94 t/s | 5.46s | |
| 249 | 42,757 | 311.94 t/s | 40.11 t/s | 5.37s | 优化CLI参数提示 |
| 248 | 42,554 | 10.23 t/s | 45.61 t/s | 5.80s | 完成运行 |
| 247 | 42,478 | 31.27 t/s | 41.36 t/s | 2.24s | |
| 246 | 41,330 | 91.89 t/s | 45.97 t/s | 23.07s | |
| 245 | 41,217 | 161.66 t/s | 40.34 t/s | 4.84s | |
| 244 | 41,007 | 32.43 t/s | 65.54 t/s | 3.71s | |
| 243 | 40,720 | 168.56 t/s | 73.83 t/s | 3.29s | |
| 242 | 40,032 | 464.05 t/s | 77.38 t/s | 3.50s | |
| 241 | 39,375 | 233.86 t/s | 59.97 t/s | 4.22s | |
| 240 | 39,194 | 256.77 t/s | 39.97 t/s | 13.69s | |
| 239 | 38,927 | 63.91 t/s | 49.08 t/s | 5.45s | |
| 238 | 38,719 | 49.58 t/s | 44.10 t/s | 4.82s | |
| 237 | 38,185 | 229.21 t/s | 42.34 t/s | 9.75s | |
| 236 | 37,818 | 89.87 t/s | 52.56 t/s | 6.72s | |
| 235 | 37,525 | 257.00 t/s | 39.58 t/s | 3.59s | |
| 234 | 37,317 | 33.91 t/s | 62.15 t/s | 3.79s | |
| 233 | 37,221 | 33.86 t/s | 49.58 t/s | 2.30s | |
| 232 | 36,801 | 33.45 t/s | 55.57 t/s | 7.94s | |
| 231 | 28,668 | 294.62 t/s | 71.03 t/s | 112.68s | |
| 230 | 28,342 | 198.16 t/s | 51.91 t/s | 4.77s | 开始执行代理任务 |
| 229 | 8,931 | 70.58 t/s | 40.89 t/s | 475.21s | 初始提示与推理...进行了大量思考 |
以下是我的llama-swap配置。本次运行在OpenCode中使用`Q3.8-27B-MTP:preserve-thinking-coding`配置,我发现保留推理token能显著提升结果质量:
```yaml
macros:
"server-latest": |
/path/to/llama-server/llama-server-latest --host 0.0.0.0 --port ${PORT} -ngl 999 -ngld 999 --no-mmap --no-warmup --log-verbosity 4 --fit off
"qwen-27B-server": |
${server-latest} --temp 1.0 --min-p 0.0 --top-k 20 --top-p 0.95 --repeat_penalty 1.0 --presence_penalty 0.0
models:
Q3.8-27B-MTP:
sendLoadingState: false
env:
- "CUDA_VISIBLE_DEVICES=GPU-6f0,GPU-f10"
filters:
stripParams: "temperature, top_k, top_p, repeat_penalty, min_p, presence_penalty"
setParamsByID:
"${MODEL_ID}:thinking-coding":
temperature: 0.6
presence_penalty: 0.0
"${MODEL_ID}:preserve-thinking-coding":
temperature: 0.6
presence_penalty: 0.0
chat_template_kwargs:
preserve_thinking: true
enable_thinking: true
"${MODEL_ID}:instruct":
chat_template_kwargs:
enable_thinking: false
temperature: 0.7
top_p: 0.8
presence_penalty: 1.0
cmd: |
${qwen-27B-server} --model /path/to/models/Qwen3.8-27B-UD-Q8_K_XL.gguf # 完整上下文略超容量
--ctx-size 238000 --kv-unified --spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0.75
--tensor-split 50,50 -sm tensor -np 2 --batch-size 4096 --ubatch-size 512
```
代码及高清视频请访问:https://github.com/mostlygeek/retrocraft
相似文章
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
@sudoingX:更新:Qwen 3.6 27b dense q4 在单张 3090 上一次生成了 Octopus Invaders 游戏。Hermes Agent 驱动了整个事…
用户基准测试表明,Qwen 3.6 27B dense 模型(Q4 量化)能够在单张 RTX 3090 上通过单次提示自主生成一个完全可玩的多文件游戏,性能显著优于其前代版本,且无需任何人工干预。测试结果突显了在消费级硬件上本地代码生成和智能体能力方面的重大改进。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。
Qwen3-8B 2.4T 在 Nvidia GB300 NVL72 上达到 288k tokens/s
NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。