RetroCraft - Qwen 3.8 27B Q8,双路3090显卡单次运行提供精确性能数据。

Reddit r/LocalLLaMA 模型

摘要

以下是在双块英伟达3090显卡上运行Qwen 3.8 27B Q8模型的性能演示:通过单次指令生成名为RetroCraft的《我的世界》仿制游戏,包含详细的Token处理与生成速度分析。

以上演示视频仅使用 Qwen 3.8 27B Q8_K_XL 通过单条提示词生成。提示词要求:"创建一个名为RetroCraft的单页HTML/JS/CSS GeoCities风格、激光波效果、80年代复古风、Minecraft克隆游戏,并将其打包为可运行的单体Go二进制文件。"Opencode仅用几分钟就完成了编码,无需任何调整即运行成功。今天将展示大量内容和演示,但我想先公布完整运行过程的性能数据:提示处理速度、生成速度及输入/输出token数。llama-swap提供了基础性能轨迹数据,可见不同轮次在提示处理和生成阶段存在性能差异: | ID | 缓存提示 | 提示速度 | 生成速度 | 耗时 | 备注 | |------|----------|----------|----------|---------|-------------------| | 251 | 43,473 | 142.46 t/s | 48.76 t/s | 2.76s | 最终版本 | | 250 | 43,186 | 128.22 t/s | 43.94 t/s | 5.46s | | | 249 | 42,757 | 311.94 t/s | 40.11 t/s | 5.37s | 优化CLI参数提示 | | 248 | 42,554 | 10.23 t/s | 45.61 t/s | 5.80s | 完成运行 | | 247 | 42,478 | 31.27 t/s | 41.36 t/s | 2.24s | | | 246 | 41,330 | 91.89 t/s | 45.97 t/s | 23.07s | | | 245 | 41,217 | 161.66 t/s | 40.34 t/s | 4.84s | | | 244 | 41,007 | 32.43 t/s | 65.54 t/s | 3.71s | | | 243 | 40,720 | 168.56 t/s | 73.83 t/s | 3.29s | | | 242 | 40,032 | 464.05 t/s | 77.38 t/s | 3.50s | | | 241 | 39,375 | 233.86 t/s | 59.97 t/s | 4.22s | | | 240 | 39,194 | 256.77 t/s | 39.97 t/s | 13.69s | | | 239 | 38,927 | 63.91 t/s | 49.08 t/s | 5.45s | | | 238 | 38,719 | 49.58 t/s | 44.10 t/s | 4.82s | | | 237 | 38,185 | 229.21 t/s | 42.34 t/s | 9.75s | | | 236 | 37,818 | 89.87 t/s | 52.56 t/s | 6.72s | | | 235 | 37,525 | 257.00 t/s | 39.58 t/s | 3.59s | | | 234 | 37,317 | 33.91 t/s | 62.15 t/s | 3.79s | | | 233 | 37,221 | 33.86 t/s | 49.58 t/s | 2.30s | | | 232 | 36,801 | 33.45 t/s | 55.57 t/s | 7.94s | | | 231 | 28,668 | 294.62 t/s | 71.03 t/s | 112.68s | | | 230 | 28,342 | 198.16 t/s | 51.91 t/s | 4.77s | 开始执行代理任务 | | 229 | 8,931 | 70.58 t/s | 40.89 t/s | 475.21s | 初始提示与推理...进行了大量思考 | 以下是我的llama-swap配置。本次运行在OpenCode中使用`Q3.8-27B-MTP:preserve-thinking-coding`配置,我发现保留推理token能显著提升结果质量: ```yaml macros: "server-latest": | /path/to/llama-server/llama-server-latest --host 0.0.0.0 --port ${PORT} -ngl 999 -ngld 999 --no-mmap --no-warmup --log-verbosity 4 --fit off "qwen-27B-server": | ${server-latest} --temp 1.0 --min-p 0.0 --top-k 20 --top-p 0.95 --repeat_penalty 1.0 --presence_penalty 0.0 models: Q3.8-27B-MTP: sendLoadingState: false env: - "CUDA_VISIBLE_DEVICES=GPU-6f0,GPU-f10" filters: stripParams: "temperature, top_k, top_p, repeat_penalty, min_p, presence_penalty" setParamsByID: "${MODEL_ID}:thinking-coding": temperature: 0.6 presence_penalty: 0.0 "${MODEL_ID}:preserve-thinking-coding": temperature: 0.6 presence_penalty: 0.0 chat_template_kwargs: preserve_thinking: true enable_thinking: true "${MODEL_ID}:instruct": chat_template_kwargs: enable_thinking: false temperature: 0.7 top_p: 0.8 presence_penalty: 1.0 cmd: | ${qwen-27B-server} --model /path/to/models/Qwen3.8-27B-UD-Q8_K_XL.gguf # 完整上下文略超容量 --ctx-size 238000 --kv-unified --spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0.75 --tensor-split 50,50 -sm tensor -np 2 --batch-size 4096 --ubatch-size 512 ``` 代码及高清视频请访问:https://github.com/mostlygeek/retrocraft
查看原文

相似文章

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。