@superalesha: 你们大多数人可能不知道一个8.4GB的模型在12GB RTX 3080 Ti上能做什么。Qwen3.8-27B制作了这个体素日本宝塔花园……
摘要
展示了Qwen3.8-27B AI模型在12GB RTX 3080 Ti GPU上的性能,使用llama.cpp在特定量化设置下,在128K上下文中达到每秒47个令牌。
查看缓存全文
缓存时间: 2026/09/03 20:15
你们大多不知道8.4GB模型在12GB显存的RTX 3080 Ti上能实现什么效果。
Qwen3.8-27B生成了这座体素风格的日本庭院。包含昼夜光照、真实阴影、樱花树与灯笼。它甚至在池塘里放了锦鲤。当镜头推近池塘时,我简直不敢相信这些鱼真的存在——所以记录下了夜幕降临的全过程。
本次使用的量化方案为ISTA-DASLab GSQ-RCO IQ2_XS。模型磁盘占用8.4GB,真实平均位宽2.50 bpw,搭配q4_0 KV缓存实现131072上下文长度。
- 在128K上下文下解码速度达47 tok/s
- 131K上下文预填充速度达695 tok/s
- 40分钟持续运行中稳定保持46.6-46.8 tok/s
- 峰值功耗349W,温度70°C
测试环境:Windows + WSL2系统下的llama.cpp(提交版本2cdae80),编译目标为sm_86架构。加载模型后显存占用12029 MiB,仅剩余58 MiB可用——适配精度已到极限。
以下是本次运行的完整命令,可直接复制使用:
./build/bin/llama-server
-m ~/models/Qwen3.8-27B-GSQ-RCO-IQ2_XS.gguf
–mmproj ~/models/mmproj-Qwen3.8-27B-BF16.gguf
–no-mmproj-offload
-ngl 99
-c 131072
-fa on
–cache-type-k q4_0 –cache-type-v q4_0
-ub 256
–jinja
–alias qwen3.8-27b-iq2xs
–host 0.0.0.0 –port 8080
仅凭一块12GB游戏显卡,承载8.4GB模型,在128K上下文下实现47 tok/s推理速度。
相似文章
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。
Qwen3.8-Flash 在 RTX3090 + 64GB RAM 上运行(但你只需 12GB VRAM)
本文提供了在 RTX 3090 和 64GB RAM 上运行 Qwen3.8-Flash AI 模型的详细指南,讨论了性能指标、量化设置以及使用 llamacpp 等工具的部署步骤。
Qwen3.6-35B-A3B Q4 262k上下文,8GB 3070 Ti上可达+30tps
作者分享了在8GB RTX 3070 Ti上使用llama.cpp运行Qwen3.6-35B-A3B MoE模型,实现高达262k上下文、30+tps的详细调优技巧,并指出从Windows切换到Ubuntu Server后速度提升了25%。
@rohanpaul_ai: 精美的视觉展示,有人在本地运行 Qwen 3.8 27B,使用 RTX 5090 32 GB 显存系统,速度达到 115 tokens/秒 注意,Qw…
推文重点介绍了在 RTX 5090 系统上本地运行 Qwen 3.8 27B 模型,配备 32GB 显存,达到 115 tokens/秒的速度,并指出官方 BF16 检查点大小为 55.6GB。
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。