@superalesha: 你们大多数人可能不知道一个8.4GB的模型在12GB RTX 3080 Ti上能做什么。Qwen3.8-27B制作了这个体素日本宝塔花园……

X AI KOLs Timeline 新闻

摘要

展示了Qwen3.8-27B AI模型在12GB RTX 3080 Ti GPU上的性能,使用llama.cpp在特定量化设置下,在128K上下文中达到每秒47个令牌。

你们大多数人可能不知道一个8.4GB的模型在12GB RTX 3080 Ti上能做什么。 Qwen3.8-27B制作了这个体素日本宝塔花园。有昼夜光照。真实的阴影。樱花树。灯笼。它甚至在池塘里放了锦鲤。看着夜晚过去,我放大了池塘,因为我不敢相信鱼真的在那里。 量化是ISTA-DASLab GSQ-RCO IQ2_XS。磁盘上8.4GB,2.50 bpw真实平均值,131072上下文,使用q4_0 KV。 在128K上下文中解码速度为47令牌/秒。 在131K预填充速度为695令牌/秒。 40分钟测试保持在46.6到46.8令牌/秒。峰值349W,70°C。 llama.cpp提交2cdae80,在Windows + WSL2上,为sm_86构建。加载后,卡使用12029 MiB,58 MiB空闲。空间如此紧张。 运行时的精确命令,复制它: ./build/bin/llama-server \ -m ~/models/Qwen3.8-27B-GSQ-RCO-IQ2_XS.gguf \ --mmproj ~/models/mmproj-Qwen3.8-27B-BF16.gguf \ --no-mmproj-offload \ -ngl 99 \ -c 131072 \ -fa on \ --cache-type-k q4_0 --cache-type-v q4_0 \ -ub 256 \ --jinja \ --alias qwen3.8-27b-iq2xs \ --host 0.0.0.0 --port 8080 一个12GB的游戏GPU。一个8.4GB的模型。在128K上下文中47令牌/秒。
查看原文
查看缓存全文

缓存时间: 2026/09/03 20:15

你们大多不知道8.4GB模型在12GB显存的RTX 3080 Ti上能实现什么效果。

Qwen3.8-27B生成了这座体素风格的日本庭院。包含昼夜光照、真实阴影、樱花树与灯笼。它甚至在池塘里放了锦鲤。当镜头推近池塘时,我简直不敢相信这些鱼真的存在——所以记录下了夜幕降临的全过程。

本次使用的量化方案为ISTA-DASLab GSQ-RCO IQ2_XS。模型磁盘占用8.4GB,真实平均位宽2.50 bpw,搭配q4_0 KV缓存实现131072上下文长度。

  • 在128K上下文下解码速度达47 tok/s
  • 131K上下文预填充速度达695 tok/s
  • 40分钟持续运行中稳定保持46.6-46.8 tok/s
  • 峰值功耗349W,温度70°C

测试环境:Windows + WSL2系统下的llama.cpp(提交版本2cdae80),编译目标为sm_86架构。加载模型后显存占用12029 MiB,仅剩余58 MiB可用——适配精度已到极限。

以下是本次运行的完整命令,可直接复制使用:

./build/bin/llama-server
-m ~/models/Qwen3.8-27B-GSQ-RCO-IQ2_XS.gguf
–mmproj ~/models/mmproj-Qwen3.8-27B-BF16.gguf
–no-mmproj-offload
-ngl 99
-c 131072
-fa on
–cache-type-k q4_0 –cache-type-v q4_0
-ub 256
–jinja
–alias qwen3.8-27b-iq2xs
–host 0.0.0.0 –port 8080

仅凭一块12GB游戏显卡,承载8.4GB模型,在128K上下文下实现47 tok/s推理速度。

相似文章

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。