@BenjaminDEKR: 这里是我对NVIDIA 5070 Ti GPU(16GB显存)上Qwen-Image-2.1的测试结果 它能运行,并且相当快。大约25秒生成1024²图像…
摘要
在NVIDIA 5070 Ti GPU上对Qwen-Image-2.1的测试表明,它能在16GB显存内运行,生成1024²图像的时间约为25秒,并突出了出色的提示词遵循和排版能力。
查看缓存全文
缓存时间: 2026/09/20 17:22
以下是我使用 NVIDIA 5070 Ti GPU(16GB 显存)测试 Qwen-Image-2.1 的结果
它可以运行,而且速度相当快。
生成一张 1024² 分辨率的图像需要约 25 秒,共 20 步。显存峰值达到 13.9/15.9 GB。
有三点令我意外:
-
在 DiT 上使用 FP8 反而更慢。每步耗时从 1.23 秒增加到 1.37 秒——性能下降约 11%。虽然它节省了 4GB 显存(从 13.9GB 降至 9.9GB),但仅权重量化的 FP8 在每次矩阵乘法时都需要进行反量化。这是一种内存与速度的权衡,并非性能提升。除非需要额外显存空间,否则建议使用 bf16。
-
步数越多,每步平均耗时反而越低。从 20 步增加到 40 步时,每步耗时从 1.23 秒降至 1.12 秒。固定成本(文本编码、PCIe 模块交换、VAE 解码)得以分摊。
-
“7B”参数量模型仅占下载量的一半多。文本编码器拥有约 87.5 亿参数——比 70 亿参数的 DiT 更大。其文件大小为 16.3GB,而 DiT 为 13.25GB。总计约 31GB。
文本编码器才是真正的瓶颈:在 bf16 精度下,其显存占用超过了整张显卡容量,因此 enable_model_cpu_offload() 无法将其置入。而使用 FP8 后降至约 8.8GB,这才使得标准的 CPU 卸载流程得以运行。
提示词遵循度非常出色。首次生成即准确呈现了三个罐子(左侧红弹珠、中间柠檬、右侧空置)和右侧的黑猫,数量、属性关联及左/中/右布局均完全正确。
文字排版同样稳定:“KYOTO” + “AUTUMN 1962” 通过 FP8 编码器也能清晰渲染。
2048² 分辨率可以运行,但性能骤降:每步耗时 7.29 秒,单图生成需 146 秒。
通义千问 (@Alibaba_Qwen): 全新 Qwen-Image-2.1 现已开源!作为通义万象系列中平衡性与性价比最优的图像生成模型,它兼具生成与编辑功能,以轻量化架构实现顶尖质量。🎨
核心亮点:👀
- 紧凑高速,性能卓越:
相似文章
@BenjaminDEKR: 我现在正在用一块 5070 Ti(16GB 显存)进行测试,目前的表现真的非常令人印象深刻。
一名用户正在使用 NVIDIA 5070 Ti GPU 测试新发布的 Ternary Bonsai 2 27B AI 模型,这是 Qwen3.8 27B 的更小且量化版本,并对其性能感到印象深刻。
我在有限显存(16-20GB)上对 Qwen 3.8 27B 的测试
本文测试了在有限显存环境下各种量化版本的 Qwen 3.8 27B AI 模型,比较了它们在动画生成、应用开发和单词生成等任务上的表现。
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
有人在5070ti(16GB)上运行qwen 3.8 27b吗?
用户询问在配备16GB显存的5070ti GPU上使用量化运行Qwen 3.8 27b模型是否可行,主要用于智能体编码。