@BenjaminDEKR: 这里是我对NVIDIA 5070 Ti GPU(16GB显存)上Qwen-Image-2.1的测试结果 它能运行,并且相当快。大约25秒生成1024²图像…

X AI KOLs Timeline 模型

摘要

在NVIDIA 5070 Ti GPU上对Qwen-Image-2.1的测试表明,它能在16GB显存内运行,生成1024²图像的时间约为25秒,并突出了出色的提示词遵循和排版能力。

以下是我对NVIDIA 5070 Ti GPU(16GB显存)上Qwen-Image-2.1的测试结果 它能运行,并且相当快。 生成1024²图像,20步,约25秒。显存峰值13.9/15.9 GB。 三件让我惊讶的事情: 1. DiT上的FP8更慢。1.37 vs 1.23 s/步 —— 慢约11%。节省4GB(13.9→9.9),但仅权重的FP8需要在每次矩阵乘法时进行反量化。这是内存权衡,而非速度优势。除非需要额外空间,否则使用bf16。 2. 更多步骤每步成本更低。从20步到40步,1.23 → 1.12 s/步。固定成本(文本编码、PCIe模块交换、VAE解码)摊销了。 3. "7B"模型下载量不到一半。文本编码器约8.75B参数——比7B DiT更大。16.3GB vs 13.25GB。总计约31GB。 那个编码器才是真正的限制:在bf16下,它超出了整个显卡,所以enable_model_cpu_offload()无法放置它。FP8将其降至约8.8GB,这使得标准卸载路径得以工作。 提示词遵循出色。三个罐子(左红色弹珠,中柠檬,右空,右边黑猫)计数、属性绑定和左/中/右顺序首次尝试全部正确。 排版也保持:"KYOTO" + "AUTUMN 1962" 清晰渲染,通过FP8编码器。 2048²可行但代价高:7.29 s/步,146秒/图像。
查看原文
查看缓存全文

缓存时间: 2026/09/20 17:22

以下是我使用 NVIDIA 5070 Ti GPU(16GB 显存)测试 Qwen-Image-2.1 的结果

它可以运行,而且速度相当快。

生成一张 1024² 分辨率的图像需要约 25 秒,共 20 步。显存峰值达到 13.9/15.9 GB。

有三点令我意外:

  1. 在 DiT 上使用 FP8 反而更慢。每步耗时从 1.23 秒增加到 1.37 秒——性能下降约 11%。虽然它节省了 4GB 显存(从 13.9GB 降至 9.9GB),但仅权重量化的 FP8 在每次矩阵乘法时都需要进行反量化。这是一种内存与速度的权衡,并非性能提升。除非需要额外显存空间,否则建议使用 bf16。

  2. 步数越多,每步平均耗时反而越低。从 20 步增加到 40 步时,每步耗时从 1.23 秒降至 1.12 秒。固定成本(文本编码、PCIe 模块交换、VAE 解码)得以分摊。

  3. “7B”参数量模型仅占下载量的一半多。文本编码器拥有约 87.5 亿参数——比 70 亿参数的 DiT 更大。其文件大小为 16.3GB,而 DiT 为 13.25GB。总计约 31GB。

文本编码器才是真正的瓶颈:在 bf16 精度下,其显存占用超过了整张显卡容量,因此 enable_model_cpu_offload() 无法将其置入。而使用 FP8 后降至约 8.8GB,这才使得标准的 CPU 卸载流程得以运行。

提示词遵循度非常出色。首次生成即准确呈现了三个罐子(左侧红弹珠、中间柠檬、右侧空置)和右侧的黑猫,数量、属性关联及左/中/右布局均完全正确。

文字排版同样稳定:“KYOTO” + “AUTUMN 1962” 通过 FP8 编码器也能清晰渲染。

2048² 分辨率可以运行,但性能骤降:每步耗时 7.29 秒,单图生成需 146 秒。

通义千问 (@Alibaba_Qwen): 全新 Qwen-Image-2.1 现已开源!作为通义万象系列中平衡性与性价比最优的图像生成模型,它兼具生成与编辑功能,以轻量化架构实现顶尖质量。🎨

核心亮点:👀

  • 紧凑高速,性能卓越:

相似文章

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。