@wildmindai: Qwen Image 2.1 Frame-Lock LoRA 将编辑固定到原始帧,确保没有偏移; - 相同提示/编辑,零移动 - …
摘要
Qwen Image 2.1 Consistency LoRA 是一种在编辑过程中保持图像一致性的工具,能防止AI图像生成工作流中的偏移和不必要的重绘。
查看缓存全文
缓存时间: 2026/09/29 05:50
Qwen Image 2.1 Frame-Lock LoRA 将编辑内容固定到原始帧上,确保零偏移;
- 使用相同提示词/编辑操作,图像完全不发生位移
- 阻止高度、横向或种子值的漂移以及不必要的重绘 漫画/动漫风格化可能仍会产生≤12.9像素的微调偏移 英文训练模型 https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA…
ausboss/Qwen-Image-2.1-Consistency-LoRA · Hugging Face
来源:https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#qwen-image-21-consistency-loraQwen Image 2.1 一致性 LoRA
**更新(2026年9月28日):**我在大量编辑对上训练此模型以增强像素一致性,结果发现数据集可能在某些特定类型的编辑上过拟合。我注意到它忽略了运动变化,例如新姿势或转头动作。等我整理好数据集后计划尝试制作v2版本。在此之前您可以试用我上传的两个工作流:
qwen\-image\-2\.1\-edit\-consistency\.json(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/resolve/main/workflows/qwen-image-2.1-edit-consistency.json?download=true):启用此LoRA进行普通编辑qwen\-image\-2\.1\-edit\-realign\.json(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/resolve/main/workflows/qwen-image-2.1-edit-realign.json?download=true):关闭LoRA,使用“源图对齐“节点将编辑内容重新与您的图像对齐。需要移动元素的编辑请尝试这个版本。 这些工作流基于我的节点(AusBoss (https://github.com/ausboss/ComfyUI-AusBoss),版本2.3.0或更高)。您可以自由替换为任何其他节点。
Qwen Image 2.1 的编辑内容无法固定在指定位置。要求生成水彩、漫画或动漫版本时,图像往往会高度增加几个百分点,有时会横向偏移,且每个种子值结果都不同:腰带位置下降40像素,面部与原始图像不再对齐。进行局部编辑时,它还会重绘未要求修改的部分(发丝、标识、纹理)。这款LoRA能将编辑固定在原始框架内:相同提示词、相同编辑,内容完全不发生位移。
无需触发词。加载后照常编写编辑指令。此模型也可在Civitai下载(https://civitai.com/models/2969143/qwen-image-21-consistency-lora-edits-that-dont-move)。
CRT墙水彩效果:未使用LoRA时画作高度增加5%;使用后腰带保持在原始位置(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_crt_watercolor.jpg) 虚线标记原始图像中特征的位置;箭头表示移动距离。每列使用相同提示词和种子值,在ComfyUI中通过Comfy-Org INT8 Qwen Image 2.1模型渲染(25步,CFG 1,euler/simple采样器)。所有图片均未参与训练集。
街角漫画效果:普通Qwen将场景拉伸3.9%;锥尖下降21像素(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_street_comic.jpg)
沿海公路漫画效果:普通Qwen将场景高度增加5%,地平线上升25像素;使用LoRA后保持原位(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_road_comic.jpg)
街角添加开衫:未使用LoRA时9%的周边区域被重绘;使用后仅2%(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_street_cardigan.jpg)
局部编辑:两者都完成修改,但未使用LoRA时Qwen会额外重绘头发、店铺招牌和交通灯。变化对比图在将渲染图与原图对齐后进行比较,因此显示的是重绘而非漂移。
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#files文件说明
文件说明:
qwen\-image\-2\.1\-consistency\.safetensors第1500步,推荐首选保持Qwen原有视觉风格
qwen\-image\-2\.1\-consistency\-2000\.safetensors第2000步:对齐精度最高;生成的绘画效果会略显苍白
秩32,ComfyUI键名格式(diffusion\_model\.transformer\_blocks\.\*),全部384个张量可加载至Comfy-Org Qwen Image 2.1权重
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#1500-or-20001500步与2000步对比
留出编辑样本,普通Qwen 2.1与LoRA效果对比:
| 编辑类型 | 无LoRA | 1500步 | 2000步 |
|---|---|---|---|
| 风格化(36组):最差角落偏移(中位数) | 24.3像素 | 1.6像素 | 0.9像素 |
| 风格化:最差角落偏移(最坏情况) | 61.1像素 | 12.9像素 | 3.5像素 |
| 偏移小于3像素的风格化比例 | 3% | 75% | 97% |
| 风格化(15组):视觉相似度对比(色差值,越低越相似) | 7.0* | 6.3 | 10.9 |
| 重光照与局部编辑(12组):最差角落偏移(中位数) | 0.7像素 | 0.1像素 | 0.1像素 |
*普通Qwen的两个不同种子值结果差异为7.0,因此1500步风格化结果与普通Qwen的相似度,等同于普通Qwen自身的相似度。2000步对齐更精确但会漂移风格:纸张更白,墨水与水粉色彩减弱。
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#only-the-thing-you-asked-for-changes仅修改指定内容
18组针对人物照片的重色与移除编辑(背包、帽子、冲浪板、夹克颜色)。每张渲染图均与原图对齐后计算重绘区域(非漂移):
| 编辑对象外部区域 | 无LoRA | 1500步 | 2000步 |
|---|---|---|---|
| 明显变化像素(ΔE > 5)比例 | 12.8% | 7.5% | 7.5% |
| 峰值信噪比(相对原图) | 27.7 dB | 31.6 dB | 31.7 dB |
参考:仅通过Qwen 2.1 VAE编解码一张图像约改变2%像素(37 dB),此为基准下限。所有18组编辑在启用/禁用LoRA时均能完成指定修改。
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#comfyuiComfyUI集成
该工具包中的Qwen Image 2.1编辑示例(https://github.com/ausboss/ComfyUI-AusBoss/tree/main/example_workflows)即为这些数据的来源工作流。要将LoRA添加到任何Qwen Image 2.1编辑图中:
- LoraLoaderModelOnly节点放置在模型加载器之后,强度设为1.0(降低强度会让部分漂移回归)
- Text Encode Qwen Image 2.1:将您的图像设为
image\_1,resolution设为0,编辑指令作为提示词 - KSampler节点连接编码器的
latent输出:25步,CFG 1,euler/simple,降噪强度1.0。在此latent空间采样。其他尺寸的latent会导致Qwen按比例缩放图像,且任何LoRA都无法修正 - VAE Decode→Split Image with Alpha(Qwen 2.1 VAE解码输出为RGBA格式)
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#training训练细节
- 使用ostris/ai-toolkit(https://github.com/ostris/ai-toolkit),
arch: qwen\_image\_2,Comfy-Org INT8卷积基础模型,参考图像与目标保持尺寸一致(match\_target\_res) - 训练数据:950组编辑对,来自257张图片:110张为本项目专门使用Qwen Image 2.1渲染的人像,133张来自Unsplash(https://unsplash.com/license)(通过unsplash-lite(https://huggingface.co/datasets/1aurent/unsplash-lite)数据集),14张作者精选的参考文件夹图片
- 每组数据起始均为真实Qwen Image 2.1编辑结果:风格化、重光照、季节变换、照片风格、新背景、服装替换、色彩调整、发型、配饰、物体编辑。测量编辑漂移后进行修正,确保每个目标图像与其源图像框架对齐:
- 正向对(原图→编辑图):将原图移动到编辑图框架内,编辑图作为未修改目标
- 反向对(编辑图→原图,“将这张水彩转为照片”):将编辑图移动到原图框架内,未修改的原图作为目标
- 局部编辑保留编辑对象外部的所有原始像素。目标图像从不重采样。风格化使用两个种子值渲染并保留其一。所有编辑经人工检查,排除33组(弱风格化、扭曲图像的绘画、可能被解读为未满18岁的主体);自动检查进一步排除76组修正后仍存在偏差的对
- 说明文字即为编辑指令本身,约三分之一后面附带“保持构图“样式短语。说明文字丢弃率0
- 秩32 / 缩放系数32,AdamW8bit优化器,学习率1e-4恒定,批处理1,使用
shift时间步,resolution: 1408(32像素网格下处理0.9-1.5百万像素图像对,无需缩放),在单块H100上训练3000步(约1.9秒/步),每250步保存检查点。第500步已可用;1500步是最佳平衡点
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#limits局限性
- 在约1百万像素分辨率及上述设置下测试。尚未测试4/8步加速LoRA、2百万像素分辨率或CFG大于1的情况
- 漫画和动漫风格化会重绘所有轮廓线,因此某些形状仍会自行偏移数像素(1500步最差情况为角落偏移12.9像素)
- 仅固定图像位置,不会增强弱编辑效果。若普通Qwen无法完成的编辑,此LoRA同样无法实现
- 训练指令均为英文
https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#license许可证
适用于Qwen Image 2.1的LoRA模型,遵循Qwen Research License;基础模型及其配合使用均需遵守该许可协议。
相似文章
@_akhaliq: Pruna-Qwen-Image-2.1 是一组少步 LoRA 适配器,使 Qwen-Image-2.1 的图像生成速度提高多达 6.3 倍 …
Pruna-Qwen-Image-2.1 是一组 LoRA 适配器,可显著加快 Qwen-Image-2.1 中的图像生成和编辑,将步数从 40 步减少到 5 或 8 步,性能提升高达 6.3 倍。
Qwen/Qwen-Image-2.1
Qwen-Image-2.1是一个开源的统一文本到图像和图像编辑模型,拥有70亿参数,具有高效的架构、透明度支持和多功能的编辑能力。
Qwen-Image-2.0 技术报告
Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。
我为TensorSharp添加了Qwen-Image 2.1和LoRA支持(GGUF,本地推理)
TensorSharp作为一个开源推理引擎,现已支持使用LoRA适配器在本地进行Qwen-Image 2.1的文本到图像生成与编辑,包括Pruna和Viggle等加速变体。
Qwen-Image-2.1:紧凑、高效且统一的图像生成
Qwen-Image-2.1是一款紧凑高效的AI模型,专为统一图像生成而设计,由阿里巴巴打造,旨在提升图像生成任务的性能和可用性。