@wildmindai: Qwen Image 2.1 Frame-Lock LoRA 将编辑固定到原始帧,确保没有偏移; - 相同提示/编辑,零移动 - …

X AI KOLs Timeline 模型

摘要

Qwen Image 2.1 Consistency LoRA 是一种在编辑过程中保持图像一致性的工具,能防止AI图像生成工作流中的偏移和不必要的重绘。

Qwen Image 2.1 Frame-Lock LoRA 将编辑固定到原始帧,确保没有偏移; - 相同提示/编辑,零移动 - 防止高度/侧向/种子漂移和不必要的重绘;漫画/动漫风格重绘可能仍有≤12.9像素的微小偏移;英语训练 https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA…
查看原文
查看缓存全文

缓存时间: 2026/09/29 05:50

Qwen Image 2.1 Frame-Lock LoRA 将编辑内容固定到原始帧上,确保零偏移;

  • 使用相同提示词/编辑操作,图像完全不发生位移
  • 阻止高度、横向或种子值的漂移以及不必要的重绘 漫画/动漫风格化可能仍会产生≤12.9像素的微调偏移 英文训练模型 https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA…

ausboss/Qwen-Image-2.1-Consistency-LoRA · Hugging Face

来源:https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#qwen-image-21-consistency-loraQwen Image 2.1 一致性 LoRA

**更新(2026年9月28日):**我在大量编辑对上训练此模型以增强像素一致性,结果发现数据集可能在某些特定类型的编辑上过拟合。我注意到它忽略了运动变化,例如新姿势或转头动作。等我整理好数据集后计划尝试制作v2版本。在此之前您可以试用我上传的两个工作流:

  • qwen\-image\-2\.1\-edit\-consistency\.json(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/resolve/main/workflows/qwen-image-2.1-edit-consistency.json?download=true):启用此LoRA进行普通编辑
  • qwen\-image\-2\.1\-edit\-realign\.json(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/resolve/main/workflows/qwen-image-2.1-edit-realign.json?download=true):关闭LoRA,使用“源图对齐“节点将编辑内容重新与您的图像对齐。需要移动元素的编辑请尝试这个版本。 这些工作流基于我的节点(AusBoss (https://github.com/ausboss/ComfyUI-AusBoss),版本2.3.0或更高)。您可以自由替换为任何其他节点。

Qwen Image 2.1 的编辑内容无法固定在指定位置。要求生成水彩、漫画或动漫版本时,图像往往会高度增加几个百分点,有时会横向偏移,且每个种子值结果都不同:腰带位置下降40像素,面部与原始图像不再对齐。进行局部编辑时,它还会重绘未要求修改的部分(发丝、标识、纹理)。这款LoRA能将编辑固定在原始框架内:相同提示词、相同编辑,内容完全不发生位移。

无需触发词。加载后照常编写编辑指令。此模型也可在Civitai下载(https://civitai.com/models/2969143/qwen-image-21-consistency-lora-edits-that-dont-move)。

CRT墙水彩效果:未使用LoRA时画作高度增加5%;使用后腰带保持在原始位置(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_crt_watercolor.jpg) 虚线标记原始图像中特征的位置;箭头表示移动距离。每列使用相同提示词和种子值,在ComfyUI中通过Comfy-Org INT8 Qwen Image 2.1模型渲染(25步,CFG 1,euler/simple采样器)。所有图片均未参与训练集。

街角漫画效果:普通Qwen将场景拉伸3.9%;锥尖下降21像素(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_street_comic.jpg)

沿海公路漫画效果:普通Qwen将场景高度增加5%,地平线上升25像素;使用LoRA后保持原位(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_road_comic.jpg)

街角添加开衫:未使用LoRA时9%的周边区域被重绘;使用后仅2%(https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA/blob/main/drift_street_cardigan.jpg)

局部编辑:两者都完成修改,但未使用LoRA时Qwen会额外重绘头发、店铺招牌和交通灯。变化对比图在将渲染图与原图对齐后进行比较,因此显示的是重绘而非漂移。

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#files文件说明

文件说明: qwen\-image\-2\.1\-consistency\.safetensors第1500步,推荐首选保持Qwen原有视觉风格 qwen\-image\-2\.1\-consistency\-2000\.safetensors第2000步:对齐精度最高;生成的绘画效果会略显苍白

秩32,ComfyUI键名格式(diffusion\_model\.transformer\_blocks\.\*),全部384个张量可加载至Comfy-Org Qwen Image 2.1权重

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#1500-or-20001500步与2000步对比

留出编辑样本,普通Qwen 2.1与LoRA效果对比:

编辑类型无LoRA1500步2000步
风格化(36组):最差角落偏移(中位数)24.3像素1.6像素0.9像素
风格化:最差角落偏移(最坏情况)61.1像素12.9像素3.5像素
偏移小于3像素的风格化比例3%75%97%
风格化(15组):视觉相似度对比(色差值,越低越相似)7.0*6.310.9
重光照与局部编辑(12组):最差角落偏移(中位数)0.7像素0.1像素0.1像素

*普通Qwen的两个不同种子值结果差异为7.0,因此1500步风格化结果与普通Qwen的相似度,等同于普通Qwen自身的相似度。2000步对齐更精确但会漂移风格:纸张更白,墨水与水粉色彩减弱。

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#only-the-thing-you-asked-for-changes仅修改指定内容

18组针对人物照片的重色与移除编辑(背包、帽子、冲浪板、夹克颜色)。每张渲染图均与原图对齐后计算重绘区域(非漂移):

编辑对象外部区域无LoRA1500步2000步
明显变化像素(ΔE > 5)比例12.8%7.5%7.5%
峰值信噪比(相对原图)27.7 dB31.6 dB31.7 dB

参考:仅通过Qwen 2.1 VAE编解码一张图像约改变2%像素(37 dB),此为基准下限。所有18组编辑在启用/禁用LoRA时均能完成指定修改。

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#comfyuiComfyUI集成

该工具包中的Qwen Image 2.1编辑示例(https://github.com/ausboss/ComfyUI-AusBoss/tree/main/example_workflows)即为这些数据的来源工作流。要将LoRA添加到任何Qwen Image 2.1编辑图中:

  1. LoraLoaderModelOnly节点放置在模型加载器之后,强度设为1.0(降低强度会让部分漂移回归)
  2. Text Encode Qwen Image 2.1:将您的图像设为image\_1,resolution设为0,编辑指令作为提示词
  3. KSampler节点连接编码器的latent输出:25步,CFG 1,euler/simple,降噪强度1.0。在此latent空间采样。其他尺寸的latent会导致Qwen按比例缩放图像,且任何LoRA都无法修正
  4. VAE Decode→Split Image with Alpha(Qwen 2.1 VAE解码输出为RGBA格式)

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#training训练细节

  • 使用ostris/ai-toolkit(https://github.com/ostris/ai-toolkit),arch: qwen\_image\_2,Comfy-Org INT8卷积基础模型,参考图像与目标保持尺寸一致(match\_target\_res)
  • 训练数据:950组编辑对,来自257张图片:110张为本项目专门使用Qwen Image 2.1渲染的人像,133张来自Unsplash(https://unsplash.com/license)(通过unsplash-lite(https://huggingface.co/datasets/1aurent/unsplash-lite)数据集),14张作者精选的参考文件夹图片
  • 每组数据起始均为真实Qwen Image 2.1编辑结果:风格化、重光照、季节变换、照片风格、新背景、服装替换、色彩调整、发型、配饰、物体编辑。测量编辑漂移后进行修正,确保每个目标图像与其源图像框架对齐:
    • 正向对(原图→编辑图):将原图移动到编辑图框架内,编辑图作为未修改目标
    • 反向对(编辑图→原图,“将这张水彩转为照片”):将编辑图移动到原图框架内,未修改的原图作为目标
    • 局部编辑保留编辑对象外部的所有原始像素。目标图像从不重采样。风格化使用两个种子值渲染并保留其一。所有编辑经人工检查,排除33组(弱风格化、扭曲图像的绘画、可能被解读为未满18岁的主体);自动检查进一步排除76组修正后仍存在偏差的对
  • 说明文字即为编辑指令本身,约三分之一后面附带“保持构图“样式短语。说明文字丢弃率0
  • 秩32 / 缩放系数32,AdamW8bit优化器,学习率1e-4恒定,批处理1,使用shift时间步,resolution: 1408(32像素网格下处理0.9-1.5百万像素图像对,无需缩放),在单块H100上训练3000步(约1.9秒/步),每250步保存检查点。第500步已可用;1500步是最佳平衡点

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#limits局限性

  • 在约1百万像素分辨率及上述设置下测试。尚未测试4/8步加速LoRA、2百万像素分辨率或CFG大于1的情况
  • 漫画和动漫风格化会重绘所有轮廓线,因此某些形状仍会自行偏移数像素(1500步最差情况为角落偏移12.9像素)
  • 仅固定图像位置,不会增强弱编辑效果。若普通Qwen无法完成的编辑,此LoRA同样无法实现
  • 训练指令均为英文

https://huggingface.co/ausboss/Qwen-Image-2.1-Consistency-LoRA#license许可证

适用于Qwen Image 2.1的LoRA模型,遵循Qwen Research License;基础模型及其配合使用均需遵守该许可协议。

相似文章

Qwen/Qwen-Image-2.1

Hugging Face Models Trending

Qwen-Image-2.1是一个开源的统一文本到图像和图像编辑模型,拥有70亿参数,具有高效的架构、透明度支持和多功能的编辑能力。

Qwen-Image-2.0 技术报告

Hugging Face Daily Papers

Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。