Patil/Krea-2-depth-controlnet
摘要
该模型为Krea-2引入了一个深度条件化的ControlNet-LoRA,能够实现深度图引导的图像生成,具有高深度一致性(皮尔逊相关系数0.98-0.99)。它支持Raw和Turbo两种变体,并包含简易推理脚本和Comfy UI集成。
查看缓存全文
缓存时间: 2026/07/09 07:49
Patil/Krea-2-depth-controlnet · Hugging Face
来源:https://huggingface.co/Patil/Krea-2-depth-controlnet
https://huggingface.co/Patil/Krea-2-depth-controlnet#krea-2-depth-controlnet-loraKrea-2 Depth ControlNet-LoRA
面向 Krea-2(https://github.com/krea-ai/krea-2)的深度条件生成。输入任意图像和提示词——它会利用 Depth-Anything-V2 提取深度图,然后生成一张具有相同 3D 结构和构图,但内容和风格完全由你指定的新图像。
- 基于 Krea-2-Raw 训练,可同时用于 Raw 和 Krea-2-Turbo(8 步)模型
- 单个 862MB LoRA 文件(rank 64 + 扩展输入投影),基座模型保持冻结
- 深度一致性(输入深度与生成图像深度的皮尔逊相关系数):无提示词时 0.98,有提示词时 0.99
每张条带图:原始图像 → 提取的深度图 → 生成输出。
https://huggingface.co/Patil/Krea-2-depth-controlnet#examples示例
机器人示例(https://huggingface.co/Patil/Krea-2-depth-controlnet/blob/main/assets/image.webp)
猫变老虎示例(https://huggingface.co/Patil/Krea-2-depth-controlnet/blob/main/assets/image%20%286%29.webp)
https://huggingface.co/Patil/Krea-2-depth-controlnet#checkpoint检查点
https://huggingface.co/Patil/Krea-2-depth-controlnet#comfy-uiComfy UI
如需在 Comfy UI 中使用,请遵循此指南:https://github.com/facok/comfyui-krea2-controlnet
https://huggingface.co/Patil/Krea-2-depth-controlnet#setup安装
`` git clone https://github.com/Tanmaypatil123/Krea-2-controlnet.git cd Krea-2-controlnet pip install -r requirements.txt
hf download Patil/Krea-2-depth-controlnet depth-control-lora.safetensors –local-dir . ``
https://huggingface.co/Patil/Krea-2-depth-controlnet#inference推理
``
Turbo 基座 — 快速,推荐(8 步,无 CFG)
python inference.py photo.jpg -p “a futuristic spaceship interior, cinematic lighting”
–lora depth-control-lora.safetensors
Raw 基座 — 未蒸馏(28-52 步,CFG 3.5)
python inference.py photo.jpg -p “…” –lora depth-control-lora.safetensors
–base raw
无提示词:仅由深度图作为信号
python inference.py photo.jpg –lora depth-control-lora.safetensors –save-strip
较弱的结构遵循(更多创作自由度)
python inference.py photo.jpg -p “…” –lora depth-control-lora.safetensors –lora-scale 0.6 ``
| 标志 | 默认值 | 说明 |
|---|---|---|
-p / --prompt | "" | 空值 = 仅基于深度生成 |
--base | turbo | turbo 或 raw |
--steps | 8(turbo)/ 28(raw) | 步数 |
--cfg | 0(turbo)/ 3.5(raw) | 无分类器引导 |
--mu | 1.15(turbo)/ auto(raw) | 时间步偏移 |
--lora-scale | 1.0 | 控制强度旋钮 |
--seed | 0 | 随机种子 |
--save-strip | 关闭 | 同时保存输入|深度|输出对比图 |
https://huggingface.co/Patil/Krea-2-depth-controlnet#python-apiPython API
`` from PIL import Image from huggingface_hub import hf_hub_download from pipeline import DepthLoRAPipeline
base = hf_hub_download(“krea/Krea-2-Turbo”, “turbo.safetensors”) pipe = DepthLoRAPipeline(base, “depth-control-lora.safetensors”)
out, depth = pipe(Image.open(“photo.jpg”), prompt=“a cozy cabin interior at dusk”, steps=8, cfg=0.0, mu=1.15, seed=0) out.save(“output.png”) ``
https://huggingface.co/Patil/Krea-2-depth-controlnet#how-it-works-inference-path工作原理(推理路径)
- 输入图像被调整到最近的约 1MP 长宽比桶,并经 Depth-Anything-V2-Large 处理 → 得到逆深度图(近处 = 白色)。
- 深度图使用与图像相同的 Qwen-Image VAE 进行编码,因此控制信号位于潜在空间中。
- 在每个去噪步骤中,深度潜在向量按通道拼接到噪声潜在向量上(每个 DiT token:64 → 128 维)。扩展的输入投影以及所有 28 层上的 rank-64 LoRA(均包含在检查点中)引导生成遵循深度结构。
- 否则为标准 Krea-2 流匹配欧拉采样——与 BFL 的 Flux.1-Depth-dev-lora 相同的配方。
https://huggingface.co/Patil/Krea-2-depth-controlnet#tips–limitations提示与限制
- 最佳输入:具有真实透视感的照片/渲染图。扁平的 2D 插图会产生几乎均匀的深度图,因此控制效果会很弱(垃圾进,垃圾出)。
- 空提示词生成有效(深度一致性 0.98)——用于测试仅靠控制信号能携带多少结构信息。
--lora-scale低于 1.0 会放松结构遵循,高于 1.0 则会加强(但会牺牲一些质量)。- Krea-2-Raw 可生成最高约 1K 分辨率;输出受限于约 1MP 的桶大小。
https://huggingface.co/Patil/Krea-2-depth-controlnet#files文件
inference.py— 命令行接口pipeline.py— 完整流水线:LoRA 手术、Qwen3-VL 条件器、VAE、深度估计器、带控制注入的流采样器mmdit.py— 来自 krea-2 仓库(https://github.com/krea-ai/krea-2)的未修改 DiT 定义
模型权重受 Krea 2 社区许可(https://www.krea.ai/krea-2-licensing)约束。训练代码将另行发布。
@Tanmaypatil79(https://x.com/TanmayPatil79),@Shauray7(https://x.com/Shauray7),@edwixxxx(https://x.com/edwixxxx)
相似文章
krea/Krea-2-Turbo
Krea发布了Krea 2 Turbo,一个120亿参数的文本到图像扩散模型,在Hugging Face上开放权重,并支持多个推理库。
Krea 2 技术报告 (59分钟阅读)
Krea 2 是一系列用于创意图像生成的基础模型,构建于大规模数据基础设施和多阶段训练流程之上。它引入了提示扩展器和风格参考系统,以提高可操控性并实现创意探索。
Krea 2 在 Hugging Face 上发布
Krea 2 是一个拥有120亿参数的文本到图像扩散模型,以开放权重形式在 Hugging Face 上发布,提供了 Raw(基础版)和 Turbo(后训练版)检查点。
Krea 2
Krea 2 是一款为增强风格控制和情绪板创建而发布的图像模型。
Krea-2-Turbo 图像模型 - 易于完全无审查,而且还能编辑图像!
Krea-2-Turbo 是一个本地 AI 图像生成模型,能在约 3 秒内生成高质量图像。通过提示重新平衡可以轻松实现无审查,尽管它被宣传为仅文本到图像,但实际上也支持通过遮罩进行图像编辑。