Patil/Krea-2-depth-controlnet

Hugging Face Models Trending 模型

摘要

该模型为Krea-2引入了一个深度条件化的ControlNet-LoRA,能够实现深度图引导的图像生成,具有高深度一致性(皮尔逊相关系数0.98-0.99)。它支持Raw和Turbo两种变体,并包含简易推理脚本和Comfy UI集成。

任务: 图像到图像 标签: controlnet, lora, depth, krea-2, flow-matching, image-to-image, base_model:krea/Krea-2-Raw, base_model:adapter:krea/Krea-2-Raw, 许可证:其他, 区域:us
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:49

Patil/Krea-2-depth-controlnet · Hugging Face

来源:https://huggingface.co/Patil/Krea-2-depth-controlnet

https://huggingface.co/Patil/Krea-2-depth-controlnet#krea-2-depth-controlnet-loraKrea-2 Depth ControlNet-LoRA

面向 Krea-2(https://github.com/krea-ai/krea-2)的深度条件生成。输入任意图像和提示词——它会利用 Depth-Anything-V2 提取深度图,然后生成一张具有相同 3D 结构和构图,但内容和风格完全由你指定的新图像。

  • 基于 Krea-2-Raw 训练,可同时用于 RawKrea-2-Turbo(8 步)模型
  • 单个 862MB LoRA 文件(rank 64 + 扩展输入投影),基座模型保持冻结
  • 深度一致性(输入深度与生成图像深度的皮尔逊相关系数):无提示词时 0.98,有提示词时 0.99

每张条带图:原始图像 → 提取的深度图 → 生成输出。

https://huggingface.co/Patil/Krea-2-depth-controlnet#examples示例

机器人示例(https://huggingface.co/Patil/Krea-2-depth-controlnet/blob/main/assets/image.webp)

猫变老虎示例(https://huggingface.co/Patil/Krea-2-depth-controlnet/blob/main/assets/image%20%286%29.webp)

https://huggingface.co/Patil/Krea-2-depth-controlnet#checkpoint检查点

https://huggingface.co/Patil/Krea-2-depth-controlnet#comfy-uiComfy UI

如需在 Comfy UI 中使用,请遵循此指南:https://github.com/facok/comfyui-krea2-controlnet

https://huggingface.co/Patil/Krea-2-depth-controlnet#setup安装

`` git clone https://github.com/Tanmaypatil123/Krea-2-controlnet.git cd Krea-2-controlnet pip install -r requirements.txt

hf download Patil/Krea-2-depth-controlnet depth-control-lora.safetensors –local-dir . ``

https://huggingface.co/Patil/Krea-2-depth-controlnet#inference推理

``

Turbo 基座 — 快速,推荐(8 步,无 CFG)

python inference.py photo.jpg -p “a futuristic spaceship interior, cinematic lighting”
–lora depth-control-lora.safetensors

Raw 基座 — 未蒸馏(28-52 步,CFG 3.5)

python inference.py photo.jpg -p “…” –lora depth-control-lora.safetensors
–base raw

无提示词:仅由深度图作为信号

python inference.py photo.jpg –lora depth-control-lora.safetensors –save-strip

较弱的结构遵循(更多创作自由度)

python inference.py photo.jpg -p “…” –lora depth-control-lora.safetensors –lora-scale 0.6 ``

标志默认值说明
-p / --prompt""空值 = 仅基于深度生成
--baseturboturboraw
--steps8(turbo)/ 28(raw)步数
--cfg0(turbo)/ 3.5(raw)无分类器引导
--mu1.15(turbo)/ auto(raw)时间步偏移
--lora-scale1.0控制强度旋钮
--seed0随机种子
--save-strip关闭同时保存输入|深度|输出对比图

https://huggingface.co/Patil/Krea-2-depth-controlnet#python-apiPython API

`` from PIL import Image from huggingface_hub import hf_hub_download from pipeline import DepthLoRAPipeline

base = hf_hub_download(“krea/Krea-2-Turbo”, “turbo.safetensors”) pipe = DepthLoRAPipeline(base, “depth-control-lora.safetensors”)

out, depth = pipe(Image.open(“photo.jpg”), prompt=“a cozy cabin interior at dusk”, steps=8, cfg=0.0, mu=1.15, seed=0) out.save(“output.png”) ``

https://huggingface.co/Patil/Krea-2-depth-controlnet#how-it-works-inference-path工作原理(推理路径)

  1. 输入图像被调整到最近的约 1MP 长宽比桶,并经 Depth-Anything-V2-Large 处理 → 得到逆深度图(近处 = 白色)。
  2. 深度图使用与图像相同的 Qwen-Image VAE 进行编码,因此控制信号位于潜在空间中。
  3. 在每个去噪步骤中,深度潜在向量按通道拼接到噪声潜在向量上(每个 DiT token:64 → 128 维)。扩展的输入投影以及所有 28 层上的 rank-64 LoRA(均包含在检查点中)引导生成遵循深度结构。
  4. 否则为标准 Krea-2 流匹配欧拉采样——与 BFL 的 Flux.1-Depth-dev-lora 相同的配方。

https://huggingface.co/Patil/Krea-2-depth-controlnet#tips–limitations提示与限制

  • 最佳输入:具有真实透视感的照片/渲染图。扁平的 2D 插图会产生几乎均匀的深度图,因此控制效果会很弱(垃圾进,垃圾出)。
  • 空提示词生成有效(深度一致性 0.98)——用于测试仅靠控制信号能携带多少结构信息。
  • --lora-scale 低于 1.0 会放松结构遵循,高于 1.0 则会加强(但会牺牲一些质量)。
  • Krea-2-Raw 可生成最高约 1K 分辨率;输出受限于约 1MP 的桶大小。

https://huggingface.co/Patil/Krea-2-depth-controlnet#files文件

  • inference.py — 命令行接口
  • pipeline.py — 完整流水线:LoRA 手术、Qwen3-VL 条件器、VAE、深度估计器、带控制注入的流采样器
  • mmdit.py — 来自 krea-2 仓库(https://github.com/krea-ai/krea-2)的未修改 DiT 定义

模型权重受 Krea 2 社区许可(https://www.krea.ai/krea-2-licensing)约束。训练代码将另行发布。

@Tanmaypatil79(https://x.com/TanmayPatil79),@Shauray7(https://x.com/Shauray7),@edwixxxx(https://x.com/edwixxxx)

相似文章

krea/Krea-2-Turbo

Hugging Face Models Trending

Krea发布了Krea 2 Turbo,一个120亿参数的文本到图像扩散模型,在Hugging Face上开放权重,并支持多个推理库。

Krea 2 技术报告 (59分钟阅读)

TLDR AI

Krea 2 是一系列用于创意图像生成的基础模型,构建于大规模数据基础设施和多阶段训练流程之上。它引入了提示扩展器和风格参考系统,以提高可操控性并实现创意探索。

Krea 2 在 Hugging Face 上发布

Reddit r/LocalLLaMA

Krea 2 是一个拥有120亿参数的文本到图像扩散模型,以开放权重形式在 Hugging Face 上发布,提供了 Raw(基础版)和 Turbo(后训练版)检查点。

Krea 2

Product Hunt

Krea 2 是一款为增强风格控制和情绪板创建而发布的图像模型。