Boogu/Boogu-Image-0.1-Edit
摘要
Boogu-Image-0.1 是一个基于 Apache-2.0 开源协议的统一图像生成与编辑模型家族,包含文本到图像、快速生成、编辑以及中英文文本渲染等变体,作为研究项目发布于 Hugging Face。
标签: diffusers, safetensors, en, zh, 许可证:apache-2.0, diffusers:BooguImagePipeline, 区域:us
查看缓存全文
缓存时间: 2026/06/22 01:35
Boogu/Boogu-Image-0.1-Edit · Hugging Face 源:https://huggingface.co/Boogu/Boogu-Image-0.1-Edit Boogu-Image-0.1 ### 推动开源统一多模态理解与生成 — > ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%E2%9A%A0%EF%B8%8F-important-notice⚠️ 重要通知 Boogu 团队目前不提供任何与 Boogu-Image 相关的付费 API、订阅或商业服务。 任何以 “Boogu-Image” 或类似/变体名称(如 booguimage、Boogu Image、Boogu 等)提供的付费产品或服务与本项目无关,且均为非官方版本。请在支付前仔细核实,并保持警惕以保护您的个人隐私与资金安全。 Boogu-Image-0.1 仅作为研究项目,并非正式模型发布。 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%F0%9F%93%96-introduction📖 简介 Boogu-Image-0.1 是一个具有竞争力的 Apache-2.0 开源统一图像生成与编辑模型系列,包含 Base、Turbo、Edit 等变体,为高质量的文生图、快速生成、图像编辑以及中英双语文本渲染提供稳定、实用的能力。像 Nano Banana Pro 和 GPT-Image-2 这样的闭源多模态理解与生成系统之所以取得显著性能,并非仅靠单一模型,而是通过高度统一的系统能力套件。然而,在与闭源系统相比极其有限的训练算力下,我们发现系统性地提升模型的理解能力、数据质量与训练流程,仍然可以显著改善图像生成与编辑性能。具体来说,与某些现有开源模型相比,我们的训练数据规模大约小一个数量级。我们希望我们的实证研究与开源发布能有助于推动多模态生成与理解的开源生态。本仓库提供 Boogu-Image-0.1 的检查点与推理代码。 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%F0%9F%8F%86-boogu-arena🏆 Boogu Arena 由于我们无法直接在 LM Arena 上进行评估,我们构建了 Boogu Arena,一种 LM Arena 风格的偏好评估。我们使用 LLM 生成多样的用户画像,然后要求每个画像生成图像生成提示,从而得到 1000+ 测试提示,我们将公开发布这些提示以供社区复现。下方的 ELO 排行榜涵盖了领先的闭源与开源系统。欢迎对结果有疑问的团队联系我们,以便我们共同努力实现更客观、公平和可复现的评估。 Boogu Arena ELO 排行榜 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%E2%9C%A8-highlights✨ 亮点 - 📸 精美逼真的摄影 — 准确理解摄影提示,生成具有自然光照、连贯构图和忠实细节的高质量图像,即使在复杂的现实场景中也能保持主体、背景和空间关系的一致性摄影示例 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/assets/photography_triptych.png) - 📝 多样稳定的文本渲染 — 支持多种富含文本的设计 — 海报、印章、文档、界面、品牌指南和手写板 — 具有可读的结构、稳定的排版以及跨多样化布局的稳健双语(中/英)渲染文本渲染示例 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/assets/text_rendering_triptych.png) - 🎨 多样精美的风格化 — 处理风格化生成,涵盖微型 3D 场景、中国风镀金美学、闪耀幻想视觉效果、动漫肖像和神话角色艺术 — 不仅是风格迁移,而是稳定、吸引人且遵从提示的创意生成风格化示例 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/assets/stylization_triptych.png) - 🖌️ 多功能图像编辑 — 处理广泛的编辑任务,包括对象插入、替换和移除,属性和材质修改,背景和场景替换,以及跨艺术风格的忠实风格迁移,同时保持源主体和构图的一致性图像编辑示例 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/assets/edit_cases_combined.png)风格迁移示例 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/assets/style_cases_combined.png) - 🪧 个性化海报设计与产品渲染 — 生成个性化海报布局和干净的产品可视化,具有一致的品牌标识、精致的排版以及产品级光照与构图海报与产品示例 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/assets/poster_cases_combined.png) - ✍️ 精确文本编辑 — 实现图像内细粒度文本编辑 — 替换、添加或删除中英文字符 — 并灵活调整字体、字重、颜色和布局以匹配不同设计意图文本编辑示例 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/assets/text_cases_combined.png) - 📊 具有竞争力的通用性能 — 在多种场景和基准测试中表现竞争力突出,Boogu-Image-0.1 系列在 Boogu Arena 评估的开源与闭源系统中位列前茅 > 📖 要了解完整的实践经验以及对当前局限的坦诚说明,请参阅下方的 负责任 AI 与局限 (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#-responsible-ai–limitations)。 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%F0%9F%94%AC-scenario-wise-comparison🔬 场景对比 除了总体竞技场排名,我们按场景细分了性能,并与领先的开源同模型进行对比。评分反映我们对每个类别典型提示的内部评估。| 模型 | 真实感摄影 | 简单文本渲染 | 密集文本渲染 | |——|————|–––––––|–––––––| | Boogu-Image-0.1-Turbo | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | | Boogu-Image-0.1-Base | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | | Z-Image-Turbo | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | | Qwen-Image-2512 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | - 📸 具有可靠文本渲染的摄影 — Boogu-Image-0.1-Turbo 提供真实感摄影,同时在简单和密集文本渲染上也表现稳健。 - 📝 强大的密集文本渲染 — Boogu-Image-0.1-Base 在密集、布局繁重的文本场景(如海报、文档、品牌指南和复杂的双语设计)中显示出竞争力。 - 💡 建议 — 当您的工作负载以密集/超密集文本渲染需求为主时,我们建议运行 Boogu-Image-0.1-Base 2K 输出分辨率,以获得最佳的布局保真度和字符准确性。 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%F0%9F%93%A3-news📣 新闻 - 2026-06-XX 🧊 Boogu-Image-0.1-Edit-Turbo(图到图)即将到来! - 2026-06-XX 🧊 Boogu-Image-0.1-Turbo-2K(文到图)即将到来! - 2026-06-20 🧊 端午节快乐!我们看到了许多社区评测和反馈,并将继续相应更新模型。由于产品设计理念的差异,Boogu 系列与大多数现有的开源模型有所不同。当其他模型倾向于依赖强化学习技术来增强美学效果时,Boogu 专注于使用多样化数据来给用户更多控制权。这正是我们采用集成理解与生成系统的原因:我们需要更精确的指令控制。我们将在三天内发布用户手册,帮助大家更好地使用 Boogu 系列模型。 - 2026-06-17 🔥 ComfyUI-Boogu (https://huggingface.co/Comfy-Org/Boogu-Image) 由 ComfyUI 驱动,已发布!感谢 ComfyUI! - 2026-06-17 🔥 ComfyUI-Boogu (https://github.com/boogu-project/ComfyUI-Boogu) 已发布! - 2026-06-16 🔥 Boogu-Image-0.1-Base(文到图)已发布! 核心文到图基础模型。尝试在线演示 (http://demo-base.boogu.org/)。 - 2026-06-16 🎨 Boogu-Image-0.1-Edit(图到图)已发布! 图像编辑与变换能力现已可用。注意,您需要相应地将参考图像的分辨率调整为 1K。 尝试在线演示 (http://demo-edit.boogu.org/)。目前仅支持一张参考图像。我们将尽力支持更多参考图像,敬请期待! Boogu-Image-0.1-Edit 在单图编辑上表现出色。欢迎提供更多失败案例。 - 2026-06-16 🚀 Boogu-Image-0.1-Turbo 已发布! 四步蒸馏变体,用于快速推理和照片级真实感生成。尝试在线演示 (http://demo-turbo.boogu.org/)。 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%F0%9F%93%A5-model-zoo📥 模型动物园 - Boogu-Image-0.1-Base:基础模型,具有强大的 多样性 和 可控性 — 非常适合 微调 和下游开发。主要面向 超密集文本渲染;对于照片真实感,Turbo 通常是更好的默认选择。 - Boogu-Image-0.1-Edit:图像编辑和变换变体。 - Boogu-Image-0.1-Turbo:蒸馏变体,具有 相同参数量,通常仅需 3~4 步。专注于 高质量生成 和照片真实感,同时保留双语文本渲染和提示遵循能力。 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%F0%9F%9B%A0%EF%B8%8F-installation🛠️ 安装 > 测试环境: Python 3.10 · CUDA 12.6 · PyTorch 2.7.1 bash # 使用全新的 conda 环境 conda create -y -n boogu python=3.10 conda activate boogu # 安装必要依赖 # 支持 PyTorch 最高 2.11.0 及 CUDA 最高 12.8 # 查看 requirements/_.txt pip install -r requirements/torch2.7-cu126.txt pip install -e . python utils/get_flash_attn.py 或 bash bash quick_start.sh conda activate boogu ### https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#download-checkpoints下载检查点 在运行推理前,将模型权重下载到本地 models/ 目录。我们推荐使用官方的 Hugging Face CLI: bash pip install -U "huggingface_hub[cli]" # 下载到 ./models/ huggingface-cli download Boogu/Boogu-Image-0.1-Base --local-dir models/Boogu-Image-0.1-Base huggingface-cli download Boogu/Boogu-Image-0.1-Turbo --local-dir models/Boogu-Image-0.1-Turbo huggingface-cli download Boogu/Boogu-Image-0.1-Edit --local-dir models/Boogu-Image-0.1-Edit 下载后的示例目录结构: models/ └── Boogu-Image-0.1-Base/ ├── model_index.json ├── mllm ├── processor ├── scheduler ├── transformer └── vae 然后通过 --model models/Boogu-Image-0.1-Base 指定本地路径进行推理。 ### https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#flash-attentionFlash Attention 本仓库提供 utils/get_flash_attn.py,可自动为您环境安装兼容的 flash-attn wheel。要求: - 已安装 Python、PyTorch 和 CUDA - Linux x86_64 bash # 自动:检测环境,下载预编译 wheel,回退到源码编译 python utils/get_flash_attn.py # 强制源码编译 python utils/get_flash_attn.py --build 脚本首先搜索 mjun0812/flash-attention-prebuild-wheels (https://github.com/mjun0812/flash-attention-prebuild-wheels),然后尝试官方 Dao-AILab/flash-attention (https://github.com/Dao-AILab/flash-attention) 发布 wheel(包含两种 cxx11abi 变体),最后通过 pip install flash-attn --no-build-isolation 回退到源码编译。 ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%F0%9F%9A%80-quick-start🚀 快速开始 ### https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#pytorch-native-ti2i-edit-inferencePyTorch 原生 TI2I 编辑推理 bash export device="cuda:0" # 必需 mkdir -p outputs/test_ti2i/ python inference.py \ --pretrained_pipeline_name_or_path "models/Boogu-Image-0.1-Edit" \ --input_image_paths "input_image_examples/03.jpg" \ --instruction "将风格改为彩色铅笔画。" \ --num_inference_steps 50 \ --height 1024 --width 1024 \ --text_guidance_scale 5.0 --image_guidance_scale 1.0 \ --output_image_path "outputs/test_ti2i/out_1.png" \ --device "$device" ### https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#hardware-notes硬件说明 > 📖 关于完整 CLI 选项、设备设置、卸载策略、缓存加速、Torch Compile、FP8 和批量推理详情,请参见 INFERENCE_GUIDE.md (https://huggingface.co/Boogu/Boogu-Image-0.1-Edit/blob/main/INFERENCE_GUIDE.md)。 Torch Compile 注意:--enable_torch_compile 在某些 GPU/模型上可能偶尔产生全黑输出。如果发生这种情况,请先禁用它。 | VRAM | 推荐配置(T2I 1K) | 推荐配置(T2I 2K) | |——|––––––––––|––––––––––| | 12GB | 未量化:--enable_sequential_cpu_offload_flag 量化:--enable_model_cpu_offload_flag --use_fp8_weights | 未量化:--enable_sequential_cpu_offload_flag 量化:--enable_group_offload_flag --use_fp8_weights | | 16GB | 未量化:--enable_sequential_cpu_offload_flag 量化:--enable_model_cpu_offload_flag --use_fp8_weights | 未量化:--enable_sequential_cpu_offload_flag 量化:--enable_model_cpu_offload_flag --use_fp8_weights | | 24GB | 未量化:--enable_model_cpu_offload_flag 量化:--use_fp8_weights | --enable_model_cpu_offload_flag | | 32GB | 未量化:--enable_model_cpu_offload_flag 量化:--use_fp8_weights | 未量化:--enable_model_cpu_offload_flag 量化:--use_fp8_weights | | 40GB | 基础模型 | 未量化:--enable_model_cpu_offload_flag 量化:--use_fp8_weights | | 80GB | 基础模型 | 基础模型 | ## https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#%E2%9A%A0%EF%B8%8F-responsible-ai–limitations⚠️ 负责任 AI 与局限性 Boogu-Image-0.1 仅供研究目的发布,未经额外安全措施不宜用于生产部署。我们在数据筛选、训练和评估过程中考虑了负责任 AI 的因素;但模型仍可能产生不准确、有偏见或其他不适当的输出。 ### https://huggingface.co/Boogu/Boogu-Image-0.1-Edit#known-limitations已知局限 🌍 世界知识差距 - 对于需要丰富常识、领域知识、真实品牌或人物、著名地标、名人、产品以及复杂上下文理解的任务,Boogu 与强大的闭源系统仍存在明显差距 - 这种能力的评估成本极高;即使是 Arena 风格的评估也难以全面衡量,因此现有基准几乎无法量化这一维度,实际差距可能大于测量分数所示 🖼️ 图像到图像的一致性与上下文场景 - 对于需要严格保留输入主体、身份、布局或细节的编辑任务,Boogu 的图像到图像一致性仍不够稳定 - 由于我们的图像到图像能力更侧重于摄影和文本生成应用,Boogu 在某些上下文生成场景中仍落后于 Seedream 5.0 和 Nano Banana Pro 📝 文本渲染稳定性 - Boogu 可以处理许多中文和英文文本场景,但长文本、密集排版、小字体和复杂设计布局仍可能产生错字、漏字或布局漂移 - 文本渲染目前专注于中文和英文;其他语言未经专门优化,可能会明显降级 🦴 复杂姿态中的身体结构 - 在多人物交互、遮挡、夸张动作或异常视角下,手部、肢体和身体结构可能仍显得不自然或不一致
相似文章
Boogu-Image-0.1:推动开源统一多模态理解与生成
Boogu-Image-0.1是一个开源的统一多模态理解与生成模型系列,在文本到图像生成、快速推理、基于指令的编辑和双语文本渲染方面实现了有竞争力的性能,训练成本仅约40万美元。
@AdinaYakup: Boogu-Image-0.1 全新统一图像生成与编辑模型家族 - 10B Base/Edit/Turbo - Apache 2.0 - 快速 Turbo 推理…
Boogu-Image-0.1 是一个全新的统一图像生成与编辑模型家族,拥有10B参数,采用 Apache 2.0 许可证。它支持快速 Turbo 推理(仅需4步),在10倍更少的数据上训练,并支持中文和英文。
Boogu Base、Turbo、Edit —— 开源统一图像生成与编辑模型系列
Boogu 发布了一系列开源统一图像生成与编辑模型,包括 Base、Turbo 和 Edit 变体。
Comfy-Org/Boogu-Image
Comfy-Org已为ComfyUI重新打包了Boogu-Image模型文件,包括base、edit和turbo变体,具有不同的量化格式,以及一个LoRA和文本编码器。
microsoft/Mage-Flow-Edit-Turbo
微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。