prism-ml/bonsai-image-ternary-4B-gemlite-2bit

Hugging Face Models Trending 模型

摘要

Prism ML发布Bonsai Image,一个1.21 GB的文本到图像扩散变换器,使用三元权重(1.58-bit)用于NVIDIA GPU,在RTX 3080上4.5秒生成1024²图像,体积远小于FP16。

任务:文本到图像 标签:diffusers, safetensors, 三元, 1.58-bit, gemlite, hqq, cuda, 文本到图像, 扩散, flux, prismml, bonsai, base_model:prism-ml/bonsai-image-ternary-4B-unpacked, base_model:finetune:prism-ml/bonsai-image-ternary-4B-unpacked, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/06/01 08:22

prism-ml/bonsai-image-ternary-4B-gemlite-2bit · Hugging Face

来源:https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit Bonsai Image

Prism ML 官网 (https://prismml.com/)|技术白皮书 (https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)|演示与示例 (https://github.com/PrismML-Eng/Bonsai-Image-Demo)|Discord (https://discord.gg/prismml)

三元权重(1.58-bit)文本到图像扩散Transformer部署,适用于NVIDIA GPU

1.21 GB 的Transformer|比FP16缩小6.4倍|RTX 3080上 4.5 秒 / 1024²|A100上 2.8 秒 / 1024²|原生支持Linux和Windows

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#highlights亮点

  • 1.21 GB 扩散Transformer,相比FP16的FLUX.2 Klein 4B Transformer(7.75 GB)大幅缩小
  • 三元权重 {−1, 0, +1},在矩阵密集的Transformer层(Q/K/V投影、输出投影、MLP权重)中采用FP16分组缩放
  • 面向质量的 Bonsai Image 变体:额外的零状态提升了视觉质量和提示忠实度,同时保持Transformer紧凑
  • 4.55 GB CUDA部署负载,包含4-bit文本编码器和FP16 VAE — 文本编码器在提示编码后卸载,因此去噪循环仅保留紧凑的Transformer和VAE常驻内存
  • 4步FlowMatch-Euler采样器,guidance = 1.0,shift = 3.0 — 无需CFG,无需负向提示
  • 适用于NVIDIA GPU的Gemlite低位GEMM路径,压缩文本编码器使用HQQ
  • 通过相同的CUDA/Gemlite部署堆栈原生支持Linux和Windows
  • 跨平台伴侣:也提供MLX 2-bit (https://huggingface.co/prism-ml/bonsai-image-ternary-4B-mlx-2bit)版本,适用于Apple Silicon

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#resources资源

  • 白皮书 (https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf) — 完整的基准测试、内核和内存分析
  • 演示仓库 (https://github.com/PrismML-Eng/Bonsai-Image-Demo) — Mac / Linux / Windows 一键设置
  • Discord (https://discord.gg/prismml) — 社区 + 支持
  • 内核:gemlite (https://github.com/mobiusml/gemlite)(融合低位GEMM)·HQQ (https://github.com/mobiusml/hqq)(低位量化运行时)·triton-windows (https://github.com/triton-lang/triton-windows)(Windows路径)

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#model-overview模型概述

项目规格
基础架构FLUX.2 Klein 4B (MMDiT扩散Transformer)
参数~4.0B(Transformer主干)
模块25个MMDiT模块:5个双流 + 20个单流
采样器FlowMatchEuler,4步,guidance = 1.0,shift = 3.0
文本编码器Qwen3-4B 4-bit HQQ(约2.84 GB CUDA负载,提示编码后卸载)
VAEFlux2 32通道潜空间,分块解码(128像素块)
原生分辨率1024×1024(也支持512×512和任意32的倍数)
权重格式Gemlite INT2打包,三元值 + FP16分组缩放
Transformer大小1.21 GB 模型级Bonsai表示;1.54 GB CUDA打包部署大小
总负载4.55 GB CUDA部署负载(Transformer + 4-bit文本编码器 + FP16 VAE)
三元覆盖范围25个MMDiT模块中所有100个重matmul线性层
平台Linux x86_64 + Windows原生,NVIDIA GPU
许可证Apache 2.0

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#ternary-weight-representation-158-bit-g128三元权重表示:1.58-bit g128

每个三元权重取值为 {−1, 0, +1},每128个权重共享一个FP16缩放因子:

w_i = scale_g * t_i, t_i 取 {−1, 0, +1}

三元值每个权重包含 log2(3) ≈ 1.585 比特信息。加上每128个权重一个FP16缩放因子,有效存储为:

b_eff ≈ log2(3) + 16/128 ≈ 1.585 + 0.125 ≈ 1.71 bits/weight

相对于FP16,这在三元Transformer层实现了理想的9.4倍缩减。少量精度敏感的支持张量保留为FP16,因此最终的三元Bonsai Image 4B扩散Transformer大小为1.21 GB,比FP16的FLUX.2 Klein 4B Transformer(7.75 GB)缩减了6.4倍。

三元表示应用于矩阵密集的Transformer层,包括Q/K/V投影、输出投影、MLP线性层以及双流add-K/Q/V线性层。支持张量(少于总参数的5%)如调制流、嵌入器、输出归一化和输出投影保留为FP16,以保证图像质量和稳定性。

CUDA部署使用Gemlite INT2打包格式。三元值存储在2-bit槽中,第四个编码未使用。模型级Bonsai表示大小为1.21 GB;由于当前Gemlite路径中的运行时打包和对齐开销,部署的CUDA包为1.54 GB(磁盘上)。

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#memory内存

格式Transformer大小缩减比例比率
FP16 FLUX.2 Klein 4B7.75 GB1.0×
三元Bonsai Image 4B1.21 GB84.4%6.4×

CUDA部署:

组件大小
Gemlite INT2扩散Transformer1.54 GB
HQQ 4-bit文本编码器2.84 GB
FP16 VAE0.17 GB
总负载4.55 GB

运行时,文本编码器在提示编码后卸载。在去噪过程中,重复的图像生成循环主要由紧凑的三元扩散Transformer和活跃的图像生成组件主导,而非完整负载。

RTX 3080上1024²的峰值HBM约为6.8 GiB(端到端,包括Transformer + VAE + 激活内存)。

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#best-practices最佳实践

  • 采样器:FlowMatchEuler-discrete,4步,guidance = 1.0,shift = 3.0。模型设计为4步;运行更多步数不会显著提升质量,反而可能引入伪影。
  • 分辨率:原生1024²是设计目标。512²可用于快速预览。
  • 宽高比:支持32的倍数,包括832x1248和1248x832。
  • 提示:自然语言提示。无需负向提示。
  • 运行时内存:文本编码器在提示编码后卸载,因此去噪循环内存占用较轻。

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#quickstart快速开始

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#bonsai-studio-linux–windowsBonsai Studio (Linux / Windows)

最简单的路径是使用Bonsai Image Demo仓库 (https://github.com/PrismML-Eng/Bonsai-Image-Demo),它会设置完整的Bonsai Studio(FastAPI后端 + Next.js前端),并在Linux/Windows上自动选择gemlite:

git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git cd Bonsai-Image-Demo ./setup.sh ./scripts/download_model.sh # 三元版本为默认 ./scripts/serve.sh

在Windows上(PowerShell):

Set-ExecutionPolicy -Scope CurrentUser RemoteSigned # 仅一次 .\setup.ps1 .\scripts\download_model.ps1 .\scripts\serve.ps1

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#python-api-backend_gpuPython API (backend_gpu)

无需工作室前端进行推理:

`` from backend_gpu.server import build_pipeline

pipe = build_pipeline(model_id=“prism-ml/bonsai-image-ternary-4B-gemlite-2bit”) image = pipe( prompt=“A bonsai tree in a quiet ceramic studio, soft morning light”, num_inference_steps=4, guidance_scale=1.0, height=1024, width=1024, ).images[0] image.save(“bonsai.png”) ``

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#throughput-cuda–gemlite吞吐量 (CUDA / gemlite)

预热,每张图像的墙上时钟时间,4步去噪,guidance = 1.0,匹配的提示和采样器设置。

平台512² (s)1024² (s)备注
A100 (Colab)1.12.8Ampere数据中心 (40 GB)
RTX PRO 6000 Blackwell (Colab)1.02.1NVIDIA Blackwell, 96 GB VRAM
RTX 3080 10 GB1.44.5Ampere消费级;1024²峰值HBM 6.8 GiB
RTX 3060 6 GB (笔记本)3.317.5Ampere移动版;1024²受内存限制

低于2-bit的打包使得在普通GPU上生成1024²图像成为可能。RTX 3080 10 GB达到4.5秒/图像,而6 GB笔记本版RTX 3060是内存受限的尾端。

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#benchmarks基准测试

在H100上使用匹配的生成设置进行评估。GenEval使用官方512x512协议。对于HPSv3和DPG-Bench,较大骨干的行在1024x1024下评估,较小骨干的行在其原生512x512设置下评估。三个基准测试均为越高越好。

模型Transformer (GB)GenEvalHPSv3DPG-Bench
Bonsai Image · Ternary 4B1.210.72312.220.851
Bonsai Image · Binary 4B0.930.67111.150.822
FLUX.2 Klein 4B7.750.81912.840.853
FLUX.1-schnell23.80.71612.670.848
SDXL5.140.30010.050.740
PixArt-Σ XL 21.200.54111.930.769
Stable Diffusion 1.51.720.3964.200.601
BK-SDM-Small0.980.2973.050.559

基准测试结果显示了预期的质量-占用权衡。三元Bonsai Image 4B是面向质量的变体:在1.21 GB下,其在GenEval、HPSv3和DPG-Bench上非常接近FLUX.2 Klein 4B,同时将扩散Transformer占用减少了6.4倍。二元伴侣是面向占用的变体,将扩散Transformer降低至1 GB以下,同时仍然提供强大的基准测试结果。

结合起来,Bonsai Image 变体推进了质量-占用边界:它们将现代扩散Transformer的行为带入了以前由更小、能力更低的模型占据的内存范围。

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#use-cases使用场景

  • 本地创意工具:直接在配备CUDA的工作站和消费级GPU上生成图像
  • 私人生成:提示和生成的素材可保留在本地或受控环境中
  • 快速迭代:降低本地延迟,无需远程队列即可进行迭代创意工作流
  • 普通GPU服务:降低Transformer占用和内存压力,适用于NVIDIA GPU上的服务部署
  • Windows和Linux部署:通过相同的Gemlite部署堆栈提供原生路径
  • 企业级和受控推理:适用于数据驻留和合规性敏感工作流的本地或私有环境

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#limitations局限性

  • 三元Bonsai Image 4B与FP16 FLUX.2 Klein 4B模型并非比特一致;它是一个紧凑的三元权重部署,旨在以更小的体积实现类似的实际行为。
  • 图像生成质量仍取决于提示和工作流。小文字、精细细节、对象计数和严格的构图约束应根据目标使用场景进行评估。
  • 当前的普通推理堆栈尚未将完全原生的三元执行作为标准硬件路径暴露。本次发布在CUDA上使用实用的Gemlite低位GEMM内核。
  • 在扩散Transformer变得紧凑后,其他组件(如VAE)可能成为更显著的内存瓶颈。运行时通过文本编码器卸载和分块VAE解码来缓解这一问题。

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#citation引用

@techreport{bonsaiimage4b, title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs}, author = {Prism ML}, year = {2026}, month = {May}, url = {https://prismml.com} }

https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit#contact联系方式

如有问题、反馈或合作咨询:[email protected]

相似文章

prism-ml/Ternary-Bonsai-27B-mlx-2bit

Hugging Face Models Trending

Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。

1-Bit Bonsai Image 4B 本地设备图像生成

Hacker News Top

PrismML 发布 Bonsai Image 4B,这是一系列紧凑型图像生成模型,使用 1-bit 和三进制权重,能够在笔记本电脑和 iPhone 等本地设备上实现高质量扩散推理,同时显著减少内存占用。

Prism-ML Bonsai Qwen 3.6 27B

Reddit r/LocalLLaMA

Prism ML 发布了 Ternary-Bonsai-27B,这是 Qwen3.6-27B 的三元量化版本,在约 7.2 GB 的占用下保留了 FP16 智能的 95%,能够在笔记本电脑和单 GPU 上实现完整的 27B 级推理,在 Apple M5 Pro 上速度可达 26 tok/s。

prism-ml/Bonsai-27B-gguf

Hugging Face Models Trending

Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。