clark-labs/clark-air-sana-1.6b-1.58bit · Hugging Face

Reddit r/LocalLLaMA 模型

摘要

Clark Labs 发布了 Clark Air Sana 1.6B,这是 Sana 1.6B 文本到图像转换器的三值量化版本,体积比 FP16 小 8.6 倍,同时保持接近 FP16 的质量,从而实现高效部署。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/28 05:59

clark-labs/clark-air-sana-1.6b-1.58bit · Hugging Face

Source: https://huggingface.co/clark-labs/clark-air-sana-1.6b-1.58bit

Clark Air · Sana 1.6B

一款压缩为三值(约1.85比特/权重)的Sana 1.6B文本到图像Transformer:比FP16小8.6倍,接近FP16质量。

Clark Air Sana 1.6B 样本 (https://huggingface.co/clark-labs/clark-air-sana-1.6b-1.58bit/blob/main/demo.png)

由Clark Air Sana 1.6B在1.58比特下生成的样本。

内存占用(实测)

产物大小对比FP16说明
FP16 Transformer3.21 GB1× (100%)参考
Clark Air(打包)374 MB8.6× (≈12%)打包三值(clark-air-sana-1.6b-packed.safetensors
Clark Air(未打包)3.21 GB兼容本仓库的 transformer/,反量化bf16,可即插即用 diffusers

实测约1.85比特/权重 → 缩小8.6倍(374 MB打包 ÷ 3.21 GB FP16)。

ⓘ 此处的 transformer/ 为未打包的兼容格式:可在标准 diffusers 中加载,无需自定义代码,因此与FP16版本大小相同(3.21 GB)。实际的压缩产物为本仓库中374 MB的打包 safetensors

用法(即插即用 diffusers

`` import torch from diffusers import SanaPipeline, SanaTransformer2DModel

transformer = SanaTransformer2DModel.from_pretrained( “clark-labs/clark-air-sana-1.6b-1.58bit”, subfolder=“transformer”, torch_dtype=torch.bfloat16) pipe = SanaPipeline.from_pretrained( “Efficient-Large-Model/Sana_1600M_512px_diffusers”, transformer=transformer, torch_dtype=torch.bfloat16) pipe.to(“cuda”) pipe(“a half empty bottle of red wine”, num_inference_steps=20, guidance_scale=4.5).images[0].save(“out.png”) ``

关于

Transformer权重被量化为三值,并带有分组缩放因子;少量高精度部分(约占参数的5%,即条件和投影层)保留更高精度。

  • 基础模型: Sana 1.6B, 512px

许可

Apache-2.0 © Clark Labs, Inc.

相似文章

NVlabs/Sana

GitHub Trending (daily)

NVlabs/Sana是一个面向效率的开源代码库,用于高分辨率图像和视频生成,包含多个模型变体及训练/推理管线。

Efficient-Large-Model/SANA-WM_bidirectional

Hugging Face Models Trending

SANA-WM 是一个高效的 2.6B 参数开源世界模型,用于分钟级视频生成并具备精确的相机控制。它采用混合线性扩散变换器和两阶段流水线,从图像和文本提示生成 720p 视频。