clark-labs/clark-air-sana-1.6b-1.58bit · Hugging Face
摘要
Clark Labs 发布了 Clark Air Sana 1.6B,这是 Sana 1.6B 文本到图像转换器的三值量化版本,体积比 FP16 小 8.6 倍,同时保持接近 FP16 的质量,从而实现高效部署。
查看缓存全文
缓存时间: 2026/06/28 05:59
clark-labs/clark-air-sana-1.6b-1.58bit · Hugging Face
Source: https://huggingface.co/clark-labs/clark-air-sana-1.6b-1.58bit
Clark Air · Sana 1.6B
一款压缩为三值(约1.85比特/权重)的Sana 1.6B文本到图像Transformer:比FP16小8.6倍,接近FP16质量。
Clark Air Sana 1.6B 样本 (https://huggingface.co/clark-labs/clark-air-sana-1.6b-1.58bit/blob/main/demo.png)
由Clark Air Sana 1.6B在1.58比特下生成的样本。
内存占用(实测)
| 产物 | 大小 | 对比FP16 | 说明 |
|---|---|---|---|
| FP16 Transformer | 3.21 GB | 1× (100%) | 参考 |
| Clark Air(打包) | 374 MB | 8.6× (≈12%) | 打包三值(clark-air-sana-1.6b-packed.safetensors) |
| Clark Air(未打包) | 3.21 GB | 兼容 | 本仓库的 transformer/,反量化bf16,可即插即用 diffusers |
实测约1.85比特/权重 → 缩小8.6倍(374 MB打包 ÷ 3.21 GB FP16)。
ⓘ 此处的
transformer/为未打包的兼容格式:可在标准diffusers中加载,无需自定义代码,因此与FP16版本大小相同(3.21 GB)。实际的压缩产物为本仓库中374 MB的打包safetensors。
用法(即插即用 diffusers)
`` import torch from diffusers import SanaPipeline, SanaTransformer2DModel
transformer = SanaTransformer2DModel.from_pretrained( “clark-labs/clark-air-sana-1.6b-1.58bit”, subfolder=“transformer”, torch_dtype=torch.bfloat16) pipe = SanaPipeline.from_pretrained( “Efficient-Large-Model/Sana_1600M_512px_diffusers”, transformer=transformer, torch_dtype=torch.bfloat16) pipe.to(“cuda”) pipe(“a half empty bottle of red wine”, num_inference_steps=20, guidance_scale=4.5).images[0].save(“out.png”) ``
关于
Transformer权重被量化为三值,并带有分组缩放因子;少量高精度部分(约占参数的5%,即条件和投影层)保留更高精度。
- 基础模型: Sana 1.6B, 512px
许可
Apache-2.0 © Clark Labs, Inc.
相似文章
NVlabs/Sana
NVlabs/Sana是一个面向效率的开源代码库,用于高分辨率图像和视频生成,包含多个模型变体及训练/推理管线。
SANA-Video:基于块线性扩散变压器的高效视频生成
SANA-Video是一个小型扩散模型,利用线性注意力和恒定内存KV缓存,高效生成高分辨率、长时长的视频,以显著更低的成本和更快的速度实现与现有模型相媲美的性能。
@NielsRogge: 我们已在 Transformers 库中新增对 SAM-3 Lite-Text 的支持!> 将 SAM-3 中笨重的文本编码器替换为……
Hugging Face 的 Transformers 库新增了对 SAM-3 Lite-Text 的支持,将原本笨重的文本编码器替换为一个轻量的 MobileCLIP 学生模型,该模型通过知识蒸馏训练,在保持性能的同时将参数量减少了 88%。
Efficient-Large-Model/SANA-WM_bidirectional
SANA-WM 是一个高效的 2.6B 参数开源世界模型,用于分钟级视频生成并具备精确的相机控制。它采用混合线性扩散变换器和两阶段流水线,从图像和文本提示生成 720p 视频。
@danielhanchen: 我们还发布了可在8GB内存上运行的1位 Qwen3.8-27B 量化版本。它们相比BF16保留了约77%的准确率。我们原本…
Unsloth AI 发布了可在8GB内存上运行的 Qwen3.8-27B AI模型的1位量化版本,相比BF16精度保留了约77%的准确率。