标签
LTX-Video 是 Lightricks 开发的一个开源 Python 仓库,用于在本地使用 LTX-Video 模型生成和调节视频,支持文本/图像输入、多条件工作流程,并与 ComfyUI 和 Diffusers 集成。
Nunchaku 是一款基于 SVDQuant 的 4-bit 扩散推理引擎,现已原生集成到 Hugging Face Diffusers 中,通过简单的 from_pretrained() 调用即可快速、节省内存地加载量化扩散模型。
NVIDIA NeMo Automodel 与 Hugging Face Diffusers 集成,支持对扩散模型进行可扩展的分布式微调,用于图像和视频生成,支持的模型包括 FLUX.1-dev、Wan 2.1 和 HunyuanVideo。
Diffusers库已更新,新增了包括Ideogram4、MotifVideo以及DiffusionGemma模型在内的图像和视频流水线。
Giga-World-1 是 GigaAI Research 在 Hugging Face 上发布的视频生成模型,具备多个阶段检查点和用于场景控制的 LoRA 适配器。
Clark Labs 发布了 Clark Air Sana 1.6B,这是 Sana 1.6B 文本到图像转换器的三值量化版本,体积比 FP16 小 8.6 倍,同时保持接近 FP16 的质量,从而实现高效部署。
Sayak Paul 描述了一个使用 torch.compile 分析和优化 Diffusers 流水线的项目,并宣布由 Ari G. 教授的相关教程系列。