标签
Z-Anime 是对阿里巴巴 Z-Image Base 模型进行全面微调的产物,专门用于高质量动漫生成,支持自然语言提示词,且显存占用较低。
NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。
VoxCPM2 是一个开源的、无分词器的扩散自回归文本转语音模型,支持30种语言,拥有20亿参数,48kHz音频输出,并具备从自然语言描述进行语音设计、可控语音克隆以及实时流式处理等功能。
OmniVoice 是一款大规模多语言零样本文本转语音模型,支持超过 600 种语言,基于扩散语言模型架构构建,具备快速推理和语音克隆能力。
Lightricks 发布了 LTX-2.3,这是一个基于扩散的开放权重音视频基础模型,具有改进的质量和提示遵循性,提供多个检查点,包括蒸馏和 LoRA 变体,可在本地执行。
Anima 是一个拥有20亿参数的文生图模型,专注于动漫和插画风格,由 CircleStone Labs 与 Comfy Org 合作开发,以开源形式发布在 Hugging Face 上。
SANA-Video是一个小型扩散模型,利用线性注意力和恒定内存KV缓存,高效生成高分辨率、长时长的视频,以显著更低的成本和更快的速度实现与现有模型相媲美的性能。
Hunyuan3D 2.0 是一个可扩展的基于流的扩散变换器系统,用于生成高分辨率纹理3D资产,性能优于当前最先进的模型,并已公开发布代码和权重。
Ernie Image,全新开源扩散模型,文字渲染与提示词忠实度全面超越Zage,可在ComfyUI本地运行,仅需约20 GB显存。