标签
Qwen Image 2.1 Consistency LoRA 是一种在编辑过程中保持图像一致性的工具,能防止AI图像生成工作流中的偏移和不必要的重绘。
Akatz Labs 发布了一个实验性的 MiniMax H3 角色替换 LoRA(1,000 步训练),可在保留场景的前提下,用一张图像参考替换源视频中的指定角色。作者指出,背景保留效果尚可,但运动时序、面部表情以及硬切镜头仍然不够稳定。
用户尝试在本地GPU上运行Qwen 27B和Qwen Image 2.1来生成用于打印的3D模型和渲染图,使用了CADQuery和ComfyUI等工具,并计划未来项目从照片创建模型。
本文介绍了 Qwen-Image-2.1 文本编码器的 GGUF 版本,包括修复在 ComfyUI 中加载的问题以及用于图像生成的推荐采样器设置。
Qwen-Image-2.1模型的GGUF量化版本,用于使用ComfyUI进行本地图像生成,包含推荐的量化方式和部署设置说明。
为 ComfyUI 工作流程优化的 Qwen-Image-2.1 重打包模型文件,支持文本生成图像和图像编辑功能。
本文详细介绍了为ComfyUI重新打包的YuE2模型,支持音频和音乐生成工作流。它提供了基于MERT-v2-FullSong和SheetSage2的模型文件,便于集成到ComfyUI项目中。
本仓库为MiniMax H3模型提供LoRAs,旨在ComfyUI中运行,用于视频增强,例如在保持照片真实感的同时锐化视频。
实测显示双机spark能够同时运行qwen3.8和ComfyUI,但设备发热严重。
Wan 3.0 是阿里云开发的AI视频生成模型,现已在 ComfyUI 上可用,支持单次生成最长30秒的场景,分辨率从480p到1080p。
一个神经潜在空间上采样器,旨在通过直接上采样潜在表示来加速高分辨率Minimax H3视频生成,避免昂贵的解码-编码往返过程。
一个名为TAPEDECK的开源、自托管AI音乐生成电台工具,使用MiniMax Music 3从用户本地GPU上的音乐库创建无限的、个性化电台。
Minimax 正准备发布 Music 3 的开源权重版本,Diffusers 和 ComfyUI 中的活跃 PR 证明了这一点,演示已经可用,Comfy-Org 也暗示将在数小时内进行重大发布。
一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。
MiniMax-H3 的早期预览版 LoRA 支持 4 步音视频生成,取代约 20 步,采样速度大约提升 5 倍,但质量仍不成熟。
MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。
这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。
Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。
一篇病毒式传播的帖子讲述了一位匿名开发者如何构建了ComfyUI——一款强大的免费开源AI图像工具,并将其与Adobe的订阅费用以及近期与美国司法部的和解进行对比。帖子称赞ComfyUI免费、本地运行、采用GPL-3.0许可的发布方式。