drbaph/MiniMax-H3-Turbo-Lora-ComfyUI
摘要
MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。
查看缓存全文
缓存时间: 2026/08/07 01:44
drbaph/MiniMax-H3-Turbo-Lora-ComfyUI · Hugging Face
MiniMax-H3 Turbo 4-Step — ComfyUI 剪枝模型 LoRA
本仓库包含原始 MiniMax-H3 Turbo LoRA — 4 步音视频生成预览 的第三方 ComfyUI 兼容转换版本,原始模型由 larryvrh (https://huggingface.co/larryvrh) 创建。
此外,仓库还包含两个 进一步训练的 checkpoint-500 变体,采用相同的剪枝模型 ComfyUI 格式。
这些 LoRA 专为 ComfyUI 使用的 剪枝/曲线形式 MiniMax-H3 checkpoint 设计。
另请查看 https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo
ComfyUI 测试输出
下载 ComfyUI 工作流 (https://huggingface.co/drbaph/MiniMax-H3-Turbo-Lora-ComfyUI/resolve/main/fl_minimax_h3_turbo_lora_example_workflow.json?download=true)
ComfyUI 工作流截图 (https://cdn-uploads.huggingface.co/production/uploads/63473b59e5c0717e6737b872/zfVV_yKP-njnOrGinGy8K.png)
原始项目
原始 LoRA 权重、训练工作、四步蒸馏方法、双重视频/音频采样实现、文档和源文件均由 larryvrh 创建并发布:
原始仓库: larryvrh/MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)
我 没有 训练、蒸馏或创建原始的 Turbo LoRA 权重。本仓库提供的是修改后的兼容版本,目的是让兼容的 LoRA 适配器能够在使用剪枝/曲线形式模型时,通过 ComfyUI 内置的 MiniMax-H3 LoRA 加载器加载。
原始 MiniMax-H3 Turbo LoRA 及其蒸馏方法的全部功劳归于 larryvrh。
包含文件
| 文件 | 描述 |
|---|---|
minimax\_h3\_turbo\_4step\_pruned\_comfyui\.safetensors | 原始非 EMA Turbo 权重的初步部分 ComfyUI 兼容转换版本,适用于剪枝/曲线形式的 MiniMax-H3 checkpoint。原作者描述非 EMA 权重更清晰,并且能更好地保持快速运动。 |
minimax\_h3\_turbo\_4step\_ema\_pruned\_comfyui\.safetensors | 原始 EMA Turbo 权重的初步部分 ComfyUI 兼容转换版本,适用于剪枝/曲线形式的 MiniMax-H3 checkpoint。原作者描述早期 EMA 权重更平滑,但由于 EMA 尚未完全成熟,因此更柔和。 |
minimax\_h3\_turbo\_4step\_ckpt500\_pruned\_comfyui\.safetensors | 进一步训练的 checkpoint-500 非 EMA 变体,采用剪枝模型 ComfyUI 格式。它是在初始预览 checkpoint 基础上继续训练的成果。 |
minimax\_h3\_turbo\_4step\_ema\_ckpt500\_pruned\_comfyui\.safetensors | 进一步训练的 checkpoint-500 EMA 变体,采用剪枝模型 ComfyUI 格式。其中包含进一步训练 checkpoint 的时间平均权重。 |
fl\_minimax\_h3\_turbo\_lora\_example\_workflow\.json | 使用 Turbo LoRA 的首帧和末帧 ComfyUI 示例工作流,带有可选的注意力和内存优化。 |
EMA 和非 EMA 文件保持独立,包含不同的张量值。
原始转换文件保留了初始预览权重,而 ckpt500 文件提供了进一步训练的变体。
这些是原始全模型 Turbo LoRA 的部分兼容版本,用于剪枝/曲线形式的 MiniMax-H3 架构。
应该使用哪个文件?
对于进一步训练的权重,请从以下文件开始:
minimax\_h3\_turbo\_4step\_ckpt500\_pruned\_comfyui\.safetensors
如需使用进一步训练的 EMA 变体进行对比:
minimax\_h3\_turbo\_4step\_ema\_ckpt500\_pruned\_comfyui\.safetensors
不带 ckpt500 的两个文件保留了早期的预览版本:
minimax\_h3\_turbo\_4step\_pruned\_comfyui\.safetensorsminimax\_h3\_turbo\_4step\_ema\_pruned\_comfyui\.safetensors
非 EMA 变体通常保持更锐利的响应和更强的快速运动表现,而 EMA 变体旨在提供更平滑的时间平均权重。
关于原始 Turbo LoRA
原始 MiniMax-H3 Turbo LoRA 是一个早期预览 checkpoint,旨在以大约 4 个采样步数(而不是通常的大约 20 个步数)生成联合视频和同步立体声音频,从而实现采样墙钟时间大约 5 倍 的缩减。
原作者明确指出,初始版本是正在进行中的训练运行所产生的未完成预览 checkpoint:
- 训练不足;
- 初始 EMA 权重尚未完全成熟;
- 质量不能代表完整运行的结果;
- 旨在作为项目方向的早期演示。
本仓库中额外的 ckpt500 文件是在该初始预览 checkpoint 基础上进一步训练的变体。
有关原始作者的文档、生成脚本、调度器实现和未来更新,请参阅原始仓库:
larryvrh/MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)
为什么进行此转换
原始 Turbo LoRA 文件使用如下张量键:
blocks\.0\.attn\.qkv\_proj\.lora\_A\.weight
ComfyUI 内置的 MiniMax-H3 LoRA 解析器期望键位于模型命名空间下:
diffusion\_model\.blocks\.0\.attn\.qkv\_proj\.lora\_A\.weight
如果没有该命名空间,ComfyUI 会报告如下警告:
\[WARNING\] lora key not loaded: blocks\.0\.attn\.out\_proj\.lora\_A\.weight
对保留的张量应用了以下命名空间转换:
blocks\.\*→diffusion\_model\.blocks\.\*token\_refiner\.\*→diffusion\_model\.token\_refiner\.\*
保留的张量值、BF16 数据类型、张量形状、LoRA 秩以及 A/B 方向均保持不变。
转换细节
每个原始全模型 Turbo LoRA 包含:
| 组件 | 数量 |
|---|---|
| 源张量 | 518 |
| 源 LoRA A/B 对 | 259 |
每个剪枝模型兼容转换版本包含:
| 组件 | 数量 |
|---|---|
| 保留张量 | 416 |
| 保留 LoRA A/B 对 | 208 |
| 剪枝的 AdaLN 张量 | 102 |
| 剪枝的 AdaLN A/B 对 | 51 |
被剪枝的适配器包括:
- 来自
blocks\.0到blocks\.49的 50 个 AdaLN 投影对; - 来自
final\_layer\.adaln\_proj\.linear的 1 个 AdaLN 投影对。
保留的适配器包括:
- 所有主块注意力适配器;
- 所有主块 MLP 适配器;
- 所有 token-refiner 注意力适配器;
- 所有 token-refiner MLP 适配器。
保留的注意力、MLP 和 token-refiner 张量具有与剪枝/曲线形式的 MiniMax-H3 checkpoint 兼容的维度。
验证
已检查转换后 LoRA 结构的以下方面:
- 完整的 LoRA A/B 适配器对;
- 没有孤立的 A 或 B 张量;
- 保留的键使用
diffusion\_model\.\*命名空间; - 没有重复的
diffusion\_model\.diffusion\_model\.\*前缀; - 没有不兼容的
adaln\_proj张量; - 保留 BF16 数据类型;
- 保留张量形状;
- 保留 LoRA 秩;
- EMA 和非 EMA 权重彼此分离;
- 在 ComfyUI 加载器级别的验证中没有未解析的保留键。
原始源文件未被覆盖。
这些 LoRA 已在 ComfyUI 中测试通过以下可选加速方法:
- SageAttention
- Sol Attention
- Gradient
- Spectrum
这些加速方法是可选的,不包含在本仓库中。
重要限制
这些文件是 剪枝/曲线形式 MiniMax-H3 checkpoint 的部分 ComfyUI 兼容版本。
进一步训练的 ckpt500 变体在初始兼容版本的基础上有所改进,
使用方法
将 LoRA 文件放入:
ComfyUI/models/loras/
与 适用于 ComfyUI 的剪枝/曲线形式 MiniMax-H3 checkpoint 配合使用。
推荐的进一步训练版本:
minimax\_h3\_turbo\_4step\_ckpt500\_pruned\_comfyui\.safetensors
进一步训练的 EMA 版本:
minimax\_h3\_turbo\_4step\_ema\_ckpt500\_pruned\_comfyui\.safetensors
建议的 ComfyUI 设置:
- 视频 sigma shift:
12 - 音频 sigma shift:
4\-6 - 已测试可行的步数:
8–10/6\-8(ckpt500) - 推荐采样器:
res\_multistep - 建议 LoRA 强度:
0\.8–1\.8 - 采样步数越少,通常可以使用越高的 LoRA 强度
- 比较文件时,请使用相同的提示词、种子、分辨率、模型 checkpoint、采样器和工作流
已确认可用的可选加速器:
- SageAttention
- Sol Attention
- Gradient
- Spectrum
在检查采样器、调度器和音频 sigma 偏移配置之前,不要假定音频损坏是由 LoRA 引起的。
音频与调度器说明
MiniMax-H3 将视频和同步音频生成为独立流,二者具有不同的调度要求。
原始作者的独立生成实现使用专门为超低步数生成设计的双重视频/音频调度系统。
对于此 ComfyUI 剪枝模型版本,已测试的设置如下:
- 视频 sigma shift:
12 - 音频 sigma shift:
4\-6 - 步数:
8–10/6\-8(ckpt500) - 采样器:
res\_multistep
错误的音频调度可能导致:
- 音频爆音;
- 严重失真;
- 类似噪声的音频;
- 音频能量不稳定;
- 音频完全损坏。
有关原始全模型设置、模型文件、分辨率指南、帧数规则和双调度器实现,请遵循原始 README:
larryvrh/MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)
署名
原始 MiniMax-H3 Turbo LoRA 作者:
larryvrh (https://huggingface.co/larryvrh)
原始项目:
MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)
本仓库包含用于剪枝/曲线形式 MiniMax-H3 checkpoint 的第三方部分 ComfyUI 兼容版本,包括进一步训练的 checkpoint-500 变体。
我不声明对以下内容的作者身份:
- 原始 Turbo LoRA 权重;
- 原始 LoRA 训练;
- 原始蒸馏方法;
- 原始四步采样方法;
- 原始双重视频/音频调度器;
- 原始
generate\.py; - 原始文档;
- MiniMax-H3 基础模型;
- 剪枝/曲线形式的 MiniMax-H3 checkpoint。
在使用或再分发这些文件时,请保留对 larryvrh 的署名,并遵守原始 LoRA 和 MiniMax-H3 基础模型的许可证与条款。
相似文章
larryvrh/MiniMax-H3-Turbo-Lora
这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。
Kijai/MiniMax-H3_comfy
一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。
@aisearchio: 终于来了!Minimax H3 Turbo lora 让生成速度快 5 倍。只需 4 步而不是 20 步。https://huggingfa…
MiniMax-H3 的早期预览版 LoRA 支持 4 步音视频生成,取代约 20 步,采样速度大约提升 5 倍,但质量仍不成熟。
Comfy-Org/MiniMax-H3
Comfy-Org 为 ComfyUI 重新打包了 MiniMax-H3 模型文件,包括扩散模型、文本编码器和 VAE,并提供了用于文本生成视频、图像生成视频和参考生成视频的工作流模板。
@_akhaliq:MiniMax-H3-Turbo-Lora https://huggingface.co/spaces/akhaliq/MiniMax-H3-Turbo-Lora…
一条推文,分享了 MiniMax-H3-Turbo-Lora 的 Hugging Face Space,这是 MiniMax H3 Turbo 模型的 LoRA 微调变体。