drbaph/MiniMax-H3-Turbo-Lora-ComfyUI

Hugging Face Models Trending 模型

摘要

MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。

任务:文本生成视频 标签:minimax-h3, lora, adapter, comfyui, pruned, pruned-model, curve-form, text-to-video, text-to-audio, audio-video, video-generation, audio-generation, synchronized-audio, four-step, 4-step, turbo, accelerated-inference, further-trained, checkpoint-500, safetensors, bfloat16, bf16, partial-conversion, base_model:Comfy-Org/MiniMax-H3, base_model:adapter:Comfy-Org/MiniMax-H3, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/08/07 01:44

drbaph/MiniMax-H3-Turbo-Lora-ComfyUI · Hugging Face

MiniMax-H3 Turbo 4-Step — ComfyUI 剪枝模型 LoRA

本仓库包含原始 MiniMax-H3 Turbo LoRA — 4 步音视频生成预览 的第三方 ComfyUI 兼容转换版本,原始模型由 larryvrh (https://huggingface.co/larryvrh) 创建。

此外,仓库还包含两个 进一步训练的 checkpoint-500 变体,采用相同的剪枝模型 ComfyUI 格式。

这些 LoRA 专为 ComfyUI 使用的 剪枝/曲线形式 MiniMax-H3 checkpoint 设计。

另请查看 https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo

ComfyUI 测试输出

下载 ComfyUI 工作流 (https://huggingface.co/drbaph/MiniMax-H3-Turbo-Lora-ComfyUI/resolve/main/fl_minimax_h3_turbo_lora_example_workflow.json?download=true)

ComfyUI 工作流截图 (https://cdn-uploads.huggingface.co/production/uploads/63473b59e5c0717e6737b872/zfVV_yKP-njnOrGinGy8K.png)

原始项目

原始 LoRA 权重、训练工作、四步蒸馏方法、双重视频/音频采样实现、文档和源文件均由 larryvrh 创建并发布:

原始仓库: larryvrh/MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)

没有 训练、蒸馏或创建原始的 Turbo LoRA 权重。本仓库提供的是修改后的兼容版本,目的是让兼容的 LoRA 适配器能够在使用剪枝/曲线形式模型时,通过 ComfyUI 内置的 MiniMax-H3 LoRA 加载器加载。

原始 MiniMax-H3 Turbo LoRA 及其蒸馏方法的全部功劳归于 larryvrh

包含文件

文件描述
minimax\_h3\_turbo\_4step\_pruned\_comfyui\.safetensors原始非 EMA Turbo 权重的初步部分 ComfyUI 兼容转换版本,适用于剪枝/曲线形式的 MiniMax-H3 checkpoint。原作者描述非 EMA 权重更清晰,并且能更好地保持快速运动。
minimax\_h3\_turbo\_4step\_ema\_pruned\_comfyui\.safetensors原始 EMA Turbo 权重的初步部分 ComfyUI 兼容转换版本,适用于剪枝/曲线形式的 MiniMax-H3 checkpoint。原作者描述早期 EMA 权重更平滑,但由于 EMA 尚未完全成熟,因此更柔和。
minimax\_h3\_turbo\_4step\_ckpt500\_pruned\_comfyui\.safetensors进一步训练的 checkpoint-500 非 EMA 变体,采用剪枝模型 ComfyUI 格式。它是在初始预览 checkpoint 基础上继续训练的成果。
minimax\_h3\_turbo\_4step\_ema\_ckpt500\_pruned\_comfyui\.safetensors进一步训练的 checkpoint-500 EMA 变体,采用剪枝模型 ComfyUI 格式。其中包含进一步训练 checkpoint 的时间平均权重。
fl\_minimax\_h3\_turbo\_lora\_example\_workflow\.json使用 Turbo LoRA 的首帧和末帧 ComfyUI 示例工作流,带有可选的注意力和内存优化。

EMA 和非 EMA 文件保持独立,包含不同的张量值。

原始转换文件保留了初始预览权重,而 ckpt500 文件提供了进一步训练的变体。

这些是原始全模型 Turbo LoRA 的部分兼容版本,用于剪枝/曲线形式的 MiniMax-H3 架构。

应该使用哪个文件?

对于进一步训练的权重,请从以下文件开始:

minimax\_h3\_turbo\_4step\_ckpt500\_pruned\_comfyui\.safetensors

如需使用进一步训练的 EMA 变体进行对比:

minimax\_h3\_turbo\_4step\_ema\_ckpt500\_pruned\_comfyui\.safetensors

不带 ckpt500 的两个文件保留了早期的预览版本:

  • minimax\_h3\_turbo\_4step\_pruned\_comfyui\.safetensors
  • minimax\_h3\_turbo\_4step\_ema\_pruned\_comfyui\.safetensors

非 EMA 变体通常保持更锐利的响应和更强的快速运动表现,而 EMA 变体旨在提供更平滑的时间平均权重。

关于原始 Turbo LoRA

原始 MiniMax-H3 Turbo LoRA 是一个早期预览 checkpoint,旨在以大约 4 个采样步数(而不是通常的大约 20 个步数)生成联合视频和同步立体声音频,从而实现采样墙钟时间大约 5 倍 的缩减。

原作者明确指出,初始版本是正在进行中的训练运行所产生的未完成预览 checkpoint:

  • 训练不足;
  • 初始 EMA 权重尚未完全成熟;
  • 质量不能代表完整运行的结果;
  • 旨在作为项目方向的早期演示。

本仓库中额外的 ckpt500 文件是在该初始预览 checkpoint 基础上进一步训练的变体。

有关原始作者的文档、生成脚本、调度器实现和未来更新,请参阅原始仓库:

larryvrh/MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)

为什么进行此转换

原始 Turbo LoRA 文件使用如下张量键:

blocks\.0\.attn\.qkv\_proj\.lora\_A\.weight

ComfyUI 内置的 MiniMax-H3 LoRA 解析器期望键位于模型命名空间下:

diffusion\_model\.blocks\.0\.attn\.qkv\_proj\.lora\_A\.weight

如果没有该命名空间,ComfyUI 会报告如下警告:

\[WARNING\] lora key not loaded: blocks\.0\.attn\.out\_proj\.lora\_A\.weight

对保留的张量应用了以下命名空间转换:

  • blocks\.\*diffusion\_model\.blocks\.\*
  • token\_refiner\.\*diffusion\_model\.token\_refiner\.\*

保留的张量值、BF16 数据类型、张量形状、LoRA 秩以及 A/B 方向均保持不变。

转换细节

每个原始全模型 Turbo LoRA 包含:

组件数量
源张量518
源 LoRA A/B 对259

每个剪枝模型兼容转换版本包含:

组件数量
保留张量416
保留 LoRA A/B 对208
剪枝的 AdaLN 张量102
剪枝的 AdaLN A/B 对51

被剪枝的适配器包括:

  • 来自 blocks\.0blocks\.49 的 50 个 AdaLN 投影对;
  • 来自 final\_layer\.adaln\_proj\.linear 的 1 个 AdaLN 投影对。

保留的适配器包括:

  • 所有主块注意力适配器;
  • 所有主块 MLP 适配器;
  • 所有 token-refiner 注意力适配器;
  • 所有 token-refiner MLP 适配器。

保留的注意力、MLP 和 token-refiner 张量具有与剪枝/曲线形式的 MiniMax-H3 checkpoint 兼容的维度。

验证

已检查转换后 LoRA 结构的以下方面:

  • 完整的 LoRA A/B 适配器对;
  • 没有孤立的 A 或 B 张量;
  • 保留的键使用 diffusion\_model\.\* 命名空间;
  • 没有重复的 diffusion\_model\.diffusion\_model\.\* 前缀;
  • 没有不兼容的 adaln\_proj 张量;
  • 保留 BF16 数据类型;
  • 保留张量形状;
  • 保留 LoRA 秩;
  • EMA 和非 EMA 权重彼此分离;
  • 在 ComfyUI 加载器级别的验证中没有未解析的保留键。

原始源文件未被覆盖。

这些 LoRA 已在 ComfyUI 中测试通过以下可选加速方法:

  • SageAttention
  • Sol Attention
  • Gradient
  • Spectrum

这些加速方法是可选的,不包含在本仓库中。

重要限制

这些文件是 剪枝/曲线形式 MiniMax-H3 checkpoint 的部分 ComfyUI 兼容版本

进一步训练的 ckpt500 变体在初始兼容版本的基础上有所改进,

使用方法

将 LoRA 文件放入:

ComfyUI/models/loras/

适用于 ComfyUI 的剪枝/曲线形式 MiniMax-H3 checkpoint 配合使用。

推荐的进一步训练版本:

minimax\_h3\_turbo\_4step\_ckpt500\_pruned\_comfyui\.safetensors

进一步训练的 EMA 版本:

minimax\_h3\_turbo\_4step\_ema\_ckpt500\_pruned\_comfyui\.safetensors

建议的 ComfyUI 设置:

  • 视频 sigma shift:12
  • 音频 sigma shift:4\-6
  • 已测试可行的步数:8–10 / 6\-8(ckpt500)
  • 推荐采样器:res\_multistep
  • 建议 LoRA 强度:0\.8–1\.8
  • 采样步数越少,通常可以使用越高的 LoRA 强度
  • 比较文件时,请使用相同的提示词、种子、分辨率、模型 checkpoint、采样器和工作流

已确认可用的可选加速器:

  • SageAttention
  • Sol Attention
  • Gradient
  • Spectrum

在检查采样器、调度器和音频 sigma 偏移配置之前,不要假定音频损坏是由 LoRA 引起的。

音频与调度器说明

MiniMax-H3 将视频和同步音频生成为独立流,二者具有不同的调度要求。

原始作者的独立生成实现使用专门为超低步数生成设计的双重视频/音频调度系统。

对于此 ComfyUI 剪枝模型版本,已测试的设置如下:

  • 视频 sigma shift:12
  • 音频 sigma shift:4\-6
  • 步数:8–10 / 6\-8(ckpt500)
  • 采样器:res\_multistep

错误的音频调度可能导致:

  • 音频爆音;
  • 严重失真;
  • 类似噪声的音频;
  • 音频能量不稳定;
  • 音频完全损坏。

有关原始全模型设置、模型文件、分辨率指南、帧数规则和双调度器实现,请遵循原始 README:

larryvrh/MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)

署名

原始 MiniMax-H3 Turbo LoRA 作者:

larryvrh (https://huggingface.co/larryvrh)

原始项目:

MiniMax-H3-Turbo-Lora (https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora)

本仓库包含用于剪枝/曲线形式 MiniMax-H3 checkpoint 的第三方部分 ComfyUI 兼容版本,包括进一步训练的 checkpoint-500 变体。

我不声明对以下内容的作者身份:

  • 原始 Turbo LoRA 权重;
  • 原始 LoRA 训练;
  • 原始蒸馏方法;
  • 原始四步采样方法;
  • 原始双重视频/音频调度器;
  • 原始 generate\.py
  • 原始文档;
  • MiniMax-H3 基础模型;
  • 剪枝/曲线形式的 MiniMax-H3 checkpoint。

在使用或再分发这些文件时,请保留对 larryvrh 的署名,并遵守原始 LoRA 和 MiniMax-H3 基础模型的许可证与条款。

相似文章

larryvrh/MiniMax-H3-Turbo-Lora

Hugging Face Models Trending

这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。

Kijai/MiniMax-H3_comfy

Hugging Face Models Trending

一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。

Comfy-Org/MiniMax-H3

Hugging Face Models Trending

Comfy-Org 为 ComfyUI 重新打包了 MiniMax-H3 模型文件,包括扩散模型、文本编码器和 VAE,并提供了用于文本生成视频、图像生成视频和参考生成视频的工作流模板。