larryvrh/MiniMax-H3-Turbo-Lora

Hugging Face Models Trending 模型

摘要

这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。

任务:文生视频 标签:文生视频、文生音频、音视频、lora、minimax-h3、comfyui、base_model:Comfy-Org/MiniMax-H3、base_model:adapter:Comfy-Org/MiniMax-H3、license:apache-2.0、region:us
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:42

larryvrh/MiniMax-H3-Turbo-Lora · Hugging Face

MiniMax-H3 Turbo LoRA — 4 步音视频生成(早期预览)

这是一个针对 MiniMax-H3(https://huggingface.co/Comfy-Org/MiniMax-H3)的 LoRA,可以仅用 4 步采样 渲染出视频 + 同步立体声音频,而通常需要约 20 步——在采样墙钟时间上大约提升 5 倍。

⚠️**早期原型——权重工具链皆是如此。**这些权重是早期、训练不足的检查点(非生产质量),下面的 ComfyUI 节点也是原型代码:**功能和兼容性不作保证。**不过在 4 步设置下,它已经明显优于基础模型——细节更锐利、音频更干净且同步更好——但请把这里的一切都当作进行中的尝鲜版,而不是成品。如果出了问题,请在节点仓库(https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo/issues)提交 issue。

在 ComfyUI 中使用(推荐)

自定义节点:Larryvrh/ComfyUI-MiniMax-H3-Turbo(https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo)——或在 ComfyUI-Manager 中搜索 “MiniMax-H3 Turbo”

  1. 安装节点(通过 Manager,或 git cloneComfyUI/custom_nodes)。
  2. 从此仓库下载一个 .safetensors 文件放到 ComfyUI/models/loras/
  3. 从官方 MiniMax-H3 工作流(https://docs.comfy.org/tutorials/video/minimax/minimax-h3)(文本生视频或图片生视频)开始,做两处修改:
    • 在模型加载器和采样器之间插入 MiniMax-H3 Turbo LoRA
    • 将输入到 SamplerCustomAdvanced 的采样器替换为 MiniMax-H3 Turbo Sampler (4-step),并将调度器设置为 4 步simple)。

其余部分保持官方工作流不变,因此 t2v 和 i2v 都可用。这里还附带了一个现成的 t2v 工作流(minimax_h3_t2v_turbo.json),节点仓库(https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo/tree/main/example_workflows)中也有——直接拖入 ComfyUI 即可。必须使用自定义采样器:MiniMax-H3 在两条不同的流调度上运行视频和音频,普通采样器在 4 步时会对音频过采样,导致出错。

  • 步数:任何**≥ 4** 的步数都有效,步数越多效果越好——4 是快速默认值,6 或 8 更干净。调度器保持 simple
  • 基础模型:使用未剪枝的基础模型(bf16 或完整版 int8_convrot DiT)。剪枝版本pruned_int8pruned_fp8)使用不同的时间条件层,与此 LoRA 不兼容

权重

三个检查点,均为 bf16,约 744 MB,以标准低秩更新方式应用(W_eff = W + lora_B @ lora_A,alpha = rank,因此没有额外缩放):

文件~步数说明
minimax_h3_turbo_4step_ema_ckpt500.safetensors~500最新、训练最充分——推荐默认(时间平均)
minimax_h3_turbo_4step.safetensors~200初始发布,已训练权重——在快速运动上略锐利
minimax_h3_turbo_4step_ema.safetensors~200初始发布,时间平均——更柔和;已被 ckpt500 文件取代

训练仍在进行中;新检查点会陆续发布在这里。

独立使用(无 ComfyUI 图)

generate.py 是一个完全自包含的单文件——加载基础 DiT + LoRA,编码提示词,运行 4 步双调度采样器,解码并封装为 mp4。它仍然需要一份 ComfyUI 代码库来获取 H3 模型 / VAE / 文本编码器的定义:

# ComfyUI(固定到这些权重验证所用的提交)
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI && git checkout 14b05228cef127ce529bc0c08660770d4af3e9a8
pip install -r requirements.txt && cd ..
pip install -r requirements.txt   # 本仓库:torch, safetensors, imageio-ffmpeg

# 将 Comfy-Org/MiniMax-H3 的基础权重放入 models/ 目录,然后:
python generate.py \
  --comfyui ./ComfyUI \
  --base   models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \
  --lora   minimax_h3_turbo_4step_ema_ckpt500.safetensors \
  --te     models/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors \
  --video-vae models/vae/minimax_h3_video_vae_fp16.safetensors \
  --audio-vae models/vae/minimax_h3_audio_vae_fp32.safetensors \
  --prompt "A corgi in a chef hat flipping a pancake, sizzling sounds and a cheerful bark." \
  --width 1344 --height 768 --frames 124 --out corgi.mp4

说明

  • 分辨率 / 时长:宽高为 32 的倍数;短边通常为 768。帧率按 24 fps 计算,并对齐到模型的 17·k+5 网格(124 ≈ 5 秒)。已验证范围 124–362 帧(5–15 秒)。
  • 显存:基础模型很大(约 33 B);80 GB GPU 可流畅运行(独立脚本中的 --offload-adaln 可将约 13 GB 显存换为 CPU 内存)。
  • 步数:4 是设计目标,调度器为 simple
  • 音频:32 kHz 立体声,与视频对齐;两条流使用不同的流调度,并各自按自己的时钟集成。

相似文章

drbaph/MiniMax-H3-Turbo-Lora-ComfyUI

Hugging Face Models Trending

MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。

Kijai/MiniMax-H3_comfy

Hugging Face Models Trending

一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。