larryvrh/MiniMax-H3-Turbo-Lora
摘要
这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。
查看缓存全文
缓存时间: 2026/08/06 07:42
larryvrh/MiniMax-H3-Turbo-Lora · Hugging Face
MiniMax-H3 Turbo LoRA — 4 步音视频生成(早期预览)
这是一个针对 MiniMax-H3(https://huggingface.co/Comfy-Org/MiniMax-H3)的 LoRA,可以仅用 4 步采样 渲染出视频 + 同步立体声音频,而通常需要约 20 步——在采样墙钟时间上大约提升 5 倍。
⚠️**早期原型——权重和工具链皆是如此。**这些权重是早期、训练不足的检查点(非生产质量),下面的 ComfyUI 节点也是原型代码:**功能和兼容性不作保证。**不过在 4 步设置下,它已经明显优于基础模型——细节更锐利、音频更干净且同步更好——但请把这里的一切都当作进行中的尝鲜版,而不是成品。如果出了问题,请在节点仓库(https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo/issues)提交 issue。
在 ComfyUI 中使用(推荐)
自定义节点:Larryvrh/ComfyUI-MiniMax-H3-Turbo(https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo)——或在 ComfyUI-Manager 中搜索 “MiniMax-H3 Turbo”。
- 安装节点(通过 Manager,或
git clone到ComfyUI/custom_nodes)。 - 从此仓库下载一个
.safetensors文件放到ComfyUI/models/loras/。 - 从官方 MiniMax-H3 工作流(https://docs.comfy.org/tutorials/video/minimax/minimax-h3)(文本生视频或图片生视频)开始,做两处修改:
- 在模型加载器和采样器之间插入 MiniMax-H3 Turbo LoRA;
- 将输入到
SamplerCustomAdvanced的采样器替换为 MiniMax-H3 Turbo Sampler (4-step),并将调度器设置为 4 步(simple)。
其余部分保持官方工作流不变,因此 t2v 和 i2v 都可用。这里还附带了一个现成的 t2v 工作流(minimax_h3_t2v_turbo.json),节点仓库(https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo/tree/main/example_workflows)中也有——直接拖入 ComfyUI 即可。必须使用自定义采样器:MiniMax-H3 在两条不同的流调度上运行视频和音频,普通采样器在 4 步时会对音频过采样,导致出错。
- 步数:任何**≥ 4** 的步数都有效,步数越多效果越好——4 是快速默认值,6 或 8 更干净。调度器保持
simple。 - 基础模型:使用未剪枝的基础模型(
bf16或完整版int8_convrotDiT)。剪枝版本(pruned_int8、pruned_fp8)使用不同的时间条件层,与此 LoRA 不兼容。
权重
三个检查点,均为 bf16,约 744 MB,以标准低秩更新方式应用(W_eff = W + lora_B @ lora_A,alpha = rank,因此没有额外缩放):
| 文件 | ~步数 | 说明 |
|---|---|---|
minimax_h3_turbo_4step_ema_ckpt500.safetensors | ~500 | 最新、训练最充分——推荐默认(时间平均) |
minimax_h3_turbo_4step.safetensors | ~200 | 初始发布,已训练权重——在快速运动上略锐利 |
minimax_h3_turbo_4step_ema.safetensors | ~200 | 初始发布,时间平均——更柔和;已被 ckpt500 文件取代 |
训练仍在进行中;新检查点会陆续发布在这里。
独立使用(无 ComfyUI 图)
generate.py 是一个完全自包含的单文件——加载基础 DiT + LoRA,编码提示词,运行 4 步双调度采样器,解码并封装为 mp4。它仍然需要一份 ComfyUI 代码库来获取 H3 模型 / VAE / 文本编码器的定义:
# ComfyUI(固定到这些权重验证所用的提交)
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI && git checkout 14b05228cef127ce529bc0c08660770d4af3e9a8
pip install -r requirements.txt && cd ..
pip install -r requirements.txt # 本仓库:torch, safetensors, imageio-ffmpeg
# 将 Comfy-Org/MiniMax-H3 的基础权重放入 models/ 目录,然后:
python generate.py \
--comfyui ./ComfyUI \
--base models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \
--lora minimax_h3_turbo_4step_ema_ckpt500.safetensors \
--te models/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors \
--video-vae models/vae/minimax_h3_video_vae_fp16.safetensors \
--audio-vae models/vae/minimax_h3_audio_vae_fp32.safetensors \
--prompt "A corgi in a chef hat flipping a pancake, sizzling sounds and a cheerful bark." \
--width 1344 --height 768 --frames 124 --out corgi.mp4
说明
- 分辨率 / 时长:宽高为 32 的倍数;短边通常为 768。帧率按 24 fps 计算,并对齐到模型的 17·k+5 网格(124 ≈ 5 秒)。已验证范围 124–362 帧(5–15 秒)。
- 显存:基础模型很大(约 33 B);80 GB GPU 可流畅运行(独立脚本中的
--offload-adaln可将约 13 GB 显存换为 CPU 内存)。 - 步数:4 是设计目标,调度器为
simple。 - 音频:32 kHz 立体声,与视频对齐;两条流使用不同的流调度,并各自按自己的时钟集成。
相似文章
drbaph/MiniMax-H3-Turbo-Lora-ComfyUI
MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。
@aisearchio: 终于来了!Minimax H3 Turbo lora 让生成速度快 5 倍。只需 4 步而不是 20 步。https://huggingfa…
MiniMax-H3 的早期预览版 LoRA 支持 4 步音视频生成,取代约 20 步,采样速度大约提升 5 倍,但质量仍不成熟。
@_akhaliq:MiniMax-H3-Turbo-Lora https://huggingface.co/spaces/akhaliq/MiniMax-H3-Turbo-Lora…
一条推文,分享了 MiniMax-H3-Turbo-Lora 的 Hugging Face Space,这是 MiniMax H3 Turbo 模型的 LoRA 微调变体。
Kijai/MiniMax-H3_comfy
一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。
MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频
MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。