@aisearchio: 终于来了!Minimax H3 Turbo lora 让生成速度快 5 倍。只需 4 步而不是 20 步。https://huggingfa…
摘要
MiniMax-H3 的早期预览版 LoRA 支持 4 步音视频生成,取代约 20 步,采样速度大约提升 5 倍,但质量仍不成熟。
查看缓存全文
缓存时间: 2026/08/06 06:35
终于来了!MiniMax H3 Turbo LoRA 让生成速度提升 5 倍。只需 4 步,而不是 20 步。https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora… 另见:https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora/discussions/6…
larryvrh/MiniMax-H3-Turbo-Lora · Hugging Face
Source: https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora
https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora#minimax-h3-turbo-lora–4-step-audio-video-generation-early-previewMiniMax-H3 Turbo LoRA — 4 步音频-视频生成(早期预览)
一款用于 MiniMax-H3(https://huggingface.co/Comfy-Org/MiniMax-H3)的 LoRA,能够以 4 个采样步(而不是通常的约 20 步)生成视频 + 同步立体声音频——采样实际耗时大约加速 5 倍。
⚠️ 这是一个演示/预览检查点,并非最终模型。 它是正在进行中的训练的早期快照——训练不足,时间平均(EMA)版本尚未成熟,整体质量远不及完整训练所能达到的水平。但它确实已经显示出在 4 步下相比基础模型的明显改进:细节更清晰,音频更干净、同步更好(基础模型在同样 4 步下的效果)。将其视为方向的味道,而非终点。目前尚不支持 ComfyUI,后续会添加。
如果在 ComfyUI 中加载后音频完全损坏,那几乎肯定是调度器不匹配。如果采样器正确,此处的音频会有些粗糙但连贯(这是一个早期预览检查点);完全损坏——爆音、失真或类似噪声的音频——则说明采样器选错了。MiniMax-H3 在两条不同的流动调度(flow schedule)上运行视频和音频(视频 shift 12,音频 shift 3)。模型返回的是预缩放的音频速度(velocity),因此普通的单一调度(“flat”)采样器——ComfyUI 自带采样器就是这样——可以用一个调度同时步进两个流。这种近似在通常的 ~20 步时成立,但在像 4 步这样的超低步数下,平坦步进会在最后几步大幅超过音频调度,导致音频能量爆炸。要让音频在 4 步下正常工作,必须将平坦单调度采样器替换为双时钟采样器,在音频流自己的移位调度上对其进行积分(通过除以调度导数来恢复原始音频速度)。这正是本仓库中 generate.py 所做的,与 MiniMax-H3 官方的双调度器行为一致。
包含两个权重文件:
| 文件名 | 说明 |
|---|---|
minimax\_h3\_turbo\_4step\.safetensors | 训练权重 —— 更清晰,在快速运动下表现更好 |
minimax\_h3\_turbo\_4step\_ema\.safetensors | 时间平均权重 —— 更平滑,但在此检查点尚未成熟(EMA 还未来得及热身),因此可能看起来偏软 |
两者均为 bf16,约 744 MB,作为标准的低秩(low-rank)更新应用(W\_eff = W \+ lora\_B @ lora\_A,alpha = rank,因此无需额外缩放)。
https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora#quick-start快速开始
基础模型、VAE 和文本编码器来自官方 MiniMax-H3 发布,模型定义位于 ComfyUI 中,因此你需要一份 ComfyUI 的 checkout 副本:
# 1. ComfyUI(固定到已验证此权重的提交)
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI && git checkout 14b05228cef127ce529bc0c08660770d4af3e9a8
pip install -r requirements.txt && cd ..
# 2. 本发布版本
pip install -r requirements.txt # torch、safetensors、imageio-ffmpeg 等
# 3. 基础权重(来自 Comfy-Org/MiniMax-H3):bf16 DiT、int8 Qwen3-VL
# 文本编码器,以及视频+音频 VAE,放入 models/ 目录。
# 4. 生成
python generate.py \
--comfyui ./ComfyUI \
--base models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \
--lora minimax_h3_turbo_4step.safetensors \
--te models/text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors \
--video-vae models/vae/minimax_h3_video_vae_fp16.safetensors \
--audio-vae models/vae/minimax_h3_audio_vae_fp32.safetensors \
--prompt "A corgi in a chef hat flipping a pancake, sizzling sounds and a cheerful bark." \
--width 1344 --height 768 --frames 124 --out corgi.mp4
generate\.py 是一个独立的单文件:它加载基础 DiT 并合并 LoRA,使用 Qwen3-VL 对提示词进行编码,在模型原生的双视频/音频调度上运行 4 步采样,解码两个流并封装为 mp4。
https://huggingface.co/larryvrh/MiniMax-H3-Turbo-Lora#notes备注
- 分辨率 / 时长:宽度和高度是 16 的倍数(画布基于 32);短边通常为 768。帧率为 24 fps,并向上对齐到模型的 17·k+5 网格(124 ≈ 5 秒)。已验证范围是 124–362 帧(5–15 秒)。
- 显存:基础模型很大(约 33B)。
\-\-offload\-adaln将最大的时间步条件权重保留在 CPU fp32 中,节省约 13 GB;80 GB 显存的 GPU 可以轻松运行,较小显存的卡可以尝试开启 offload。 - 步数:4 是设计目标。
\-\-steps 8如果你的算力充足会更干净一些;调度在两种情况下相同。 - 音频:模型输出与视频对齐的 32 kHz 立体声;两个流使用不同的流动调度,`generate
相似文章
larryvrh/MiniMax-H3-Turbo-Lora
这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。
drbaph/MiniMax-H3-Turbo-Lora-ComfyUI
MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。
@_akhaliq:MiniMax-H3-Turbo-Lora https://huggingface.co/spaces/akhaliq/MiniMax-H3-Turbo-Lora…
一条推文,分享了 MiniMax-H3-Turbo-Lora 的 Hugging Face Space,这是 MiniMax H3 Turbo 模型的 LoRA 微调变体。
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
@VoidAsuka:很长一段时间没有好的开源视频生成模型了,所以我们做了一个。这是一个SOTA视频生成模型…
宣布推出开源SOTA视频生成模型MiniMax H3,具备商业级生成能力、无与伦比的成本效益以及开放权重。