MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频
摘要
MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。
暂无内容
查看缓存全文
缓存时间: 2026/08/03 16:33
# MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频
来源:https://blog.comfy.org/p/minimax-h3-day-0-support-in-comfyui
MiniMax H3 今日正式发布,并附带开放权重;从今天早上起,它已在 ComfyUI 中获得原生支持。Day 0 支持。
这是一款下一代开放权重视频模型。输入文本、图像、视频或音频,即可生成带有真实立体声的视频,画质最高可达 2K,单段最长 15 秒。它是 MiniMax 继 Hailuo 01 和 Hailuo 02 之后推出的第三代视频模型,也是该公司首款以开放权重形式发布的模型。
在 Comfy Cloud 上体验 (https://links.comfy.org/4pTj4QV)
- **文生视频**——仅需提示词。
- **图生视频**——让静态图像动起来。
- **首尾帧控制**——控制起始帧、结束帧,或两者同时控制,其余部分由模型生成。
- **参考生视频**——提供参考图像、视频或音频,在片段中保持主体、动作或声音的一致性。
输出支持最高 2K 分辨率、最长 15 秒。音频与视频在同一轮生成中完成,采用立体声,而非后期拼接。
这正是 MiniMax 的核心优势所在,也将五个独立任务整合进一个模型。实际工作中很少只依赖单一模态。H3 将图像、音频和视频整合处理,并根据提示词来解析它们之间的关系。描述输入内容与目标镜头之间的关系,模型便会自行完成跨模态处理。
音频是模型的原生能力,而非后期处理。每一条音频输出均为原生立体声。
对于节点图工作流而言,动作迁移是最重要的一项能力。参考视频可以提供运动信息——镜头运镜、表演动作、剪辑节奏——而主体和风格则来自其他来源。结合就地编辑,这意味着可以不断迭代优化一个镜头。
为了让 H3 在消费级硬件上良好运行,我们投入了大量的机器学习工程工作。我们发现,模型的调制权重(约占总参数量的 40%)可以进行剪枝,并用功能等效的查找表替代,从而在不损失输出质量的情况下大幅缩小内存占用。
此外,权重自带精确高效的 int8 convrot 量化,自定义内核进一步降低了推理过程中的峰值 VRAM 占用。
[](https://substackcdn.com/image/fetch/$s_!59Bc!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F98d2552b-d84c-4385-9602-bf344dca2ebe_1000x727.png)
最终,最小模型变体的总内存占用**降低了 66%,从全精度下的 123.6 GB 降至 42.5 GB**。结合我们的动态 VRAM 卸载技术,这一下一代 2K 视频模型可以在 RTX 3060 等 GPU 上本地运行。
1. 将 ComfyUI 更新至最新版本**0.30.0**,或前往 Comfy Cloud (https://links.comfy.org/4pTj4QV)
2. 下载下方的工作流,或在模板库中查找。下载 MiniMax H3 I2V 工作流 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_i2v.json) 下载 MiniMax H3 R2V 工作流 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_r2v.json) 下载 MiniMax H3 T2V 工作流 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json)
3. 按照工作流中的说明下载模型,并将其保存到正确的模型目录中。
4. 编写提示词,连接任何帧或参考输入,然后运行。
模型权重:🤗Comfy-Org/MiniMax-H3 (https://huggingface.co/Comfy-Org/MiniMax-H3)
一如既往,享受创作吧!
#### 关于本文的讨论
### 准备好开启更多内容了吗?
相似文章
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
@Modular: MiniMax 从最初阶段就设计了 H3 以实现硬件兼容性,然后开放了权重,使人们能够在更多芯片上运行它…
MiniMax 的 H3 模型设计用于广泛的硬件兼容性与开放权重,其对 AI 视频的影响将在 ModCon 2026 直播活动中讨论。
介绍 fal 推出的 H3 Max(5分钟阅读)
H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。
@PrajwalTomar_: China may have just had another DeepSeek moment, this time for AI video. MiniMax H3 is now open-weight: a powerful 33B …
MiniMax releases H3, a powerful open-weight 33B omni-modal video model supporting text, images, video, and audio, with local deployment on consumer GPUs and significantly lower cost than competitors like Seedance.
@RisingSayak:开源权重社区的这一周真是精彩!Diffusers团队因此工作非常繁忙 > MiniMax H3: ht…
Diffusers团队宣布了多个开源权重AI模型,包括MiniMax H3、LTX 2.5、Wan Animate 2和MiniMax Music 3,突显了在多模态视频和音频生成方面的进步。