MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频

Hacker News Top 模型

摘要

MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/03 16:33

# MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频 来源:https://blog.comfy.org/p/minimax-h3-day-0-support-in-comfyui MiniMax H3 今日正式发布,并附带开放权重;从今天早上起,它已在 ComfyUI 中获得原生支持。Day 0 支持。 这是一款下一代开放权重视频模型。输入文本、图像、视频或音频,即可生成带有真实立体声的视频,画质最高可达 2K,单段最长 15 秒。它是 MiniMax 继 Hailuo 01 和 Hailuo 02 之后推出的第三代视频模型,也是该公司首款以开放权重形式发布的模型。 在 Comfy Cloud 上体验 (https://links.comfy.org/4pTj4QV) - **文生视频**——仅需提示词。 - **图生视频**——让静态图像动起来。 - **首尾帧控制**——控制起始帧、结束帧,或两者同时控制,其余部分由模型生成。 - **参考生视频**——提供参考图像、视频或音频,在片段中保持主体、动作或声音的一致性。 输出支持最高 2K 分辨率、最长 15 秒。音频与视频在同一轮生成中完成,采用立体声,而非后期拼接。 这正是 MiniMax 的核心优势所在,也将五个独立任务整合进一个模型。实际工作中很少只依赖单一模态。H3 将图像、音频和视频整合处理,并根据提示词来解析它们之间的关系。描述输入内容与目标镜头之间的关系,模型便会自行完成跨模态处理。 音频是模型的原生能力,而非后期处理。每一条音频输出均为原生立体声。 对于节点图工作流而言,动作迁移是最重要的一项能力。参考视频可以提供运动信息——镜头运镜、表演动作、剪辑节奏——而主体和风格则来自其他来源。结合就地编辑,这意味着可以不断迭代优化一个镜头。 为了让 H3 在消费级硬件上良好运行,我们投入了大量的机器学习工程工作。我们发现,模型的调制权重(约占总参数量的 40%)可以进行剪枝,并用功能等效的查找表替代,从而在不损失输出质量的情况下大幅缩小内存占用。 此外,权重自带精确高效的 int8 convrot 量化,自定义内核进一步降低了推理过程中的峰值 VRAM 占用。 [](https://substackcdn.com/image/fetch/$s_!59Bc!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F98d2552b-d84c-4385-9602-bf344dca2ebe_1000x727.png) 最终,最小模型变体的总内存占用**降低了 66%,从全精度下的 123.6 GB 降至 42.5 GB**。结合我们的动态 VRAM 卸载技术,这一下一代 2K 视频模型可以在 RTX 3060 等 GPU 上本地运行。 1. 将 ComfyUI 更新至最新版本**0.30.0**,或前往 Comfy Cloud (https://links.comfy.org/4pTj4QV) 2. 下载下方的工作流,或在模板库中查找。下载 MiniMax H3 I2V 工作流 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_i2v.json) 下载 MiniMax H3 R2V 工作流 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_r2v.json) 下载 MiniMax H3 T2V 工作流 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json) 3. 按照工作流中的说明下载模型,并将其保存到正确的模型目录中。 4. 编写提示词,连接任何帧或参考输入,然后运行。 模型权重:🤗Comfy-Org/MiniMax-H3 (https://huggingface.co/Comfy-Org/MiniMax-H3) 一如既往,享受创作吧! #### 关于本文的讨论 ### 准备好开启更多内容了吗?

相似文章

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

介绍 fal 推出的 H3 Max(5分钟阅读)

TLDR AI

H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。