@RisingSayak:开源权重社区的这一周真是精彩!Diffusers团队因此工作非常繁忙 > MiniMax H3: ht…
摘要
Diffusers团队宣布了多个开源权重AI模型,包括MiniMax H3、LTX 2.5、Wan Animate 2和MiniMax Music 3,突显了在多模态视频和音频生成方面的进步。
查看缓存全文
缓存时间: 2026/08/18 02:30
开源权重社区这周真是惊喜不断!Diffusers团队因此忙得不可开交:
MiniMax H3:http://hf.co/MiniMaxAI/MiniMax-H3…(视频+音频)
LTX2.5:https://huggingface.co/Lightricks/LTX-2.5-Diffusers…(视频+音频)
Wan Animate 2:https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B-Distilled-Diffusers…
MiniMax Music 3:https://huggingface.co/MiniMaxAI/MiniMax-Music3…
这些绝对是令人收获满满的项目!如果还没来得及体验,这个周末就是绝佳时机!
MiniMaxAI/MiniMax-H3 · Hugging Face
来源:https://huggingface.co/MiniMaxAI/MiniMax-H3
MiniMax 海螺AI (https://hailuoai.video/)
API (https://platform.minimax.io/docs/guides/text-generation)
MiniMax 官网 (https://www.minimax.io/)
GitHub (https://github.com/MiniMax-AI/MiniMax-H3)
Hugging Face (https://huggingface.co/MiniMaxAI/MiniMax-H3)
ModelScope MiniMax AI (https://modelscope.cn/organization/minimax)
微信 (https://platform.minimaxi.com/docs/faq/contact-us)
Discord (https://discord.com/invite/dbMxutw7tP)
许可证 (https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/LICENSE)
新闻
官方提示词写作技巧:GitHub 技巧库 (https://github.com/MiniMax-AI/MiniMax-H3/tree/main/skills)
在线 API
直接通过 API 使用 MiniMax-H3。
- 全球:platform.minimax.io (https://platform.minimax.io/docs/api-reference/video-generation-v2-create) | 中国:platform.minimaxi.com (https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create)
在线应用
直接通过应用使用 MiniMax-H3。
- 网页应用
全球:hailuoai.video (https://hailuoai.video/tools/minimax-h3) | 中国:hailuoai.com (https://hailuoai.com/) - 桌面应用
全球:hub.minimax.io (https://hub.minimax.io/) | 中国:hub.minimaxi.com (https://hub.minimaxi.com/)
系统概述
MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频构成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长最长 15 秒且带有原生立体声音频的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,从而在执行复杂多模态指令时表现优异。
H3 支持以下输入与输出规格:
| 类别 | 规格 |
|---|---|
| 输出时长 | 4-15 秒 |
| 输出宽高比 | 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16 |
| 输出分辨率 | 支持多种分辨率。默认较短边为 768 像素。可通过 H3-Regenerate-2K 实现 2K 生成 |
| 输出帧率 | 24 FPS |
| 输出音频 | 32 kHz 立体声 |
| 支持对话语言 | 稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。其他语言在不同程度上也受支持 |
模型变体与输入规格
| 模型变体 | 输入模式 | 规格说明 |
|---|---|---|
| H3-Base-FL2VA | 首尾帧模式 | 支持输入零张、一张或两张图像。- 无图像输入:文本生视频模式 - 输入一张图像:首帧生视频或尾帧生视频 - 输入两张图像:首尾帧生视频 |
| H3-Base-Ref2VA | 全参考模式 | 支持多模态参考输入:- 图像:≤ 9 张 - 视频:≤ 3 段;每段须为 2-15 秒;总时长 ≤ 15 秒 - 音频:≤ 3 段;每段须为 2-15 秒;总时长 ≤ 15 秒 - 混合输入:所有输入类型文件总数最多为 12 个 |

完整的 H3 系统包含以下三个模块:
- H3-Context-IR:随着输入复杂度增加,我们构建了一个专用系统,用以深度理解并优化输入的多模态指令,然后将其转换为 H3 易于理解的形式——上下文中间表示,用于生成。H3-Context-IR 对最终输出质量至关重要,因此我们强烈建议将其纳入你的生成流程,或遵循「提示词指引」来构建你自己的上下文处理系统。
- H3-Base:基于 H3-Context-IR 的输出生成音频和视频,生成结果为 768p 分辨率。
- H3-Regenerate-2K:将 768p 的结果连同原始上下文一起反馈给 H3,以重新生成 2K 分辨率的输出。此过程既利用了 H3 强大的生成能力,也利用了原始上下文中蕴含的丰富信息,使其能够产生细节更精确、视觉保真度更高的高分辨率输出。
模型架构
H3-Context-IR
H3-Context-IR 是一个托管的预处理与编排系统,专为自由形式的多模态输入而设计。它解读文本、图像、音频和参考视频之间的关系,以及这些材料与预期生成输出之间的关联。其内部工作流程包括指令解析、跨模态关联、时序理解和复杂逻辑推理。H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它也可能在适当的地方补充缺失或未明确的语义细节。
由于 H3-Context-IR 依赖多阶段工作流程以及多个托管模型和服务,因此未包含在此次开源发布中。我们提供了一个 API,允许用户复现官方工作流程的行为。我们还提供了详细的教程,开发者可以遵循提示词指引来构建自己的预处理系统。详细使用说明请参阅推荐工作流程 — 完整 2K 工作流程。
安全防护
用户提交的文本、图像和视频,以及增强后的提示词,都会经过自动审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们使用行业标准的过滤措施,但无法完全杜绝误判。这些防护措施不影响许可证持有人在 MiniMax H3 社区许可下的义务,特别是与合法使用和使用限制相关的义务。
H3-Base

架构概述
- H3-Base 使用相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成一个统一的打包多模态序列。在将整个序列送入 H3-Omni-Transformer 之前,使用 RoPE 来捕捉令牌之间必要的空间和时间关系。
- 具体而言,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频则仅由 H3-AudioVAE 编码。
- H3-Omni-Transformer 联合预测视频和音频的潜变量,然后分别解码为视频和立体声音频。
- 为了减少长多模态序列的计算成本,H3 原生支持稀疏注意力训练和推理。首次开源版本仅提供全注意力推理。我们的稀疏注意力实现将在未来更新中发布。
H3-Encoder
- H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并向 H3-Omni-Transformer 提供其第 50 层的隐藏状态。
- 我们在分词器配置中添加了几个特殊令牌,如
<image>、<video>、<audio>。使用 H3 时,需要 H3 仓库中提供的分词器及关联配置文件。
H3-VAE
H3 使用独立的视觉和音频潜变量来表示各自的模态。
H3-VisualVAE
- H3-VisualVAE 是一个时序因果视频自编码器,空间压缩因子为 16×,时间压缩因子为 4×,具有 24 个潜变量通道,记为 f16t4d24。我们应用了多种潜变量空间优化技术,以共同提高重建质量和潜变量可学习性。
- 在送入 H3-Omni-Transformer 之前,视觉潜变量会进一步按
1 × 2 × 2的大小沿(时间, 高度, 宽度)维度进行分块。因此,进入 Transformer 的视觉令牌具有 32× 的有效空间下采样因子,而时间下采样因子仍为 4×。 - H3-VisualVAE 的潜变量空间针对重建质量和生成模型易于学习进行了双重优化。在训练其编码器后,我们额外训练了一个基于 ViT 的解码器,以降低解码成本并进一步提高重建质量。
H3-AudioVAE
- H3-AudioVAE 对左右声道使用相同的编码器和解码器,同时独立处理每个声道。解码后的声道随后被重新组合,从而支持立体声音频的输入和输出。
- 对于每个声道,H3-AudioVAE 将 32 kHz 的音频压缩为时间速率为 40 Hz 的一系列潜变量令牌。
- 受 VA-VAE 的启发,我们优化了潜变量空间,在保持音频重建质量的同时使其更容易被生成模型学习。
H3-Omni-Transformer
- 为兼顾可扩展性和泛化性,我们采用了相对简单的 Transformer 块设计。H3-Omni-Transformer 是一个拥有 330 亿参数的稠密单流 Transformer,其中约 130 亿参数位于与 AdaLN 相关的分支中。由于 AdaLN 的调制输出可以预计算并缓存,这些参数在仅推理部署时无需加载。我们发布完整的模型权重以支持进一步开发,包括微调。
- 注意力层和 FFN 层均不包含模态特定的结构。模态特定的参数仅限于输入/输出层和 AdaLN 分支。特别是,模态特定的 AdaLN 以相对较低的额外训练和推理成本提升了生成质量。
- 模型使用三维多模态旋转位置嵌入(MM-RoPE)来表示在时间和两个空间维度
(t, h, w)上的位置关系。 - 在训练的最后阶段,我们引入了原生稀疏注意力以降低长序列的计算成本。稀疏注意力实现未包含在首次开源版本中,将在未来更新中单独发布。
H3-Regenerate-2K
- 对于 H3 的 2K 分辨率输出,我们不使用传统的专用超分辨率模块,而是使用 H3 基础模型通过上下文内再生的方式重新生成其自身的低分辨率结果。
- 这种方法有两个优势:(1) 再生过程可以最大限度地重用 H3 基础模型的生成能力;(2) 上下文内格式在产生高分辨率输出时可以重用原始多模态上下文,使其能够恢复传统超分辨率方法不得不“猜测”的信息,例如小文本和精细细节。
- 上下文内再生也是任务泛化的一个例子。
- **由于系统复杂性,此模块尚未开源。一旦准备就绪,我们将发布它。**我们提供了一个 API 用于验证官方结果;请参阅下文“完整 2K 工作流程”。
推荐工作流程
为了帮助社区正确部署 MiniMax H3,我们提供了两种验证方法。由于完整的 H3 系统由三个模块组成——H3-Context-IR、H3-Base 和 H3-Regenerate-2K——因此“完整 2K 工作流程”提供了一个端到端的 2K 输出验证流程,将开放平台 API 与本地部署的 H3-Base 相结合。“H3-Base 本地部署”部分提供了仅使用本地部署的 H3-Base 来验证 768p 输出的方法。此外,“提示词指引”部分提供了详细教程,帮助社区开发自己的提示词系统。
H3-Base 本地部署
MiniMax H3 以两个针对特定任务的检查点形式发布。每个检查点包含一个专用的全模态 Transformer 模型,以及所需的处理器、分词器、文本编码器、视觉 VAE 和独立的音频 VAE 组件。
| 检查点 | 支持任务 | 输入条件 | 输出 | 精度 |
|---|---|---|---|---|
| MiniMax-H3 Base FL2VA | 文本到音视频(t2va)、首/尾帧到音视频(fl2va) | 文本;可选的首帧、尾帧或两者 | 视频和音频 | BF16 |
| MiniMax-H3 Base Ref2VA | 参考到音视频(ref2va) | 带有参考图像、视频和/或音频的文本 | 视频和音频 | BF16 |
发布的检查点是经过 CFG 蒸馏的全模态 Transformer 模型权重。每个检查点都作为自包含的 Hugging Face 风格仓库分发,包含以下组件:
/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/
下载模型
该仓库并行托管了原始检查点(FL2VA/、Ref2VA/)和 diffusers 格式,因此请根据你的框架需求确定下载范围:
model_index.json 是仓库级的公共入口。特定任务族的 diffusers 索引仍位于 FL2VA/model_index.json 和 Ref2VA/model_index.json 下。
# 原始检查点,两个任务族 (SGLang, vLLM):
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3
# 或单个任务族:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" --local-dir MiniMax-H3
diffusers 用户无需手动下载:ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 会精确获取所需的组件。参阅 diffusers 文档 (https://huggingface.co/docs/diffusers/main/en/api/pipelines/minimax_h3) 了解加载方法。
我们推荐以下推理框架来服务该模型:
- SGLang (https://docs.sglang.io/) - 参阅 cookbook (https://docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3)
- vLLM (https://github.com/vllm-project/vllm) - 参阅 vllm 食谱 (https://recipes.vllm.ai/MiniMaxAI/MiniMax-H3)
- diffusers (https://github.com/huggingface/diffusers) - 参阅 diffusers 文档 (https://huggingface.co/docs/diffusers/main/en/api/pipelines/minimax_h3)
- ComfyUI (https://github.com/Comfy-Org/ComfyUI) - 参阅 Comfy 教程 (https://docs.comfy.org/tutorials/video/minimax/minimax-h3);使用 R2V 模板 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_r2v.json) / T2V 模板 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json)
SGLang 部署
相似文章
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
@PrajwalTomar_: China may have just had another DeepSeek moment, this time for AI video. MiniMax H3 is now open-weight: a powerful 33B …
MiniMax releases H3, a powerful open-weight 33B omni-modal video model supporting text, images, video, and audio, with local deployment on consumer GPUs and significantly lower cost than competitors like Seedance.
中国MiniMax H3成为首个登顶AI视频排名的开放模型(2分钟阅读)
MiniMax发布了开放权重的H3视频模型,这是首个登顶AI视频排名的开放模型,在视频编辑中排名第一,在文本生成视频中排名第二。该33B参数模型可处理文本、图像、视频和音频,但部分组件如2K分辨率和H3-Context-IR仍未开放。
@Modular: MiniMax 从最初阶段就设计了 H3 以实现硬件兼容性,然后开放了权重,使人们能够在更多芯片上运行它…
MiniMax 的 H3 模型设计用于广泛的硬件兼容性与开放权重,其对 AI 视频的影响将在 ModCon 2026 直播活动中讨论。
MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频
MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。