@RisingSayak:开源权重社区的这一周真是精彩!Diffusers团队因此工作非常繁忙 > MiniMax H3: ht…

X AI KOLs Following 新闻

摘要

Diffusers团队宣布了多个开源权重AI模型,包括MiniMax H3、LTX 2.5、Wan Animate 2和MiniMax Music 3,突显了在多模态视频和音频生成方面的进步。

开源权重社区的这一周真是精彩!因此,Diffusers团队工作非常繁忙。 > MiniMax H3: http://hf.co/MiniMaxAI/MiniMax-H3… (视频 + 音频) > LTX2.5: https://huggingface.co/Lightricks/LTX-2.5-Diffusers… (视频 + 音频) > Wan Animate 2: https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B-Distilled-Diffusers… > MiniMax Music 3: https://huggingface.co/MiniMaxAI/MiniMax-Music3… 我必须说,这真是最让人 intellectual 满足的内容!如果你还没有机会试玩这些模型,即将到来的周末是个好时机!
查看原文
查看缓存全文

缓存时间: 2026/08/18 02:30

开源权重社区这周真是惊喜不断!Diffusers团队因此忙得不可开交:

MiniMax H3:http://hf.co/MiniMaxAI/MiniMax-H3…(视频+音频)
LTX2.5:https://huggingface.co/Lightricks/LTX-2.5-Diffusers…(视频+音频)
Wan Animate 2:https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B-Distilled-Diffusers…
MiniMax Music 3:https://huggingface.co/MiniMaxAI/MiniMax-Music3…
这些绝对是令人收获满满的项目!如果还没来得及体验,这个周末就是绝佳时机!


MiniMaxAI/MiniMax-H3 · Hugging Face

来源:https://huggingface.co/MiniMaxAI/MiniMax-H3

MiniMax 海螺AI (https://hailuoai.video/)
API (https://platform.minimax.io/docs/guides/text-generation)
MiniMax 官网 (https://www.minimax.io/)
GitHub (https://github.com/MiniMax-AI/MiniMax-H3)
Hugging Face (https://huggingface.co/MiniMaxAI/MiniMax-H3)
ModelScope MiniMax AI (https://modelscope.cn/organization/minimax)
微信 (https://platform.minimaxi.com/docs/faq/contact-us)
Discord (https://discord.com/invite/dbMxutw7tP)
许可证 (https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/LICENSE)

新闻

官方提示词写作技巧:GitHub 技巧库 (https://github.com/MiniMax-AI/MiniMax-H3/tree/main/skills)

在线 API

直接通过 API 使用 MiniMax-H3。

  • 全球:platform.minimax.io (https://platform.minimax.io/docs/api-reference/video-generation-v2-create) | 中国:platform.minimaxi.com (https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create)

在线应用

直接通过应用使用 MiniMax-H3。

  • 网页应用
    全球:hailuoai.video (https://hailuoai.video/tools/minimax-h3) | 中国:hailuoai.com (https://hailuoai.com/)
  • 桌面应用
    全球:hub.minimax.io (https://hub.minimax.io/) | 中国:hub.minimaxi.com (https://hub.minimaxi.com/)

系统概述

MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频构成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长最长 15 秒且带有原生立体声音频的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,从而在执行复杂多模态指令时表现优异。

H3 支持以下输入与输出规格:

类别规格
输出时长4-15 秒
输出宽高比支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
输出分辨率支持多种分辨率。默认较短边为 768 像素。可通过 H3-Regenerate-2K 实现 2K 生成
输出帧率24 FPS
输出音频32 kHz 立体声
支持对话语言稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。其他语言在不同程度上也受支持

模型变体与输入规格

模型变体输入模式规格说明
H3-Base-FL2VA首尾帧模式支持输入零张、一张或两张图像。- 无图像输入:文本生视频模式 - 输入一张图像:首帧生视频或尾帧生视频 - 输入两张图像:首尾帧生视频
H3-Base-Ref2VA全参考模式支持多模态参考输入:- 图像:≤ 9 张 - 视频:≤ 3 段;每段须为 2-15 秒;总时长 ≤ 15 秒 - 音频:≤ 3 段;每段须为 2-15 秒;总时长 ≤ 15 秒 - 混合输入:所有输入类型文件总数最多为 12 个

概览图

完整的 H3 系统包含以下三个模块:

  • H3-Context-IR:随着输入复杂度增加,我们构建了一个专用系统,用以深度理解并优化输入的多模态指令,然后将其转换为 H3 易于理解的形式——上下文中间表示,用于生成。H3-Context-IR 对最终输出质量至关重要,因此我们强烈建议将其纳入你的生成流程,或遵循「提示词指引」来构建你自己的上下文处理系统。
  • H3-Base:基于 H3-Context-IR 的输出生成音频和视频,生成结果为 768p 分辨率。
  • H3-Regenerate-2K:将 768p 的结果连同原始上下文一起反馈给 H3,以重新生成 2K 分辨率的输出。此过程既利用了 H3 强大的生成能力,也利用了原始上下文中蕴含的丰富信息,使其能够产生细节更精确、视觉保真度更高的高分辨率输出。

模型架构

H3-Context-IR

H3-Context-IR 是一个托管的预处理与编排系统,专为自由形式的多模态输入而设计。它解读文本、图像、音频和参考视频之间的关系,以及这些材料与预期生成输出之间的关联。其内部工作流程包括指令解析、跨模态关联、时序理解和复杂逻辑推理。H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它也可能在适当的地方补充缺失或未明确的语义细节。

由于 H3-Context-IR 依赖多阶段工作流程以及多个托管模型和服务,因此未包含在此次开源发布中。我们提供了一个 API,允许用户复现官方工作流程的行为。我们还提供了详细的教程,开发者可以遵循提示词指引来构建自己的预处理系统。详细使用说明请参阅推荐工作流程 — 完整 2K 工作流程

安全防护
用户提交的文本、图像和视频,以及增强后的提示词,都会经过自动审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们使用行业标准的过滤措施,但无法完全杜绝误判。这些防护措施不影响许可证持有人在 MiniMax H3 社区许可下的义务,特别是与合法使用和使用限制相关的义务。

H3-Base

架构图

架构概述

  • H3-Base 使用相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成一个统一的打包多模态序列。在将整个序列送入 H3-Omni-Transformer 之前,使用 RoPE 来捕捉令牌之间必要的空间和时间关系。
  • 具体而言,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频则仅由 H3-AudioVAE 编码。
  • H3-Omni-Transformer 联合预测视频和音频的潜变量,然后分别解码为视频和立体声音频。
  • 为了减少长多模态序列的计算成本,H3 原生支持稀疏注意力训练和推理。首次开源版本仅提供全注意力推理。我们的稀疏注意力实现将在未来更新中发布。

H3-Encoder

  • H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并向 H3-Omni-Transformer 提供其第 50 层的隐藏状态。
  • 我们在分词器配置中添加了几个特殊令牌,如 <image><video><audio>。使用 H3 时,需要 H3 仓库中提供的分词器及关联配置文件。

H3-VAE

H3 使用独立的视觉和音频潜变量来表示各自的模态。

H3-VisualVAE
  • H3-VisualVAE 是一个时序因果视频自编码器,空间压缩因子为 16×,时间压缩因子为 4×,具有 24 个潜变量通道,记为 f16t4d24。我们应用了多种潜变量空间优化技术,以共同提高重建质量和潜变量可学习性。
  • 在送入 H3-Omni-Transformer 之前,视觉潜变量会进一步按 1 × 2 × 2 的大小沿 (时间, 高度, 宽度) 维度进行分块。因此,进入 Transformer 的视觉令牌具有 32× 的有效空间下采样因子,而时间下采样因子仍为 4×。
  • H3-VisualVAE 的潜变量空间针对重建质量和生成模型易于学习进行了双重优化。在训练其编码器后,我们额外训练了一个基于 ViT 的解码器,以降低解码成本并进一步提高重建质量。
H3-AudioVAE
  • H3-AudioVAE 对左右声道使用相同的编码器和解码器,同时独立处理每个声道。解码后的声道随后被重新组合,从而支持立体声音频的输入和输出。
  • 对于每个声道,H3-AudioVAE 将 32 kHz 的音频压缩为时间速率为 40 Hz 的一系列潜变量令牌。
  • 受 VA-VAE 的启发,我们优化了潜变量空间,在保持音频重建质量的同时使其更容易被生成模型学习。

H3-Omni-Transformer

  • 为兼顾可扩展性和泛化性,我们采用了相对简单的 Transformer 块设计。H3-Omni-Transformer 是一个拥有 330 亿参数的稠密单流 Transformer,其中约 130 亿参数位于与 AdaLN 相关的分支中。由于 AdaLN 的调制输出可以预计算并缓存,这些参数在仅推理部署时无需加载。我们发布完整的模型权重以支持进一步开发,包括微调。
  • 注意力层和 FFN 层均不包含模态特定的结构。模态特定的参数仅限于输入/输出层和 AdaLN 分支。特别是,模态特定的 AdaLN 以相对较低的额外训练和推理成本提升了生成质量。
  • 模型使用三维多模态旋转位置嵌入(MM-RoPE)来表示在时间和两个空间维度 (t, h, w) 上的位置关系。
  • 在训练的最后阶段,我们引入了原生稀疏注意力以降低长序列的计算成本。稀疏注意力实现未包含在首次开源版本中,将在未来更新中单独发布。

H3-Regenerate-2K

  • 对于 H3 的 2K 分辨率输出,我们不使用传统的专用超分辨率模块,而是使用 H3 基础模型通过上下文内再生的方式重新生成其自身的低分辨率结果。
  • 这种方法有两个优势:(1) 再生过程可以最大限度地重用 H3 基础模型的生成能力;(2) 上下文内格式在产生高分辨率输出时可以重用原始多模态上下文,使其能够恢复传统超分辨率方法不得不“猜测”的信息,例如小文本和精细细节。
  • 上下文内再生也是任务泛化的一个例子。
  • **由于系统复杂性,此模块尚未开源。一旦准备就绪,我们将发布它。**我们提供了一个 API 用于验证官方结果;请参阅下文“完整 2K 工作流程”。

推荐工作流程

为了帮助社区正确部署 MiniMax H3,我们提供了两种验证方法。由于完整的 H3 系统由三个模块组成——H3-Context-IR、H3-Base 和 H3-Regenerate-2K——因此“完整 2K 工作流程”提供了一个端到端的 2K 输出验证流程,将开放平台 API 与本地部署的 H3-Base 相结合。“H3-Base 本地部署”部分提供了仅使用本地部署的 H3-Base 来验证 768p 输出的方法。此外,“提示词指引”部分提供了详细教程,帮助社区开发自己的提示词系统。

H3-Base 本地部署

MiniMax H3 以两个针对特定任务的检查点形式发布。每个检查点包含一个专用的全模态 Transformer 模型,以及所需的处理器、分词器、文本编码器、视觉 VAE 和独立的音频 VAE 组件。

检查点支持任务输入条件输出精度
MiniMax-H3 Base FL2VA文本到音视频(t2va)、首/尾帧到音视频(fl2va文本;可选的首帧、尾帧或两者视频和音频BF16
MiniMax-H3 Base Ref2VA参考到音视频(ref2va带有参考图像、视频和/或音频的文本视频和音频BF16

发布的检查点是经过 CFG 蒸馏的全模态 Transformer 模型权重。每个检查点都作为自包含的 Hugging Face 风格仓库分发,包含以下组件:

/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/

下载模型
该仓库并行托管了原始检查点(FL2VA/Ref2VA/)和 diffusers 格式,因此请根据你的框架需求确定下载范围:
model_index.json 是仓库级的公共入口。特定任务族的 diffusers 索引仍位于 FL2VA/model_index.jsonRef2VA/model_index.json 下。

# 原始检查点,两个任务族 (SGLang, vLLM):
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3

# 或单个任务族:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" --local-dir MiniMax-H3

diffusers 用户无需手动下载:ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 会精确获取所需的组件。参阅 diffusers 文档 (https://huggingface.co/docs/diffusers/main/en/api/pipelines/minimax_h3) 了解加载方法。

我们推荐以下推理框架来服务该模型:

  • SGLang (https://docs.sglang.io/) - 参阅 cookbook (https://docs.sglang.io/cookbook/diffusion/MiniMax/MiniMax-H3)
  • vLLM (https://github.com/vllm-project/vllm) - 参阅 vllm 食谱 (https://recipes.vllm.ai/MiniMaxAI/MiniMax-H3)
  • diffusers (https://github.com/huggingface/diffusers) - 参阅 diffusers 文档 (https://huggingface.co/docs/diffusers/main/en/api/pipelines/minimax_h3)
  • ComfyUI (https://github.com/Comfy-Org/ComfyUI) - 参阅 Comfy 教程 (https://docs.comfy.org/tutorials/video/minimax/minimax-h3);使用 R2V 模板 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_r2v.json) / T2V 模板 (https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json)

SGLang 部署

相似文章

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。