MiniMax H3(10分钟阅读)

TLDR AI 模型

摘要

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

MiniMax H3 是一款开放模型,打破了任务和模态之间的界限。它能够理解跨文本、图像、视频和音频的统一上下文。该模型可生成最长 15 秒、2K 分辨率的视频,并带有原生立体声。H3 在指令跟随、精确的文本和品牌渲染以及 V2V 运动迁移方面表现出色。早期测试表明,它已可用于广泛的商业内容创作场景。
查看原文
查看缓存全文

缓存时间: 2026/07/31 18:27

MiniMax H3是一款开放模型,打破了任务与模态之间的边界。它能理解文本、图像、视频和音频的统一上下文。该模型可以生成最长15秒、2K分辨率、带原生立体声的视频。H3在指令遵循、准确的文字与品牌渲染以及V2V动作迁移方面表现出色。早期测试表明,它已准备好面向广泛的用例进行商业内容创作。


MiniMax H3:打破任务与模态边界的开放模型

今天,我们正式发布MiniMax H3,一款通用多模态生成模型。H3能够理解文本、图像、视频和音频的统一上下文,生成带原生立体声的视频,最长15秒,分辨率达2K。

早期测试表明,H3已准备好面向广泛的用例进行商业内容创作,在指令遵循、准确的文字与品牌渲染以及V2V动作迁移方面表现出色。凭借精准、可控的多模态生成与编辑能力,H3专为广告、品牌、电商、产品设计、UI/UX、游戏等领域而生。

H3由上下文全模态表示(Contextual Omni Representation)、H3-VAE、H3-Omni Transformer和上下文内再生(In-Context Regeneration)等技术驱动,提供业界领先的性价比。我们默认提供2K分辨率。在2K下,H3的每秒价格不到主流模型的三分之一;在768p下,价格不到主流模型720p的一半。

长期以来,闭源模型主导着视频生成领域,其迭代速度较慢,生态系统也不如大语言模型等领域开放。为了支持开源社区、加速与更广泛AI硬件的兼容,并让用户更轻松地构建自己的定制版本,我们计划在近期开放模型权重(须遵守适用的法律法规)。硬件兼容性从H3设计的最早期起就是关键考量因素。

H3模型亮点

1. 多模态上下文理解

真正的创意工作需要在不同模态之间融合复杂信息,将图像、音频、视频等作为输入来源。例如,下面这个镜头的提示词是:“参考视频1中的希区柯克式镜头运动,让图2中的角色唱歌,人声与音频3匹配。”只需用文字描述上下文与目标视频之间的关系,H3便能自行完成复杂的全模态理解。

多模态输入

视频1

视频1

图2

图2

音频3

音频3

H3生成的视频

0:06

2. 2K性能

**3. **原生立体声

H3使用场景

1. 电影片头标题

**2. **产品网站

3. 动态海报

4. 广告与电商

H3的设计理念

打破任务边界:从专用走向通用

我们开发了两代前代模型:Hailuo 01从零开始构建系统,Hailuo 02则专注于改进核心组件,如架构效率、数据质量和规模。

在设计H3时,我们认识到此前生成模型在任务边界上的局限:图像生成通常被拆分为多个专家模型,分别处理T2I、编辑、主体参考、动作参考和风格参考;音频生成中的语音、音效和音乐也大多作为独立领域研究;视频生成则进一步碎片化为文生视频、图生视频、首尾帧、主体参考、动作参考、语音参考、视频编辑等,图像、视频和音频之间也存在清晰边界。

这些彼此割裂的任务、能力和模态,在实践中限制了创作自由。同时,在训练方面,也限制了模型的泛化能力。这些都表明,应用范式和训练范式都有很大的变革空间。因此,H3开发的第一条原则就是跨任务统一与泛化。

基于此,以下简要介绍H3的预训练范式:

1. 数据与任务

文生图像

文生视频 音频联合生成,所有音频输出均为原生立体声 原生多镜头建模

文生音频 语音、音效、音乐不分离——统一联合建模

2. 通用参考与编辑

图生图参考与编辑

图生视频参考与编辑

音频到音频参考与编辑

音频视频到音频视频参考与编辑

在我们的设计中,“通用参考与编辑”意味着:

  • 完全基于真实自然数据构建,具备强大的数据可扩展性。

  • 参考与编辑关系通过自然语言表达,而非局限于固定任务集;语言(或广义上的智能结构)是通向泛化的桥梁。

3. 架构

尽早融合多样的数据类型和任务——正确的混合比例是关键。

4. 训练策略

在训练中尽早融合多样的数据类型和任务——正确的混合比例是关键。

这些选择都指向同一个目标:让H3从预训练阶段起就具备广泛的多模态上下文理解与生成能力。

前面我们谈到了训练范式的转变,那么视频模型的应用格局又在发生怎样的变化?

我们看到创作者直接用自然语言描述自己的意图,而不仅仅是输入一个简单的视觉提示。随着多模态理解、指令遵循和复杂任务执行能力的持续提升,视频模型将能够把握更完整的创作意图,处理更复杂的内容需求,并逐步从“生成一段片段”走向真正参与整个内容生产流程。

H3的技术选择

H3的设计理念很简单——但构建它绝非易事。从Hailuo-01到Hailuo-02再到H3,每一代的工程复杂度相比上一代都增长了约10倍。

以下是H3部分核心技术的简要介绍:

1. H3-上下文全模态表示

在H3的工程实现中,我们做的最重要的事情之一就是增强其字幕(captioning)能力。

  • 引入多模态上下文进一步拓宽了“字幕”需要覆盖的范围——我们不仅描述目标视频,还要描述上下文与目标视频之间的关系,甚至上下文内部各元素之间的关系。

  • 我们需要联合描述视频和音频,而这种音视频关系在多镜头场景下变得更加复杂。

  • 这本质上是一种上下文全模态表示(Contextual Omni Representation),语言在其中充当可泛化的桥梁和解释器,将“任务”统一为一种开放的、描述性的形式。这正是H3强大指令遵循能力的根源。

  • 为此,我们构建了专用模型和全模态理解流水线。大多数源素材需要约10万token的推理,然后蒸馏为平均约4千token。

2. H3-VAE:架构效率的重大提升

H系列一直在持续推进tokenizer技术。到了H3,我们彻底重构了此前的tokenizer,在重建质量和可学习性方面全面提升,为H3带来了效率上的竞争优势。其高压缩比还让有效序列长度提升了4倍,大幅降低了训练和推理成本,也是我们原生支持2K分辨率的关键技术。

3. H3-Omni Transformer:为任务泛化而生的架构

秉承H3“架构服务于任务”的设计理念,泛化性和效率是仅有的两个目标。值得注意的是,我们放弃了Hailuo-02架构,尽管它曾带给我们显著的架构优势,因为对于以任务泛化为核心的模型来说,它会引入不必要的复杂性。我们相信任务泛化是不可逆转的趋势,架构上的技巧应当让位于模型本身的定义方式。

在H3中,多模态上下文的引入使序列长度方差增加了两倍,理解与生成的计算负载也变得更加异构。我们采用了一种将理解与生成工作负载分离的训练架构,分别优化硬件利用率,同时联合平衡样本内的异构计算与样本间的负载均衡。端到端来看,训练吞吐量提升了近30%。

4. H3-上下文内再生

对于H3的2K输出,我们没有使用常规的专用超分模块,而是让H3基础模型在上下文内对自身的低分辨率输出进行再生成。这带来两个优势:第一,再生成过程最大限度地复用了H3基础模型已有的生成能力;第二,上下文内方式让它能重新利用原始多模态上下文来生成高分辨率输出,恢复传统超分只能“猜测”、且往往无法还原的细节,比如小文字和精细纹理。

上下文内再生本身也是任务泛化的另一种表达。

我们很快将分享完整的H3技术报告,期待听到大家的反馈。

我们的愿景与下一步

语言、图像、视频和音频是人类体验的基本模态。它们深度互联,是我们与世界交互的主要界面。它们共同构成多模态上下文,能够高效地传达大量信息,而表达和分享信息的能力,本身就是一种生产力

对于多模态理解与生成,我们将语言视为一种可泛化、可扩展的计算系统。正因如此,我们相信多模态智能应当深度植根于语言。

H3仍有成长空间,以下是我们在未来版本中的优先方向:

  • 强大的多模态理解是高质量生成的基础,且还有巨大提升空间。在下一代H系列中,我们计划整合M系列模型的能力。

  • H3当前的模型规模在多项能力上仍有提升空间。扩展规模是明确的路径,我们相信更强的任务泛化能力将让我们充分释放其潜力。

  • 在特定场景下,视觉细节仍有改进空间。我们将继续向更高分辨率和更高视觉保真度迈进。

人人共享智能。

相似文章

MiniMax M3(2分钟阅读)

TLDR AI

MiniMax 推出了 M3,这是首个结合编程、智能体与多模态能力的开源权重模型,通过稀疏注意力机制支持高达 100 万 token 的上下文。

MiniMaxAI/MiniMax-M3

Hugging Face Models Trending

MiniMax 发布 M3,一款原生多模态模型,拥有100万上下文和约4280亿参数,采用 MiniMax Sparse Attention (MSA) 实现高效长上下文处理,达到前沿级别的编码和智能体性能。