H3-World:将语言理解转化为世界控制
摘要
H3-World 通过实现基于语言的时间控制,将 MiniMax-H3 视频生成器转变为交互式世界模型,并以最少的微调实现了有效控制。
查看缓存全文
缓存时间: 2026/09/02 03:44
论文页面 - H3-World:将语言理解转化为世界控制
来源:https://huggingface.co/papers/2609.01560
摘要
我们提出了H3-World,一个高效的框架,它将33B MiniMax-H3视频生成器转变为交互式世界模型。我们的关键发现是,随着大型视频生成器能力增强,语言正作为一种自然的控制接口涌现。例如,MiniMax-H3已支持通过自然语言指令实现对角色行为和摄像机运动的零样本控制。在此基础上,H3-World将这一粗糙的语言接口转化为精确的、时间对齐的世界控制,且无需引入专用的动作模块。具体而言,我们将每个动作表示为角色与摄像机指令的结构化组合,并将其与相应的时间视频潜在变量对齐。为实现精确的时间控制,我们进一步引入了时间注意力路由机制,该机制将每条指令限制在其预定的时间区间内,减少了动作间的控制泄露。重要的是,H3-World直接复用了大规模视频预训练过程中学习到的语义表征,仅需轻量级的适配。仅使用8,000个游戏样本、10,000步LoRA优化以及0.199%的可训练参数,H3-World便在保持强大生成质量的同时,实现了有效的角色与摄像机控制。它还能泛化至未见过的场景。这些结果表明,大型视频生成器中涌现的控制能力可以被高效地转化为交互式世界控制。
查看arXiv页面 (https://arxiv.org/abs/2609.01560) 查看PDF (https://arxiv.org/pdf/2609.01560) 项目页面 (https://danzer1xxxxchan.github.io/H3-World/) GitHub (https://github.com/Danzer1xxxxChan/H3-World) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01560)
在你的代理中获取此论文:
hf papers read 2609.01560
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.01560 以从本页链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.01560 以从本页链接它。
引用此论文的Space 0
没有Space链接此论文
在Space README.md 中引用 arxiv.org/abs/2609.01560 以从本页链接它。
包含此论文的收藏 0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
介绍 fal 推出的 H3 Max(5分钟阅读)
H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。
fal 发布 H3 Max
Fal.ai 发布了 H3 Max,这是一款经过后训练的 MiniMax H3 变体,专门针对高质量视频生成进行了优化。据官方宣称,其在提示词遵循度、画面美学和生成速度方面均排名领先——生成 5 秒视频仅需约 3 秒,吞吐量达到官方 H3 模型的 35 倍。
alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
MiniMax-H3-Fun-Controlnet-Union 是一个统一的 ControlNet 模型,用于 MiniMax-H3 视频生成器,支持使用各种条件进行控制,如 Canny、Depth、HED、MLSD、Pose 和视频修复。
HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。