H3-World:将语言理解转化为世界控制

Hugging Face Daily Papers 论文

摘要

H3-World 通过实现基于语言的时间控制,将 MiniMax-H3 视频生成器转变为交互式世界模型,并以最少的微调实现了有效控制。

我们介绍了 H3-World,一个高效的框架,它将 33B MiniMax-H3 视频生成器转变为交互式世界模型。我们的关键发现是,随着大型视频生成器能力增强,语言正成为控制的自然界面。例如,MiniMax-H3 已经支持通过自然语言指令对角色行为和摄像机运动进行零样本控制。基于此,H3-World 将这一粗粒度的语言界面转化为精确的、基于时间的世界控制,而无需引入专门的动作模块。具体来说,我们将每个动作表示为角色和摄像机指令的结构化组合,并将它们与相应的时间视频潜在变量对齐。为了使控制在时间上精确,我们进一步引入了时间注意力路由,将每个指令限制在其预期的时间间隔内,并减少动作间的控制泄漏。重要的是,H3-World 直接重用大规模视频预训练期间学习的语义表示,仅需要轻量级的适配。仅使用 8,000 个游戏样本、10,000 步 LoRA 优化和 0.199% 的可训练参数,H3-World 实现了有效的角色和摄像机控制,同时保持了强大的生成质量。它还能泛化到未见过的场景。这些结果表明,大型视频生成器中涌现的控制能力可以高效地转化为交互式世界控制。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:44

论文页面 - H3-World:将语言理解转化为世界控制

来源:https://huggingface.co/papers/2609.01560

摘要

我们提出了H3-World,一个高效的框架,它将33B MiniMax-H3视频生成器转变为交互式世界模型。我们的关键发现是,随着大型视频生成器能力增强,语言正作为一种自然的控制接口涌现。例如,MiniMax-H3已支持通过自然语言指令实现对角色行为和摄像机运动的零样本控制。在此基础上,H3-World将这一粗糙的语言接口转化为精确的、时间对齐的世界控制,且无需引入专用的动作模块。具体而言,我们将每个动作表示为角色与摄像机指令的结构化组合,并将其与相应的时间视频潜在变量对齐。为实现精确的时间控制,我们进一步引入了时间注意力路由机制,该机制将每条指令限制在其预定的时间区间内,减少了动作间的控制泄露。重要的是,H3-World直接复用了大规模视频预训练过程中学习到的语义表征,仅需轻量级的适配。仅使用8,000个游戏样本、10,000步LoRA优化以及0.199%的可训练参数,H3-World便在保持强大生成质量的同时,实现了有效的角色与摄像机控制。它还能泛化至未见过的场景。这些结果表明,大型视频生成器中涌现的控制能力可以被高效地转化为交互式世界控制。

查看arXiv页面 (https://arxiv.org/abs/2609.01560) 查看PDF (https://arxiv.org/pdf/2609.01560) 项目页面 (https://danzer1xxxxchan.github.io/H3-World/) GitHub (https://github.com/Danzer1xxxxChan/H3-World) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01560)

在你的代理中获取此论文:

hf papers read 2609.01560

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.01560 以从本页链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.01560 以从本页链接它。

引用此论文的Space 0

没有Space链接此论文

在Space README.md 中引用 arxiv.org/abs/2609.01560 以从本页链接它。

包含此论文的收藏 0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

介绍 fal 推出的 H3 Max(5分钟阅读)

TLDR AI

H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。

fal 发布 H3 Max

Product Hunt

Fal.ai 发布了 H3 Max,这是一款经过后训练的 MiniMax H3 变体,专门针对高质量视频生成进行了优化。据官方宣称,其在提示词遵循度、画面美学和生成速度方面均排名领先——生成 5 秒视频仅需约 3 秒,吞吐量达到官方 H3 模型的 35 倍。

alibaba-pai/MiniMax-H3-Fun-Controlnet-Union

Hugging Face Models Trending

MiniMax-H3-Fun-Controlnet-Union 是一个统一的 ControlNet 模型,用于 MiniMax-H3 视频生成器,支持使用各种条件进行控制,如 Canny、Depth、HED、MLSD、Pose 和视频修复。