MiniMax-H3 能否推理物理世界?全模态生成模型评估

Hugging Face Daily Papers 论文

摘要

本文通过引入一个综合框架来评估 MiniMax-H3——一种全模态生成模型——在通过多模态输入推理物理世界方面的能力。评估显示,基于视频的决策推理表现最佳,而基于音频的歧义推理则最弱。

近期,全模态生成模型(全模态模型)在内容生成领域取得了进展,推动了文本、图像、视频和音频的统一建模。MiniMax-H3 通过在一个共享的潜在框架中结合多模态上下文理解与联合视听生成,体现了这一转变。其统一架构引发了一个基本问题:多模态对齐能否提升模型的世界推理能力?全模态输入又有哪些新的评估范式?为探讨此问题,本研究引入了一个围绕物理世界推理的四个互补维度组织的综合评估框架。不同于现有的视频生成和世界模型评估框架,这些框架通常受限于有限的输入模态和提示与目标视频内容紧密匹配的评估设置,我们的评估专门设计用于利用全模态模型的多模态输入。我们构建了一系列多样化的新型任务,要求模型整合跨模态的互补信息。具体来说,我们考虑了四种场景:隐式提示与多帧配对、音频-图像、前缀视频和音频-视频输入。每个模态仅提供关于底层事件的部分证据,要求模型联合推理互补的语义线索,以推断潜在的事件状态和未来动态。在517个评估实例中,MiniMax-H3 的总体成功率为41.97%。基于视频的决策推理成功率最高,达到56.00%,而基于音频的歧义推理最弱,仅为27.40%。这些结果表明,有效的多模态整合仍然是充分利用多样化输入模态优势的关键。项目地址:https://github.com/gulucaptain/MiniMax-H3-Reason。
查看原文
查看缓存全文

缓存时间: 2026/09/18 11:00

论文页面 - MiniMax-H3 能否推理物理世界?全模态生成模型评估

来源:https://huggingface.co/papers/2609.18323 作者:

,

,

,

,

,

,

,

,

,

,

摘要

近期全模态生成模型已推动内容生成迈向文本、图像、视频与音频的统一建模。MiniMax-H3 通过在统一潜在框架中结合多模态上下文理解与联合音视频生成,体现了这一转变。其统一架构引发一个根本问题:多模态对齐能否提升模型的世界推理能力?全模态输入又催生了哪些新的评估范式?为探究此问题,本研究引入一个围绕物理世界推理四个互补维度构建的综合评估框架。不同于现有视频生成与世界模型评估框架——它们往往受限于有限的输入模态以及提示与目标视频内容高度匹配的评估设置——我们的评估专为利用全模态模型的多模态输入能力而设计。我们构建了一系列多样化的新任务,要求模型整合跨模态的互补信息。具体考虑四种场景:包含多帧的隐式提示、音频-图像、前缀视频以及音视频输入。每种模态仅提供底层事件的部分证据,要求模型联合推理互补语义线索,以推断潜在事件状态与未来动态。在517个评估实例中,MiniMax-H3 整体成功率为41.97%。基于视频的决策推理成功率最高,达56.00%;而基于音频的消歧推理最弱,仅为27.40%。这些结果表明,有效整合多模态信息仍是充分利用多样输入模态优势的关键。项目地址:https://github.com/gulucaptain/MiniMax-H3-Reason。

查看arXiv页面 (https://arxiv.org/abs/2609.18323)查看PDF (https://arxiv.org/pdf/2609.18323)项目页面 (https://github.com/gulucaptain/MiniMax-H3-Reason)GitHub18 (https://github.com/gulucaptain/MiniMax-H3-Reason)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.18323)

在您的代理中获取本文:

hf papers read 2609\.18323

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.18323,即可从此页面链接。

引用本文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.18323,即可从此页面链接。

引用本文的Spaces0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.18323,即可从此页面链接。

包含本文的合集0

无合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。

MiniMaxAI/MiniMax-M3

Hugging Face Models Trending

MiniMax 发布 M3,一款原生多模态模型,拥有100万上下文和约4280亿参数,采用 MiniMax Sparse Attention (MSA) 实现高效长上下文处理,达到前沿级别的编码和智能体性能。

MiniMax M3(2分钟阅读)

TLDR AI

MiniMax 推出了 M3,这是首个结合编程、智能体与多模态能力的开源权重模型,通过稀疏注意力机制支持高达 100 万 token 的上下文。