MiniMax-H3 能否推理物理世界?全模态生成模型评估
摘要
本文通过引入一个综合框架来评估 MiniMax-H3——一种全模态生成模型——在通过多模态输入推理物理世界方面的能力。评估显示,基于视频的决策推理表现最佳,而基于音频的歧义推理则最弱。
查看缓存全文
缓存时间: 2026/09/18 11:00
论文页面 - MiniMax-H3 能否推理物理世界?全模态生成模型评估
来源:https://huggingface.co/papers/2609.18323 作者:
,
,
,
,
,
,
,
,
,
,
摘要
近期全模态生成模型已推动内容生成迈向文本、图像、视频与音频的统一建模。MiniMax-H3 通过在统一潜在框架中结合多模态上下文理解与联合音视频生成,体现了这一转变。其统一架构引发一个根本问题:多模态对齐能否提升模型的世界推理能力?全模态输入又催生了哪些新的评估范式?为探究此问题,本研究引入一个围绕物理世界推理四个互补维度构建的综合评估框架。不同于现有视频生成与世界模型评估框架——它们往往受限于有限的输入模态以及提示与目标视频内容高度匹配的评估设置——我们的评估专为利用全模态模型的多模态输入能力而设计。我们构建了一系列多样化的新任务,要求模型整合跨模态的互补信息。具体考虑四种场景:包含多帧的隐式提示、音频-图像、前缀视频以及音视频输入。每种模态仅提供底层事件的部分证据,要求模型联合推理互补语义线索,以推断潜在事件状态与未来动态。在517个评估实例中,MiniMax-H3 整体成功率为41.97%。基于视频的决策推理成功率最高,达56.00%;而基于音频的消歧推理最弱,仅为27.40%。这些结果表明,有效整合多模态信息仍是充分利用多样输入模态优势的关键。项目地址:https://github.com/gulucaptain/MiniMax-H3-Reason。
查看arXiv页面 (https://arxiv.org/abs/2609.18323)查看PDF (https://arxiv.org/pdf/2609.18323)项目页面 (https://github.com/gulucaptain/MiniMax-H3-Reason)GitHub18 (https://github.com/gulucaptain/MiniMax-H3-Reason)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.18323)
在您的代理中获取本文:
hf papers read 2609\.18323
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.18323,即可从此页面链接。
引用本文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.18323,即可从此页面链接。
引用本文的Spaces0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.18323,即可从此页面链接。
包含本文的合集0
无合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
MiniMaxAI/MiniMax-M3
MiniMax 发布 M3,一款原生多模态模型,拥有100万上下文和约4280亿参数,采用 MiniMax Sparse Attention (MSA) 实现高效长上下文处理,达到前沿级别的编码和智能体性能。
MiniMax M3(2分钟阅读)
MiniMax 推出了 M3,这是首个结合编程、智能体与多模态能力的开源权重模型,通过稀疏注意力机制支持高达 100 万 token 的上下文。