SmartMage:面向3D场景理解的动态模态编排
摘要
SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding
来源:https://huggingface.co/papers/2608.05137
摘要
理解3D场景是具身智能的基础,需要对来自多种模态的异构信息(包括视觉线索和几何线索)进行联合推理。然而,这些模态的相关性往往会因查询不同而变化。现有的多模态大语言模型(MLLMs)通常依赖固定的模态组合,忽视了与查询相关的模态需求。这种刚性设计可能会引入来自无关模态的语义噪声,同时未能充分利用信息量更大的模态,导致计算浪费和推理能力被稀释。为了解决这些挑战,本文提出了 SmartMage,一个统一的多模态大语言模型,能够动态编排异构模态,实现语义感知的3D场景理解。具体而言,SmartMage 包含:(1) 语义引导的模态自适应路由(SMART)模块,利用语义先验、文本-模态对齐和模态质量来选择任务相关的模态;(2) 模态感知门控专家(MAGE)模块,利用模态先验指导专家激活,促进多模态推理中的自适应专业化。实验上,SmartMage 在五个3D场景理解基准上取得了最先进的性能,并在纯RGB视频理解基准上获得了有竞争力的结果。在我们的诊断基准 ScanFacet 中,任务被划分为细粒度的语义类别,从而能够分析每种语义类型偏好的模态组合。观察到的模态-语义模式进一步证明了 SmartMage 的有效性。项目页面:https://yuecheong.github.io/SmartMage/。
在您的 agent 中获取此论文:
hf papers read 2608\.05137
没有最新 CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash
引用此论文的模型
0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.05137,即可从此页面链接到它。
引用此论文的数据集
0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.05137,即可从此页面链接到它。
引用此论文的 Space
0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.05137,即可从此页面链接到它。
包含此论文的收藏集
0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,即可从此页面链接到它。
相似文章
Mage (GitHub 仓库)
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
Mage(两分钟阅读)
微软推出Mage,一个紧凑型4B参数多模态模型系列,专为视觉理解与生成而设计,可在适中的硬件上轻松训练与部署,同时与更大的开源模型保持竞争力。
@HuggingModels:认识一下 Mage-VL,多模态 AI 的游戏规则改变者!它在一个模型中处理图像、文本甚至视频理解。……
Mage-VL 被介绍为一款多模态 AI 模型,它在一个模型中处理图像、文本和视频理解,从而支持更丰富的交互式应用。
MAGE:基于智能体多模态推理的类人宏布局
MAGE是一个多模态多智能体框架,通过结合结构化布局规划规则、视觉检查和迭代优化,改进了VLSI物理设计中的宏布局,在时序指标上优于商业布局工具和人类专家。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。