SmartMage:面向3D场景理解的动态模态编排

Hugging Face Daily Papers 论文

摘要

SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。

理解3D场景是具身智能的基础,需要对来自多种模态(包括视觉和几何线索)的异构信息进行联合推理。然而,这些模态的相关性往往因查询而异。现有的多模态大语言模型(MLLMs)通常依赖固定的模态组合,忽略了查询相关的模态需求。这种刚性设计可能引入来自无关模态的语义噪声,同时未能充分利用信息量更大的模态,导致计算浪费和推理稀释。为了解决这些挑战,本文提出了SmartMage,一种统一的多模态大语言模型(MLLM),可动态编排异构模态,实现语义感知的3D场景理解。具体而言,SmartMage包含:(1)语义引导的模态自适应路由(SMART)模块,利用语义先验、文本-模态对齐和模态质量来选择任务相关模态;(2)模态感知门控专家(MAGE)模块,利用模态先验指导专家激活,促进多模态推理中的自适应特化。实验上,SmartMage在五个3D场景理解基准上取得了最先进的性能,并在仅RGB视频理解基准上获得了有竞争力的结果。在我们的诊断基准ScanFacet中,任务被划分为细粒度的语义类别,从而能够分析每种语义类型偏好的模态组合。观察到的模态-语义模式进一步证明了SmartMage的有效性。项目主页:https://yuecheong.github.io/SmartMage/。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:55

论文页面 - SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

来源:https://huggingface.co/papers/2608.05137

摘要

理解3D场景是具身智能的基础,需要对来自多种模态的异构信息(包括视觉线索和几何线索)进行联合推理。然而,这些模态的相关性往往会因查询不同而变化。现有的多模态大语言模型(MLLMs)通常依赖固定的模态组合,忽视了与查询相关的模态需求。这种刚性设计可能会引入来自无关模态的语义噪声,同时未能充分利用信息量更大的模态,导致计算浪费和推理能力被稀释。为了解决这些挑战,本文提出了 SmartMage,一个统一的多模态大语言模型,能够动态编排异构模态,实现语义感知的3D场景理解。具体而言,SmartMage 包含:(1) 语义引导的模态自适应路由(SMART)模块,利用语义先验、文本-模态对齐和模态质量来选择任务相关的模态;(2) 模态感知门控专家(MAGE)模块,利用模态先验指导专家激活,促进多模态推理中的自适应专业化。实验上,SmartMage 在五个3D场景理解基准上取得了最先进的性能,并在纯RGB视频理解基准上获得了有竞争力的结果。在我们的诊断基准 ScanFacet 中,任务被划分为细粒度的语义类别,从而能够分析每种语义类型偏好的模态组合。观察到的模态-语义模式进一步证明了 SmartMage 的有效性。项目页面:https://yuecheong.github.io/SmartMage/。

查看 arXiv 页面 查看 PDF 项目页面 添加到收藏

在您的 agent 中获取此论文:

hf papers read 2608\.05137

没有最新 CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash

引用此论文的模型

0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.05137,即可从此页面链接到它。

引用此论文的数据集

0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.05137,即可从此页面链接到它。

引用此论文的 Space

0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.05137,即可从此页面链接到它。

包含此论文的收藏集

0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,即可从此页面链接到它。

相似文章

Mage (GitHub 仓库)

TLDR AI

微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。

Mage(两分钟阅读)

TLDR AI

微软推出Mage,一个紧凑型4B参数多模态模型系列,专为视觉理解与生成而设计,可在适中的硬件上轻松训练与部署,同时与更大的开源模型保持竞争力。

MAGE:基于智能体多模态推理的类人宏布局

arXiv cs.AI

MAGE是一个多模态多智能体框架,通过结合结构化布局规划规则、视觉检查和迭代优化,改进了VLSI物理设计中的宏布局,在时序指标上优于商业布局工具和人类专家。

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。