3d-scene-understanding

标签

Cards List
#3d-scene-understanding

SmartMage:面向3D场景理解的动态模态编排

Hugging Face Daily Papers · 2026-08-05 缓存

SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。

0 人收藏 0 人点赞
#3d-scene-understanding

MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准

arXiv cs.AI · 2026-07-13 缓存

MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。

0 人收藏 0 人点赞
#3d-scene-understanding

CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖

Hugging Face Daily Papers · 2026-05-15 缓存

本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。

0 人收藏 0 人点赞
#3d-scene-understanding

HERMES++:迈向用于 3D 场景理解与生成的统一驾驶世界模型

Hugging Face Daily Papers · 2026-04-30 缓存

本文介绍了 HERMES++,这是一种统一的驾驶世界模型,它利用 BEV 表示、大语言模型(LLM)增强的查询以及联合几何优化,整合了 3D 场景理解和未来几何预测。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈