Tag
SmartMage is a unified multimodal LLM that dynamically orchestrates visual and geometric modalities for query-dependent 3D scene understanding, achieving state-of-the-art results across five benchmarks.
MultiView-Bench is a diagnostic benchmark for evaluating vision-language models on their ability to integrate multiple viewpoints into a coherent 3D mental model, revealing systematic failures in 3D spatial reasoning, and introducing ViewNavigator to mitigate these issues.
This paper proposes COVER, a training-free method for converting 3D assets into sparse panoramic RGB-D-pose data with complete scene coverage and low redundancy, and introduces the CM-EVS dataset containing 36,373 curated frames from indoor and outdoor scenes.
This paper introduces HERMES++, a unified driving world model that integrates 3D scene understanding and future geometry prediction using BEV representation, LLM-enhanced queries, and joint geometric optimization.