Odyseus - 空间视觉语言模型:将2D推理映射至3D输出(开源仓库)
摘要
Odyseus 是一款开源的空间 VLM 工具,结合 Qwen 与 Depth Anything,将 2D 视觉推理转化为可用于机器人和物理 AI 应用的 3D 坐标。
我一直主张,面向机器人的物理 AI 需要可操作的输出(如 3D 坐标),而不是要点列表或华丽的段落。因此,我决定通过将视觉语言模型(VLM)与单目深度估计相结合进行实验,本质上是将 2D 推理映射到 3D 空间。我将其命名为 Odyseus - 空间 VLM。
技术栈:
- VLM: Qwen 3.6
- 深度估计: Depth Anything 3 - Metric Large
效果相当不错,于是决定分享出来,查看仓库:[https://github.com/MercuriusTech/Odyseus-Spatial-VLM](https://github.com/MercuriusTech/Odyseus-Spatial-VLM)
相似文章
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
MetaSpatial:强化VLMs在元宇宙中的3D空间推理
MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。
SpatialCLI:先使用空间工具推理,再脱离工具
SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。
SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型
介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。
Qwen-VLA:统一跨任务、环境与机器人具身形态的视觉-语言-动作建模
Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。