Odyseus - 空间视觉语言模型:将2D推理映射至3D输出(开源仓库)

Reddit r/ArtificialInteligence 工具

摘要

Odyseus 是一款开源的空间 VLM 工具,结合 Qwen 与 Depth Anything,将 2D 视觉推理转化为可用于机器人和物理 AI 应用的 3D 坐标。

我一直主张,面向机器人的物理 AI 需要可操作的输出(如 3D 坐标),而不是要点列表或华丽的段落。因此,我决定通过将视觉语言模型(VLM)与单目深度估计相结合进行实验,本质上是将 2D 推理映射到 3D 空间。我将其命名为 Odyseus - 空间 VLM。 技术栈: - VLM: Qwen 3.6 - 深度估计: Depth Anything 3 - Metric Large 效果相当不错,于是决定分享出来,查看仓库:[https://github.com/MercuriusTech/Odyseus-Spatial-VLM](https://github.com/MercuriusTech/Odyseus-Spatial-VLM)
查看原文

相似文章

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。

SpatialCLI:先使用空间工具推理,再脱离工具

Hugging Face Daily Papers

SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。