空间中的自我:无人机具身智能中自我意识与空间认知的基准测试

Hugging Face Daily Papers 论文

摘要

本文介绍了SIS-Bench,一个用于通过多模态大语言模型评估无人机具身智能中自我意识与空间认知的基准,并探索了运动感知表示以提升性能。

自主无人机系统越来越依赖多模态大语言模型(MLLMs)在复杂真实环境中运行。这种具身场景不仅需要理解周围空间,还需要保持对智能体自身的一致表示。然而,现有的无人机导向方法和基准大多以环境为中心,主要关注空间理解任务,而智能体的自我意识仍然是隐式的。为填补这一空白,我们引入了SIS-Bench,这是一个在统一的自在空间框架下评估无人机场景中具身空间智能的基准。SIS-Bench沿着两个互补维度——空间和自我,以及感知、记忆和推理三个层级组织评估。它包含4,856个问答对,覆盖13个任务,这些任务来源于1,646个真实世界无人机视频,通过任务条件化构建管道和专家验证得到。广泛评估显示,当前MLLMs在建模动态和以智能体为中心的过程中存在根本性局限。特别是,我们观察到空间认知与自我意识之间存在明显的不平衡,以及认知层级上的渐进性能下降。受这些发现启发,我们进一步探索了一种运动感知表示,通过光流和视觉特征融合融入与自我相关的动态。实验结果表明,对智能体运动进行建模能持续提升感知和记忆性能,不仅在空间认知方面,也在自我意识方面,并且能泛化到下游无人机决策任务。我们的结果强调了自我意识对推进具身空间智能的重要性,并为运动感知的自在空间建模提供了新的基准和实证证据。
查看原文
查看缓存全文

缓存时间: 2026/07/16 17:44

论文页面 - 自我在空间之中:无人机具身智能中自我意识与空间认知的基准测试

来源:https://huggingface.co/papers/2607.12477

摘要

自主无人机系统日益依赖多模态大语言模型(MLLMs)在复杂的现实环境中运行。这类具身场景不仅需要理解周围空间,还必须维持对智能体自身的一致表征。然而,现有的无人机导向方法与基准大多仍以环境为中心,主要聚焦于空间理解任务,而智能体的自我意识仍旧是隐含的。为填补这一空白,我们提出了SIS-Bench,一个在统一“自我在空间之中”框架下评估无人机场景中具身空间智能的基准。SIS-Bench沿两个互补维度——空间与自我,以及感知、记忆与推理三个层级组织评估。它包含4,856个问答对,覆盖13个任务,这些任务来自1,646个真实无人机视频,经过任务条件化的构建流程与专家验证。大量评估表明,当前MLLMs在建模动态与智能体中心过程方面存在根本性局限。特别地,我们观察到空间认知与自我意识之间存在明显的不平衡,以及认知层级间的渐进性能退化。受这些发现启发,我们进一步探索了一种通过光流与视觉特征融合来纳入自我相关动态的运动感知表征。实验结果表明,对智能体运动进行建模能够一致地提升感知与记忆性能,不仅在空间认知方面,也在自我意识方面,并且能泛化到下游无人机决策任务。我们的结果突显了自我意识对于推进具身空间智能的重要性,并为运动感知的“自我在空间之中”建模提供了新的基准与实证证据。

查看 arXiv 页面 (https://arxiv.org/abs/2607.12477)查看 PDF (https://arxiv.org/pdf/2607.12477)项目页面 (https://choucisan.github.io/publications/self-in-space)GitHub (https://github.com/IntelliSensing/Self-in-Space)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12477)

在你的智能体(agent)中获取此论文:

hf papers read 2607.12477

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 (1)

choucsan/SIS-Motion 更新于1天前 • 88 • 2 (https://huggingface.co/choucsan/SIS-Motion)

引用本论文的数据集 (3)

choucsan/SIS-Bench 查看器 • 更新于约10小时前 • 4.86k • 591 • 2 (https://huggingface.co/datasets/choucsan/SIS-Bench)

choucsan/OpenUAV-QA 预览 • 更新于1天前 • 372 • 2 (https://huggingface.co/datasets/choucsan/OpenUAV-QA)

choucsan/SIS-Motion-54K 查看器 • 更新于1天前 • 54.3k • 167 • 4 (https://huggingface.co/datasets/choucsan/SIS-Motion-54K)

引用本论文的 Spaces (0)

没有 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2607.12477 以将其链接到此页面。

包含本论文的收藏 (1)

相似文章

ESI-Bench:迈向闭环感知-行动的具身空间智能

Hugging Face Daily Papers

介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。