空间中的自我:无人机具身智能中自我意识与空间认知的基准测试
摘要
本文介绍了SIS-Bench,一个用于通过多模态大语言模型评估无人机具身智能中自我意识与空间认知的基准,并探索了运动感知表示以提升性能。
查看缓存全文
缓存时间: 2026/07/16 17:44
论文页面 - 自我在空间之中:无人机具身智能中自我意识与空间认知的基准测试
来源:https://huggingface.co/papers/2607.12477
摘要
自主无人机系统日益依赖多模态大语言模型(MLLMs)在复杂的现实环境中运行。这类具身场景不仅需要理解周围空间,还必须维持对智能体自身的一致表征。然而,现有的无人机导向方法与基准大多仍以环境为中心,主要聚焦于空间理解任务,而智能体的自我意识仍旧是隐含的。为填补这一空白,我们提出了SIS-Bench,一个在统一“自我在空间之中”框架下评估无人机场景中具身空间智能的基准。SIS-Bench沿两个互补维度——空间与自我,以及感知、记忆与推理三个层级组织评估。它包含4,856个问答对,覆盖13个任务,这些任务来自1,646个真实无人机视频,经过任务条件化的构建流程与专家验证。大量评估表明,当前MLLMs在建模动态与智能体中心过程方面存在根本性局限。特别地,我们观察到空间认知与自我意识之间存在明显的不平衡,以及认知层级间的渐进性能退化。受这些发现启发,我们进一步探索了一种通过光流与视觉特征融合来纳入自我相关动态的运动感知表征。实验结果表明,对智能体运动进行建模能够一致地提升感知与记忆性能,不仅在空间认知方面,也在自我意识方面,并且能泛化到下游无人机决策任务。我们的结果突显了自我意识对于推进具身空间智能的重要性,并为运动感知的“自我在空间之中”建模提供了新的基准与实证证据。
查看 arXiv 页面 (https://arxiv.org/abs/2607.12477)查看 PDF (https://arxiv.org/pdf/2607.12477)项目页面 (https://choucisan.github.io/publications/self-in-space)GitHub (https://github.com/IntelliSensing/Self-in-Space)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12477)
在你的智能体(agent)中获取此论文:
hf papers read 2607.12477
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 (1)
choucsan/SIS-Motion 更新于1天前 • 88 • 2 (https://huggingface.co/choucsan/SIS-Motion)
引用本论文的数据集 (3)
choucsan/SIS-Bench 查看器 • 更新于约10小时前 • 4.86k • 591 • 2 (https://huggingface.co/datasets/choucsan/SIS-Bench)
choucsan/OpenUAV-QA 预览 • 更新于1天前 • 372 • 2 (https://huggingface.co/datasets/choucsan/OpenUAV-QA)
choucsan/SIS-Motion-54K 查看器 • 更新于1天前 • 54.3k • 167 • 4 (https://huggingface.co/datasets/choucsan/SIS-Motion-54K)
引用本论文的 Spaces (0)
没有 Space 链接此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2607.12477 以将其链接到此页面。
包含本论文的收藏 (1)
相似文章
ESI-Bench:迈向闭环感知-行动的具身空间智能
介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
UESF-Bench:面向统一具身搜索与跟随的基准测试与探测
本文介绍了UESF-Bench,一个面向统一具身人类搜索与跟随的大规模基准,并提出了SeekFollow-VLA,一个视觉-语言-动作框架,该框架处理语义引导的探索以及搜索与跟随之间的可靠行为切换。