SceneActBench: 智能体能否在其看到的3D场景中执行操作?
摘要
SceneActBench是一个基准测试,用于评估VLM智能体在完整的多对象3D场景中执行操作的能力,通过五个任务中的任务特定几何指标进行评估。
查看缓存全文
缓存时间: 2026/07/27 05:40
论文页面 - SceneActBench:智能体能否基于所见3D场景采取行动?
来源:https://huggingface.co/papers/2607.22393 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
视觉语言模型(VLM)智能体越来越多地使用工具在3D场景中采取行动,而不仅仅是描述它们。现有的3D基准测试仅对文本回复或单物体操作进行评分,导致智能体在完整的多物体3D场景中的行动能力未被充分评估。我们提出SceneActBench,这是一个在统一智能体-环境循环下,针对五项3D任务进行视觉条件化行动的基准测试。给定PNG图像或采样视频帧,并在适用时提供3D资产,智能体在3D环境中采取行动。我们使用特定于任务的几何指标,将每个最终输出与隐藏的真实值进行比较。SceneActBench由210个源实例构建的五项任务组成,产生520个任务案例,包括成对的输入条件。每个任务通过一个固定的智能体循环运行,以确保比较公平。在十一种专有VLM配置中,总体得分范围为38.6-50.2,没有一种配置在所有任务中表现一致。我们进一步分析了失败发生的位置和方式。
查看arXiv页面 (https://arxiv.org/abs/2607.22393) 查看PDF (https://arxiv.org/pdf/2607.22393) 项目页面 (https://feinaldo2.github.io/sceneactbench-project-page/) GitHub2 (https://github.com/Feinaldo2/SceneActBench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22393)
在你的智能体中获取此论文:
hf papers read 2607.22393
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用 arxiv.org/abs/2607.22393 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2607.22393 以从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用 arxiv.org/abs/2607.22393 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
3DCodeBench:通过代码对智能体过程化3D建模进行基准测试
本文介绍了3DCodeBench——一个用于评估视觉语言模型通过代码进行过程化3D建模的基准测试,以及3DCodeArena——一个基于成对人类偏好的排名平台。
RoboStressBench:具身场景中VLM对物理视觉压力鲁棒性的基准测试
RoboStressBench提出了一个基准,用于评估视觉语言模型在具身场景中对物理视觉压力(材质、视点、光照、几何)的鲁棒性,并识别特定于压力的失效模式。
PlanBench-V: 面向视觉语言模型的空间规划地图基准
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
AgentViSS:多模态仿真中的视觉社交智能基准测试
本文介绍了AgentViSS基准,用于评估多模态社交模拟中的视觉社交智能,包含240个场景及对齐的视觉文本证据。评估七个近期MLLM发现局部角色扮演与基于视觉的交互管理之间存在差距。