SceneActBench: 智能体能否在其看到的3D场景中执行操作?

Hugging Face Daily Papers 论文

摘要

SceneActBench是一个基准测试,用于评估VLM智能体在完整的多对象3D场景中执行操作的能力,通过五个任务中的任务特定几何指标进行评估。

视觉语言模型(VLM)智能体越来越多地使用工具在3D场景中执行操作,而不仅仅是描述它们。现有的3D基准测试对文本响应或单对象操作进行评分,使得对完整的多对象3D场景中的智能体操作评估不足。我们提出了SceneActBench,这是一个在统一的智能体-环境循环下对五个3D任务进行视觉条件操作的基准测试。给定PNG图像或采样视频帧以及(如果适用)提供的3D资源,智能体在3D环境中执行操作。我们使用任务特定的几何指标评估每个最终输出与隐藏真实值的对比。SceneActBench包含从210个源实例构建的五个任务,产生了包括配对输入条件在内的520个任务案例。每个任务通过一个固定的智能体循环运行,以保持比较公平。在十一个专有VLM配置中,总体得分范围为38.6-50.2,没有一个配置在所有任务中表现一致良好。我们进一步分析了故障出现的位置和方式。
查看原文
查看缓存全文

缓存时间: 2026/07/27 05:40

论文页面 - SceneActBench:智能体能否基于所见3D场景采取行动?

来源:https://huggingface.co/papers/2607.22393 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

视觉语言模型(VLM)智能体越来越多地使用工具在3D场景中采取行动,而不仅仅是描述它们。现有的3D基准测试仅对文本回复或单物体操作进行评分,导致智能体在完整的多物体3D场景中的行动能力未被充分评估。我们提出SceneActBench,这是一个在统一智能体-环境循环下,针对五项3D任务进行视觉条件化行动的基准测试。给定PNG图像或采样视频帧,并在适用时提供3D资产,智能体在3D环境中采取行动。我们使用特定于任务的几何指标,将每个最终输出与隐藏的真实值进行比较。SceneActBench由210个源实例构建的五项任务组成,产生520个任务案例,包括成对的输入条件。每个任务通过一个固定的智能体循环运行,以确保比较公平。在十一种专有VLM配置中,总体得分范围为38.6-50.2,没有一种配置在所有任务中表现一致。我们进一步分析了失败发生的位置和方式。

查看arXiv页面 (https://arxiv.org/abs/2607.22393) 查看PDF (https://arxiv.org/pdf/2607.22393) 项目页面 (https://feinaldo2.github.io/sceneactbench-project-page/) GitHub2 (https://github.com/Feinaldo2/SceneActBench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22393)

在你的智能体中获取此论文:

hf papers read 2607.22393

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用 arxiv.org/abs/2607.22393 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2607.22393 以从此页面链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用 arxiv.org/abs/2607.22393 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。

PlanBench-V: 面向视觉语言模型的空间规划地图基准

arXiv cs.CL

本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。

AgentViSS:多模态仿真中的视觉社交智能基准测试

arXiv cs.CL

本文介绍了AgentViSS基准,用于评估多模态社交模拟中的视觉社交智能,包含240个场景及对齐的视觉文本证据。评估七个近期MLLM发现局部角色扮演与基于视觉的交互管理之间存在差距。