VLA 真的了解基础知识吗?视觉-语言-动作模型中常识与世界知识保留的衡量

Hugging Face Daily Papers 论文

摘要

本文提出 Act2Answer 协议,通过让智能体执行物理动作来回答问题,从而评估视觉-语言-动作模型中知识的保留情况。研究发现,VLA 模型保留了基础知识,但在更丰富的语义类别上存在差距,而 VQA 联合训练有助于改善。

具身视觉-语言-动作(VLA)模型通常通过对强大的预训练 VLM 在机器人数据上进行微调获得,但尚不清楚它们在适应后保留了多少常识和事实知识。在知识敏感任务上的失败具有歧义性,将知识缺失与低级控制的泛化能力差混为一谈。我们引入了 Act2Answer,这是一种轻量级协议,通过要求智能体通过动作来回答,将 VLM 知识基准适应于 VLA 评估。每个问题都变成一个简短的桌面场景,智能体执行单个物体放置动作以在候选答案中进行选择,从而得到基于动作的成功率,减少了控制混淆。我们策划了一套测试集,涵盖多种常识和世界知识类别,并引入了逐层意图探测,以定位 VLM 骨干网络和动作头中与答案相关的信息。在一项涉及 7 个 VLA 模型和 9 个 VLM 基线的大规模研究中,我们系统地跨类别对模型进行排名,发现 VLA 在简单概念上表现稳健,但在更丰富的语义类别上相对于其源 VLM 存在较大差距;VQA 联合训练与更好的知识保留相关;并且与答案相关的信号在 VLA 中间层达到峰值,但在高层减弱。Act2Answer 可在 https://tttonyalpha.github.io/act2answer/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/01 19:44

论文页面 - VLA真的知道基础吗?衡量视觉-语言-动作模型中的常识与世界知识保持能力

来源:https://huggingface.co/papers/2606.19297 发布时间:6月17日

·

由https://huggingface.co/tttonyalpha提交

Nikita (https://huggingface.co/tttonyalpha)于7月1日

作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

Act2Answer协议通过让智能体通过物理动作回答问题来评估具身视觉-语言-动作模型,揭示了不同语义类别下的知识保持与泛化模式。

具身视觉-语言-动作(VLA)模型通常通过将强大的预训练VLM(https://huggingface.co/papers?q=pretrained%20VLMs)在机器人数据集(https://huggingface.co/papers?q=robotics%20data)上进行微调获得,但目前尚不清楚它们在适应后保留了多少常识和事实知识。在知识敏感型任务(https://huggingface.co/papers?q=knowledge-sensitive%20tasks)上的失败具有模糊性,难以区分是知识缺失还是底层控制泛化能力不足。我们引入了Act2Answer,一种轻量级协议,通过要求智能体以动作方式回答,将VLM知识基准适配到VLA评估中。每个问题都变成一个简短的桌面场景,智能体通过执行一个物体放置动作来在候选答案之间做出选择,从而得到一个动作接地成功率(https://huggingface.co/papers?q=action-grounded%20success%20rate),减少了控制混杂因素。我们整理了一套涵盖多种常识和世界知识类别(https://huggingface.co/papers?q=world-knowledge%20categories)的测试环境,并引入了逐层意图探测(https://huggingface.co/papers?q=layerwise%20intent%20probing)来定位VLM主干网络和动作头中与答案相关的信息。在一项涵盖7个VLA模型和9个VLM基线的大规模研究中,我们系统地按类别对模型进行了排名,发现VLA在简单概念上表现稳健,但在较丰富的语义类别(https://huggingface.co/papers?q=semantic%20categories)上相较于其源VLM表现出更大差距,且VQA联合训练(https://huggingface.co/papers?q=VQA%20co-training)与更好的知识保持能力相关,而答案相关信号在VLA中间层达到峰值,但在上层衰减。Act2Answer可在 https://tttonyalpha.github.io/act2answer/ 获取。

查看arXiv页面 (https://arxiv.org/abs/2606.19297)查看PDF (https://arxiv.org/pdf/2606.19297)项目页面 (https://tttonyalpha.github.io/act2answer/)GitHub2 (https://github.com/CognitiveAISystems/Act2Answer)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19297)

在你的智能体中获取这篇论文:

hf papers read 2606.19297

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.19297以将其链接至此页面。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.19297以将其链接至此页面。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2606.19297以将其链接至此页面。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中以将其链接至此页面。

相似文章

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。