VLA 真的了解基础知识吗?视觉-语言-动作模型中常识与世界知识保留的衡量
摘要
本文提出 Act2Answer 协议,通过让智能体执行物理动作来回答问题,从而评估视觉-语言-动作模型中知识的保留情况。研究发现,VLA 模型保留了基础知识,但在更丰富的语义类别上存在差距,而 VQA 联合训练有助于改善。
查看缓存全文
缓存时间: 2026/07/01 19:44
论文页面 - VLA真的知道基础吗?衡量视觉-语言-动作模型中的常识与世界知识保持能力
来源:https://huggingface.co/papers/2606.19297 发布时间:6月17日
·
由https://huggingface.co/tttonyalpha提交
Nikita (https://huggingface.co/tttonyalpha)于7月1日
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
Act2Answer协议通过让智能体通过物理动作回答问题来评估具身视觉-语言-动作模型,揭示了不同语义类别下的知识保持与泛化模式。
具身视觉-语言-动作(VLA)模型通常通过将强大的预训练VLM(https://huggingface.co/papers?q=pretrained%20VLMs)在机器人数据集(https://huggingface.co/papers?q=robotics%20data)上进行微调获得,但目前尚不清楚它们在适应后保留了多少常识和事实知识。在知识敏感型任务(https://huggingface.co/papers?q=knowledge-sensitive%20tasks)上的失败具有模糊性,难以区分是知识缺失还是底层控制泛化能力不足。我们引入了Act2Answer,一种轻量级协议,通过要求智能体以动作方式回答,将VLM知识基准适配到VLA评估中。每个问题都变成一个简短的桌面场景,智能体通过执行一个物体放置动作来在候选答案之间做出选择,从而得到一个动作接地成功率(https://huggingface.co/papers?q=action-grounded%20success%20rate),减少了控制混杂因素。我们整理了一套涵盖多种常识和世界知识类别(https://huggingface.co/papers?q=world-knowledge%20categories)的测试环境,并引入了逐层意图探测(https://huggingface.co/papers?q=layerwise%20intent%20probing)来定位VLM主干网络和动作头中与答案相关的信息。在一项涵盖7个VLA模型和9个VLM基线的大规模研究中,我们系统地按类别对模型进行了排名,发现VLA在简单概念上表现稳健,但在较丰富的语义类别(https://huggingface.co/papers?q=semantic%20categories)上相较于其源VLM表现出更大差距,且VQA联合训练(https://huggingface.co/papers?q=VQA%20co-training)与更好的知识保持能力相关,而答案相关信号在VLA中间层达到峰值,但在上层衰减。Act2Answer可在 https://tttonyalpha.github.io/act2answer/ 获取。
查看arXiv页面 (https://arxiv.org/abs/2606.19297)查看PDF (https://arxiv.org/pdf/2606.19297)项目页面 (https://tttonyalpha.github.io/act2answer/)GitHub2 (https://github.com/CognitiveAISystems/Act2Answer)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19297)
在你的智能体中获取这篇论文:
hf papers read 2606.19297
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.19297以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.19297以将其链接至此页面。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.19297以将其链接至此页面。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection)中以将其链接至此页面。
相似文章
LabVLA:在科学实验室中落地视觉-语言-动作模型
LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
看见不等于知道:VLMs 知道何时不应回答空间问题吗(以及原因)?
本文介绍了 SpatialUncertain,这是一个用于评估视觉语言模型能否识别因遮挡或视角模糊而无法回答空间问题的基准,揭示了模型过度自信和回避行为不佳的问题。