RoboSemanticBench:诊断VLA模型动作预测中的语义基础
摘要
RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。
查看缓存全文
缓存时间: 2026/06/02 03:23
论文页面 - RoboSemanticBench:诊断VLA模型动作预测中的语义基础
来源:https://huggingface.co/papers/2606.02277 发布于6月1日
·
由https://huggingface.co/VLyb提交
yubin (https://huggingface.co/VLyb)于6月2日
作者:
,
,
,
,
,
,
,
,
,
,
摘要
RoboSemanticBench 识别了视觉-语言-动作模型中语义理解与动作预测之间的脱节问题——机器人能够抓取物体,却无法选择语义正确的目标。
视觉-语言-动作(VLA)模型基于这样一个前提:预训练语言或视觉-语言骨干网络的语义理解应能指导机器人动作预测。然而,机器人微调被优化为对任务特定动作分布的模仿学习,而许多评估可以通过视觉或指令-动作捷径来解决。我们引入了 RoboSemanticBench(RSB),这是一个用于诊断动作预测中语义基础的具身基准:评估微调后的 VLA 模型能否利用复杂的指令语义来选择和操作正确的物理目标。在每轮测试中,机器人会收到一道数学或常识类的选择题,观察候选答案模块,并需要抓取对应正确答案的模块。RSB 涵盖了受控算术、小学数学理解、以及常识或事实理解,包含四选一和十选一两种难度。在代表性的 VLA 模型上,我们发现许多策略学会了抓取候选模块,但在控制抓取成功率后,选择语义正确模块的比率接近随机甚至低于随机,揭示了骨干网络层面的语义能力与动作预测之间持续存在的差距。
查看 arXiv 页面 (https://arxiv.org/abs/2606.02277)查看 PDF (https://arxiv.org/pdf/2606.02277)GitHub1 (https://github.com/ZGC-EmbodyAI/RoboSemanticBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.02277)
在您的代理中获取此论文:
hf papers read 2606\.02277
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.02277,以便在此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.02277,以便在此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.02277,以便在此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,以便在此页面链接。
相似文章
SurgVLA-Bench:面向腹腔镜手术机器人视觉-语言-动作模型评估的基准
SurgVLA-Bench是首个用于评估腹腔镜手术机器人视觉-语言-动作模型的综合基准,利用SurRoL仿真平台评估动作准确性和语义一致性。
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
@svlevine:要想让机器人做好一件事,你需要知道如何与它对话。如果你不会,你可以学习,通过Semanti…
本文介绍了语义动作强化学习(Semantic Action RL),它通过对视觉-语言-动作(VLA)提示进行强化学习,使机器人能够在现实世界中快速学习新任务。
LabVLA:在科学实验室中落地视觉-语言-动作模型
LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。
Flat-Pack Bench:通过家具组装评估大型视觉-语言模型的时空理解能力
介绍了Flat-Pack Bench,一个通过家具组装任务评估大型视觉-语言模型细粒度时空推理能力的基准测试。实验表明,当前的LVLMs在跟踪和空间交互方面存在困难。