@contractedai: 具身推理模型能做刹车维修吗?我们让9个VLM参加了专家机械师基于其自身维修工作的考试,与…

X AI KOLs Following 论文

摘要

一项针对9个视觉语言模型的专家机械师刹车维修考试评估显示,它们懂得理论,但在实际部署中自主发现问题和适应调整方面表现不佳。

具身推理模型能做刹车维修吗? 我们与@physicreality一起,让9个VLM参加了专家机械师基于其自身维修工作的考试。理论上它们知道该怎么做。但在自主发现问题和适应调整方面正是它们的短板。 这就是部署会失败的地方。 https://t.co/exvDR5XmOV
查看原文
查看缓存全文

缓存时间: 2026/08/13 23:31

具身推理模型能做刹车维修吗?

我们用@physicreality让9个VLM参加了专家技师针对他自己维修项目设计的考试。理论上它们知道该怎么做。但在自主发现问题并随机应变方面,它们就力不从心了。

这就是部署会失败的地方。https://t.co/exvDR5XmOV

相似文章

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。

HumanCLAW:视觉-语言模型能否通过身体行动?

Hugging Face Daily Papers

本文介绍HumanCLAW评估框架,该框架将动作决策与底层执行解耦,用以评估视觉-语言模型能否通过物理身体行动。在41个场景的1218个试验片段中测试了九种最先进的VLM,最佳模型成功率仅为16.8%,表明当前VLM缺乏具身自我意识。