@contractedai: 具身推理模型能做刹车维修吗?我们让9个VLM参加了专家机械师基于其自身维修工作的考试,与…
摘要
一项针对9个视觉语言模型的专家机械师刹车维修考试评估显示,它们懂得理论,但在实际部署中自主发现问题和适应调整方面表现不佳。
查看缓存全文
缓存时间: 2026/08/13 23:31
具身推理模型能做刹车维修吗?
我们用@physicreality让9个VLM参加了专家技师针对他自己维修项目设计的考试。理论上它们知道该怎么做。但在自主发现问题并随机应变方面,它们就力不从心了。
这就是部署会失败的地方。https://t.co/exvDR5XmOV
相似文章
VLMs 是否像工程师一样推理?一个基准与分阶段评估
本文介绍了 EngVQA,一个用于评估视觉语言模型工程推理能力的多模态基准,以及一个 8 阶段自动评估框架,能够对推理失败进行细粒度分析。它揭示了当前 VLMs 在工程推理能力上的重大局限性。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。
指令层级失效之处:诊断与修复推理语言模型中的故障
本文引入了一个白盒诊断框架,将推理语言模型中的指令层级故障定位为识别、冲突解决和响应实现三个阶段。该框架评估了多个模型,并提出了两种无需训练的自我监控机制,可将违规率降低81%–99%。
HumanCLAW:视觉-语言模型能否通过身体行动?
本文介绍HumanCLAW评估框架,该框架将动作决策与底层执行解耦,用以评估视觉-语言模型能否通过物理身体行动。在41个场景的1218个试验片段中测试了九种最先进的VLM,最佳模型成功率仅为16.8%,表明当前VLM缺乏具身自我意识。
@dair_ai: 一个LLM代理真的能构建它无法看到的环境模型吗?这项工作使这个问题可评分。一个代理…
一篇研究论文提出了‘智能体自动机学习’来评估LLM代理是否能通过交互推断隐藏的世界模型,发现性能随着任务复杂度的增加而急剧下降,并且推理模型优于非推理模型,但仍然存在困难。