aerial-robotics

标签

Cards List
#aerial-robotics

空中MLLM智能体的零样本任务级评估

arXiv cs.CL · 2026-07-27 缓存

MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈