标签
GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。
小米开源了Xiaomi-Robotics-1,这是一个在超过10万小时的UMI数据上预训练,并在1万小时以上的跨具身数据上后训练的具身AI基础模型。此次发布包含完整的真实机器人后训练与部署流程,旨在挑战Figure AI和Tesla的专有机器人模型。
UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。
介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。
Google 发布了 Gemini Robotics 2.0,这是一组用于机器人的 AI 子模型,可提升灵巧性、实时视频理解和机器人协作能力,其中具身推理模型已向开发者公开。
Gemini Robotics ER 2 基于 Gemini 3.5 Flash 构建,现已发布,具备最先进的具身推理、亚秒级机器人流式传输和多机器人协同调度支持,并在 Boston Dynamics Spot 上进行了演示。
Google DeepMind 发布 Gemini Robotics ER 2,这是一个具身推理模型,使机器人能够理解视频、编排任务并与多机器人协作,现通过 Gemini API 公开提供。
介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。
清华大学推出WRISTPP腕带传感器,可实时重建精确的手部姿态和接触压力,性能优于头戴式摄像头,减少手臂疲劳,应用于具身AI和机器人遥操作。
本文介绍HumanCLAW评估框架,该框架将动作决策与底层执行解耦,用以评估视觉-语言模型能否通过物理身体行动。在41个场景的1218个试验片段中测试了九种最先进的VLM,最佳模型成功率仅为16.8%,表明当前VLM缺乏具身自我意识。
MEMENTO引入了一种记忆引导的模因框架,用于进化机器人控制程序(代码即策略),在长时域具身任务中优于现有方法如Eureka和REvolve,并展示了从仿真到真实的迁移。
MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。
MIT 已将教科书《计算机视觉基础》免费在线提供。该书涵盖从图像形成到视觉语言模型的广泛主题,面向机器人、具身AI、自动驾驶和视觉AI领域的学生和实践者。
在世界人工智能大会上展示的人形机器人仍面临重大技术瓶颈和成本上升问题,尽管资本和参与公司增多,但尚未成熟到可大规模商业部署。
RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。
OpenBMB发布了MiniCPM-RobotTrack,这是一个基于MiniCPM4-0.5B构建的紧凑型视觉-语言-动作模型,用于自然语言条件的目标跟踪,在unitree Go2上实现5+ FPS,并采用质量驱动的自进化数据和高效的板载推理。
提出了HRO,一种由大型语言模型驱动的层次化框架,用于零样本物体目标导航,模拟人类从粗到细的空间推理,在Gibson和HM3D数据集上实现了卓越的成功率和泛化能力。
本文介绍了UESF-Bench,一个面向统一具身人类搜索与跟随的大规模基准,并提出了SeekFollow-VLA,一个视觉-语言-动作框架,该框架处理语义引导的探索以及搜索与跟随之间的可靠行为切换。
SPINE是一个智能体框架,能够系统化地调试和部署双臂机器人,减少对专家标定的依赖,并提升跨平台的操作化成功率。
BadWAM 引入了一个针对 World-Action Models (WAMs) 的对抗攻击框架,通过微小的视觉扰动打破想象与行动之间的对齐。这些攻击显著降低了任务成功率,暴露了这类模型中的一个漏洞。