标签
介绍了 SimLife,一个可扩展的平台,用于模拟长期家庭生活,以及 SimLife-BP,一个评估 AI 智能体从扩展观察中推断行为模式能力的基准,发现当前模型通常缺乏基于规则的深入理解。
DeliveryGym是一个用于自适应课程的长期具身智能体规划的3D强化学习环境,通过强化学习展示了性能提升。
VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。
本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。
PhysBrain 1.5 是一个用于具身AI的开源8B参数模型,通过理解场景、生成机器人动作和预测未来帧,实现了最先进的性能,在28个基准测试中得分72.5。
PhysBrain 1.5 是一个统一模型,通过自回归训练集成物理环境理解、动作生成和未来状态预测,在28个具身基准测试中实现了最先进的开源性能。
文章强调了从2015年到2026年人形机器人技术的快速进展,展示了如跑步和工业任务等高级能力,并推测了到2036年的未来发展。
本文讨论了 GPT-6 Astra 模型在物理世界环境中进行上下文学习的能力,这代表了具身 AI 领域的重大进步。
VSArena v0.6.0是这款浏览器内工作室的重大更新,用于在3D物理环境中运行和评估视觉-语言-动作策略,强调无需本地模拟器或实体机器人即可进行可靠、可复现的评估。
Xiaomi-Robotics-U0-4B 是一款紧凑的4B模型,用于统一的具身世界生成,在World Arena上排名第一,并通过开源代码显著提高了现实世界成功率。
本文介绍了反事实隐世界模型(CLWM),用于解决世界模型中的反事实坍缩问题,通过对比目标提高部分可观测性下具身推理的规划成功率。
Xiaomi Robotics 在 Hugging Face 上发布了一款紧凑的具身世界模型,包括 4B 版本和序列变体,采用 Apache 2.0 许可证。
GPT-6展示了自主启动虚拟机、设置MuJoCo并从视频中重建场景的能力,用于具身AI研究,突出了现实到模拟到现实工作流的进步。
ReactHuman 是一个物理基础的基准,用于评估多模态大语言模型在模拟人形机器人面对家庭危险时的类人反应性决策能力,揭示了持续的安全故障,并提供了一个可扩展的诊断工具。
Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。
一个名为 Astra 的 AI 模型被配备了一个机器人、画笔和相机,用于在现实世界中绘制 Golden Gate Bridge,展示了其在多次尝试中学习和改进的能力。
一段视频展示了名为“GPT Astra”的 AI 系统通过思维链推理指挥机器人清洁桌面的过程。
本文提出一种风险感知世界模型(RIWM),通过优先考虑与决策相关的后果和恢复,而非预测可能性,以增强关键具身系统的安全性。
ZDTaichu5.0-9B 是一个多模态基础模型,结合了 Qwen3.5-9B 语言骨架和 C-RADIOv4-H 视觉编码器,在10B规模的视觉语言模型中擅长一般视觉理解、空间推理和代理任务。