@giohuh_: 当Astra被赋予类人身体时能做什么?我们构建了HomeBody来探究。由GPT Astra控制,它能够执行…
摘要
HomeBody是一款由GPT Astra控制的类人机器人,它探索未知环境,构建数字孪生体,并执行长期任务,如整理和检索物体,无需特定环境训练。
查看缓存全文
缓存时间: 2026/09/27 09:16
当Astra被赋予类人形体时,它能做什么?
我们开发了HomeBody系统来探索这个问题。在GPT Astra的控制下,HomeBody无需针对特定环境的训练数据或额外的策略学习,即可在未知的厨房环境中执行长期任务——从整理房间到根据模糊指令取回记忆中的物品。
具体实现方式请点击此处查看 👀:https://tml.stanford.edu/homebody/
HomeBody:一个自主探索、记忆与行动的类人机器人
来源:https://tml.stanford.edu/homebody/ 01
长周期类人机器人移动操作
长周期移动操作超越了机器人自身视角所能展示的范围。要在房间内远距离行动,它需要建立内部空间模型,将可见物体与记忆中的位置关联,并帮助解析模糊指令。这种空间上下文指导着机器人的行进路径、操作对象以及行走与操作的时序安排。HomeBody将这种空间记忆与可组合技能相结合,技能执行的反馈能让视觉语言模型在动作或转场失败时动态修正下一步决策。
整理厨房
清理所有咖啡袋并集中放置,同时丢弃所有变质的牛奶和橙汁包装盒。
清理厨房需要决定保留哪些物品、丢弃哪些,以及如何将每个物品移至正确位置。HomeBody将咖啡袋集中到岛台上,并处理指定的包装盒,协调在房间内往返、抓取和放置。随着每次移动视角都会变化,记忆与动作反馈帮助它追踪已完成和待处理的事项。
取回药品
我忘带药了,能帮我拿一下吗?顺便把那个变质的包装盒扔掉。
药品最初不在视野范围内。HomeBody使用存储的关键帧定位抽屉,取出药品交给人员,随后丢弃包装盒。在房间另一侧,它使用右手抓取抽屉把手并拉开抽屉,再用左手丢弃包装盒。通过选择不同手臂,它可以触及身体两侧的目标。
步骤一:探索
首先,我们赋予机器人角色上下文并让其探索未知环境。HomeBody收集0.5倍速iPhone视频、D435i相机观测、配合SLAM的LiDAR扫描、关节位姿,以及由Astra选择的路径点。探索过程从机器人自身视角采集房间数据,将其空间上下文锚定在移动和交互时可见的范围内。当物体离开自身视野时,HomeBody仍能保持该上下文记忆。
探索指令:你是一个厨房机器人,请探索该空间!
HomeBody引导厨房探索过程,选择有用的观测点并保存数据供后续任务使用。
步骤二:Real2Sim转换
HomeBody将Astra作为Real2Sim代理,利用机器人自身收集的数据在Isaac Sim[2]中构建数字孪生。这将其观测数据锚定到世界的空间模型中,帮助高层视觉语言模型推理自身视野外的位点信息。此处查看高精度Real2Sim重建所需条件及重建效果对比。
从探索到数字孪生 将HomeBody的Real2Sim代理锚定在机器人自身探索数据(包括SLAM几何信息、自身视角、关节状态和路径点)上,有助于构建几何、语义和视觉精确的数字孪生,为部署时的推理提供支持。
步骤三:为类人机器人分配日常任务
向机器人发送如“整理厨房”之类的指令。HomeBody使用空间上下文自主选择动作和目标,无需动作级脚本控制。发送以下指令可在数字孪生中回放示例整理过程。
重建厨房示例推演 重建厨房 点击房间或发送以进行3D探索 HomeBody 指令 整理厨房。将咖啡袋放在岛台上并丢弃变质的包装盒。
03
技术实现
从共享房间视角展示探索、空间数据与重建过程,随后是五个厨房动作的实录观测与决策过程。(https://tml.stanford.edu/homebody/figures/overview-full.webp)可扩展技能库观察类人机器人执行导航、抓取、放置和抽屉开启操作。探索技能库****收起技能库导航、拾取、放置和抽屉开启构成了HomeBody的动作词汇表。技能共享目标与执行结果的接口,使视觉语言模型能在部署时动态组合技能。本地重试与视觉反馈可纠正执行错误。
技能01实物机器人 · 1.25×
拾取
抓取并抬起自身视角图像中选定的物体。
技能02实物机器人 · 1.25×
放置
将手持物体移动至选定的三维释放点。
技能03实物机器人 · 1.25× · 可重试
开抽屉
视觉对齐把手,勾住后向后行走以打开抽屉。
技能04实物机器人 · 14× → 4×
从抽屉取物
伸入打开的抽屉,将选定物体抬离抽屉边缘。
技能05实物机器人 · 1.25×
导航
沿规划路径前往Real2Sim地图中的目标位置。
添加自定义技能
通过共享接口连接学习型策略、经典算法或其他控制器。HomeBody的视觉语言模型可将其与现有技能链式调用,以执行新任务。
大部分技能预览已加速至约7-10秒。抽屉开启和抓取包含记录的重试过程。抽屉取物预览从抽屉打开状态开始,保持重试过程的连续性,并在最终成功抓取时放慢速度。
系统架构
中央任务面板分隔高层指令、可热插拔视觉语言模型(Astra标识为记录模型)、子任务进度及当前拾取动作。模拟上下文与实时RGB图像支持决策过程。可扩展技能库连接至物理执行层。(https://tml.stanford.edu/homebody/figures/architecture-full.webp)
常见问题
实现高精度Real2Sim重建需要什么条件?### 人工录制视频
SLAM参考数据
HomeBody(本项目)
手持视频录制的俯视重建图,展示厨房布局与岛台。以与G1重建相同的方位和比例显示的俯视测量SLAM点云,颜色表示高度。基于G1探索数据与SLAM的俯视重建图,展示厨房布局与岛台。
人工录制视频为重建过程提供丰富的视觉细节以匹配房间外观。HomeBody还需精确几何信息用于房间导航、人形定位和物体接触。HomeBody使用机器人自身探索数据作为Real2Sim代理的锚定依据,包括相机观测、测量的SLAM几何信息、关节位姿和选定的路径点。这种锚定方式支持几何精确的空间推理与语义理解。
仅使用视频时,Real2Sim代理从外观估算房间尺寸。HomeBody还提供SLAM测量的几何信息来约束尺寸。中右面板采用相同视角和比例以便直接对比布局。SLAM地图中颜色区分不同高度的点。
HomeBody如何在已知环境中定位?为规划任务完成方式,HomeBody需知晓相关物体位置及G1相对于它们的方位。这种空间上下文帮助规划器选择移动位置和房间内动作序列。为将这些决策锚定在统一坐标系中,我们使用Super Odometry[1]定位G1,并通过迭代最近点(ICP)配准将其SLAM地图与重建模拟空间对齐。HomeBody在此统一坐标系中存储自身相机观测及描述性内容,使机器人能利用空间信息返回记录位置。
HomeBody如何将视觉语言模型决策转化为物理动作?HomeBody使用空间目标连接任务推理与物理执行。视觉语言模型从当前自身视角、地图上下文、夹爪状态、记忆观测及前序结果中选择技能与目标。该选择通过结构化工具调用传递,由技能规划执行运动。因此视觉语言模型无需了解技能的底层实现细节。
对于拾取操作,调用需指定归一化到0-1000的图像点坐标及使用哪只手。该点坐标触发分割[3]处理,Fast-FoundationStereo[4]从D435i立体图像估算深度。相机标定将分割后的几何信息投影至三维空间,我们在此预测抓取姿态。为到达该姿态,手臂规划器构建最小抖动时序的样条参考,沿路径求解逆运动学并检测运动轨迹的碰撞间隙。
其他技能使用适合其动作的目标。导航接受地图坐标系中的二维目标点和朝向点(以米为单位)。放置调用指定使用哪只手、躯干坐标系中的三维释放目标及释放距离。该技能将持握物体移至目标并松开手。抽屉开启技能融合把手对齐、勾取姿态和后向行走,协调从伸展到拉拽的过渡过程。
HomeBody如何纠正错误并重试?目标可能在机器人接近过程中发生视角偏移。分割算法识别物体后,SAM 2.1追踪器结合SAMURAI记忆选择[5]在后续帧中持续跟踪。我们整合视觉伺服技术,利用这些追踪更新在接近过程中校正对齐,无需视觉语言模型为每次调整做新决策。
若抓取闭合时未接触物体,拾取技能可尝试其他抓取候选方案或调整站姿重新规划。这些本地重试次数有限。当恢复方案耗尽或故障需要不同动作时,技能将失败原因返回给视觉语言模型,模型可重新定位、选择新目标或调整计划。
HomeBody从抽屉中重试拾取药瓶。 HomeBody如何协调行走与操作?长周期移动操作需要在手臂伸展操作物体时保持平衡。HomeBody使用预训练的AMO[6]进行上半身感知的下半身控制,在协调下半肢时考虑手臂目标。手臂与手部指令以250Hz运行,AMO策略每五个控制周期(50Hz)更新一次。
HomeBody运行在什么计算设备上?目前为HomeBody构建的技能与感知及运动规划模块,共同运行在配备RTX 4090 GPU的Razer Blade笔记本电脑上。GPT Astra远程运行,向笔记本发送技能请求与目标并接收执行结果。这为HomeBody在野外运行提供了轻量化配置,本地执行技能并通过网络访问前沿模型。
范围与局限性
Real2Sim重建增加了配置时间与API调用成本。任务时长还受限于人形机器人的臂展、操作能力和硬件耐力,包括长时间运行时的舵机过热问题。GPT Astra的推理延迟导致技能间存在停顿。当前本地技术栈需要RTX 4090笔记本GPU,若添加更重的感知模型或技能可能需要更高算力。
致谢
Gio Huh获得加州理工学院Mark Reinecke SURF奖学金(https://sfp.caltech.edu/undergraduate-research/programs/surf)资助,在斯坦福大学(https://www.stanford.edu/)运动实验室(https://tml.stanford.edu/)进行长周期类人机器人移动操作研究。他曾参与斯坦福大学本科生访问研究实习项目(https://studentservices.stanford.edu/more-resources/non-matriculated-student-researchers)。
感谢斯坦福机器人中心(https://src.stanford.edu/)提供厨房场地,斯坦福大学运动实验室(https://tml.stanford.edu/)提供API额度。感谢Alan Yu(https://alanyu.ai/)与Sarthak Kamat(https://www.sartk.com/)提供的宝贵讨论。
参考文献
- Super Odometry: IMU-centric LiDAR-Visual-Inertial Estimator for Challenging Environments (https://superodometry.com/superodom_v1.html)
- NVIDIA Isaac Sim (https://docs.isaacsim.omniverse.nvidia.com/latest/index.html)
- SAM 2: Segment Anything in Images and Videos (https://github.com/facebookresearch/sam2)
- Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching (https://github.com/NVlabs/Fast-FoundationStereo)
- SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory (https://yangchris11.github.io/samurai/)
- AMO: Adaptive Motion Optimization for Hyper-Dexterous Humanoid Whole-Body Control (https://amo-humanoid.github.io/)
引用本文 Gio Huh, Cayden Gu, Takara E. Truong, C. Karen Liu, and Guy Tevet. “HomeBody: A Humanoid That Explores, Remembers, and Acts on Its Own.” 2026.
@misc{huh2026homebody,
author = {Huh, Gio and Gu, Cayden and Truong, Takara E. and Liu, C. Karen and Tevet, Guy},
title = {{HomeBody}: A Humanoid That Explores, Remembers, and Acts on Its Own},
year = {2026},
url = {https://tml.stanford.edu/homebody/}
}
相似文章
GPT-6 Astra 现在能够控制 Unitree G1 类人机器人在从未见过的房间内操作,记住物品位置,进行清理工作,并根据模糊的人类请求稍后取回物品。
GPT-6 Astra 通过使用 Unitree G1 机器人在陌生环境中控制操作、记住物品位置、执行清理任务以及根据模糊的人类请求检索物品,展示了其高级能力。
@VraserX: GPT-6 Astra 刚刚突破了我的界限。给它一架无人机、一个陌生办公室的视频,以及找到并跟随特定目标的任务。
GPT-6 Astra 可以自主操控无人机找到并跟随特定人物,在 Drone-Bench 任务中超越人类基线,尽管可靠性低,但表明其在感知、规划和行动方面具有强大的通用能力。
@VraserX: 关于OpenAI的GPT Astra我们目前所知的一切 OpenAI正式称Astra为其“下一个主要模型” 一个内部的Ast…
OpenAI的GPT Astra是一款具有长期自主性的下一代AI模型,能够解决复杂的研究问题并引发网络安全担忧,从而导致内部安全措施。
GPT Astra 控制机器人清洁桌面(使用 COT)
一段视频展示了名为“GPT Astra”的 AI 系统通过思维链推理指挥机器人清洁桌面的过程。
GPT-6 Astra 现在能够将真实房间的视频转换为交互式 3D 世界,供机器人训练和 AI 视频模型从新视角渲染。
GPT-6 Astra 引入了将真实房间视频转换为交互式 3D 环境的能力,使机器人训练和 AI 视频模型的新视角渲染成为可能。