LeRobot v0.5.0:全面扩展

Hugging Face Blog 产品

摘要

LeRobot v0.5.0 是一个重大版本,支持 Unitree G1 人形机器人、新的策略架构(Pi0-FAST VLAs、实时分块)、用于提升 3 倍训练速度的流式视频编码,以及用于从 Hugging Face Hub 加载仿真环境的 EnvHub。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 17:27

LeRobot v0.5.0:全方位扩展

来源:https://huggingface.co/blog/lerobot-release-v050 返回文章 (https://huggingface.co/blog)

  • 摘要 (https://huggingface.co/blog/lerobot-release-v050#tldr)
  • 目录 (https://huggingface.co/blog/lerobot-release-v050#table-of-contents)
  • 硬件:机器人规模空前 (https://huggingface.co/blog/lerobot-release-v050#hardware-more-robots-than-ever)
    • Unitree G1 人形机器人 (https://huggingface.co/blog/lerobot-release-v050#unitree-g1-humanoid)
    • OpenArm 和 OpenArm Mini (https://huggingface.co/blog/lerobot-release-v050#openarm–openarm-mini)
    • 更多机器人 (https://huggingface.co/blog/lerobot-release-v050#more-robots)
    • CAN 总线电机 (https://huggingface.co/blog/lerobot-release-v050#can-bus-motors)
  • 策略:不断增长的模型库 (https://huggingface.co/blog/lerobot-release-v050#policies-a-growing-model-zoo)
    • Pi0-FAST:自回归 VLA (https://huggingface.co/blog/lerobot-release-v050#pi0-fast-autoregressive-vlas)
    • 实时分块(RTC)(https://huggingface.co/blog/lerobot-release-v050#real-time-chunking-rtc)
    • Wall-X (https://huggingface.co/blog/lerobot-release-v050#wall-x)
    • X-VLA (https://huggingface.co/blog/lerobot-release-v050#x-vla)
    • SARM (https://huggingface.co/blog/lerobot-release-v050#sarm)
    • PEFT 支持 (https://huggingface.co/blog/lerobot-release-v050#peft-support)
  • 数据集:更快的录制、更快的训练 (https://huggingface.co/blog/lerobot-release-v050#datasets-faster-recording-faster-training)
    • 流式视频编码 (https://huggingface.co/blog/lerobot-release-v050#streaming-video-encoding)
    • 图像训练快 10 倍,编码快 3 倍 (https://huggingface.co/blog/lerobot-release-v050#10x-faster-image-training-3x-faster-encoding)
    • 新的数据集工具 (https://huggingface.co/blog/lerobot-release-v050#new-dataset-tools)
  • EnvHub:从 Hub 加载环境 (https://huggingface.co/blog/lerobot-release-v050#envhub-environments-from-the-hub)
    • NVIDIA IsaacLab-Arena (https://huggingface.co/blog/lerobot-release-v050#nvidia-isaaclab-arena)
  • 代码库:现代化基础 (https://huggingface.co/blog/lerobot-release-v050#codebase-a-modern-foundation)
  • 社区与生态 (https://huggingface.co/blog/lerobot-release-v050#community–ecosystem)
  • 最后的思考 (https://huggingface.co/blog/lerobot-release-v050#final-thoughts)

LeRobot v0.5.0 自 v0.4.0 以来已合并了超过 200 个 PR,吸引了 50 多位新贡献者,是迄今为止最大的一次发布——在各个方向上同时扩展。更多机器人(包括首个人形机器人)、更多策略(包括自回归 VLA 的回归)、更快的数据集、可从 Hub 直接加载的仿真环境,以及在 Python 3.12 和 Transformers v5 上运行的现代化代码库。无论你是在仿真中训练策略还是在真实硬件上部署策略,v0.5.0 都有适合你的内容。

摘要

LeRobot v0.5.0 新增了完整的 Unitree G1 人形机器人支持(全身控制模型)、新的策略——包括 Pi0-FAST 自回归 VLA 和用于响应式推理的实时分块——以及流式视频编码,消除了录制片段之间的等待时间。该版本还引入了 EnvHub 用于从 Hugging Face Hub 加载仿真环境、NVIDIA IsaacLab-Arena 集成,以及包括 Python 3.12+、Transformers v5 和第三方策略插件的主要代码库现代化。

目录

  • LeRobot v0.5.0:全方位扩展 (https://huggingface.co/blog/lerobot-release-v050#lerobot-v050-scaling-every-dimension)
    • 摘要 (https://huggingface.co/blog/lerobot-release-v050#tldr)
    • 目录 (https://huggingface.co/blog/lerobot-release-v050#table-of-contents)
    • 硬件:机器人规模空前 (https://huggingface.co/blog/lerobot-release-v050#hardware-more-robots-than-ever)
      • Unitree G1 人形机器人 (https://huggingface.co/blog/lerobot-release-v050#unitree-g1-humanoid)
      • OpenArm 和 OpenArm Mini (https://huggingface.co/blog/lerobot-release-v050#openarm–openarm-mini)
      • 更多机器人 (https://huggingface.co/blog/lerobot-release-v050#more-robots)
      • CAN 总线电机 (https://huggingface.co/blog/lerobot-release-v050#can-bus-motors)
    • 策略:不断增长的模型库 (https://huggingface.co/blog/lerobot-release-v050#policies-a-growing-model-zoo)
      • Pi0-FAST:自回归 VLA (https://huggingface.co/blog/lerobot-release-v050#pi0-fast-autoregressive-vlas)
      • 实时分块(RTC)(https://huggingface.co/blog/lerobot-release-v050#real-time-chunking-rtc)
      • Wall-X (https://huggingface.co/blog/lerobot-release-v050#wall-x)
      • X-VLA (https://huggingface.co/blog/lerobot-release-v050#x-vla)
      • SARM (https://huggingface.co/blog/lerobot-release-v050#sarm)
      • PEFT 支持 (https://huggingface.co/blog/lerobot-release-v050#peft-support)
    • 数据集:更快的录制、更快的训练 (https://huggingface.co/blog/lerobot-release-v050#datasets-faster-recording-faster-training)
      • 流式视频编码 (https://huggingface.co/blog/lerobot-release-v050#streaming-video-encoding)
      • 图像训练快 10 倍,编码快 3 倍 (https://huggingface.co/blog/lerobot-release-v050#10x-faster-image-training-3x-faster-encoding)
      • 新的数据集工具 (https://huggingface.co/blog/lerobot-release-v050#new-dataset-tools)
    • EnvHub:从 Hub 加载环境 (https://huggingface.co/blog/lerobot-release-v050#envhub-environments-from-the-hub)
      • NVIDIA IsaacLab-Arena (https://huggingface.co/blog/lerobot-release-v050#nvidia-isaaclab-arena)
    • 代码库:现代化基础 (https://huggingface.co/blog/lerobot-release-v050#codebase-a-modern-foundation)
    • 社区与生态 (https://huggingface.co/blog/lerobot-release-v050#community–ecosystem)
    • 最后的思考 (https://huggingface.co/blog/lerobot-release-v050#final-thoughts)

硬件:机器人规模空前

LeRobot v0.5.0 戏剧性地扩展了支持的硬件范围——从机械臂和移动机器人到完整的人形机器人。

Unitree G1 人形机器人

本次发布最大的硬件补充:完整的 Unitree G1 人形机器人支持。这是 LeRobot 的首个人形机器人集成,功能非常全面:

  • 运动能力:在环境中行走、导航和移动。
  • 操作能力:执行灵巧的物体操作任务。
  • 远程操作:通过直观的远程操作界面远程控制 G1。
  • 全身控制(WBC):同时协调运动和操作,完成复杂的现实任务。

G1 集成代表了 LeRobot 向通用机器人学迈出的重大一步——超越了桌面机械臂,进入全身体现化 AI。请通过阅读文档自己尝试。

OpenArm 和 OpenArm Mini

我们增加了对 OpenArm 机器人及其配套的 OpenArm Mini 远程操作器的支持。OpenArm 是一款功能强大的机械臂,具有完整的 LeRobot 集成,Mini 可作为其自然的远程操作设备。两者都支持双臂配置,可实现双臂设置以完成更复杂的操作任务。查看文档了解详情。

更多机器人

硬件生态继续增长:

  • Earth Rover:我们首次集成的移动机器人,为 LeRobot 带来了户外导航和地面机器人学。
  • OMX Robot:一款新的机械臂,支持可配置的夹爪设置和标定支持。
  • SO-100/SO-101 整合:我们已将 SO-100 和 SO-101 的实现统一为单一、更清晰的代码库——包括双臂设置。减少了代码重复,便于维护,保留了相同的高质量机器人。

CAN 总线电机

新增通过 CAN(控制器局域网)总线的电机控制器支持,为高性能执行器打开了大门:

  • RobStride:用于高扭矩应用的 CAN 总线电机控制器。
  • Damiao:另一个 CAN 总线电机控制器,扩展了兼容硬件的范围。

这些新增功能意味着 LeRobot 现在可以驱动范围更广的专业级执行器,超越现有的 Dynamixel 和 Feetech 生态系统。

策略:不断增长的模型库

本次发布为 LeRobot 引入了六种新策略和技术,推动了开源机器人学习能力的边界。

Pi0-FAST:自回归 VLA

Pi0-FAST 将自回归视觉语言行动(Vision-Language-Action)模型引入 LeRobot,采用 FAST(频域行动序列令牌化)。与 Pi0 的流匹配方法不同,Pi0-FAST 使用基于 Gemma 300M 的自回归行动专家生成离散化行动令牌,具有以下优势:

  • FAST 令牌化:行动被令牌化用于自回归解码,配备专用的 FAST 行动令牌化器。
  • 灵活解码:可配置的温度和最大解码步数,在速度和质量间取得平衡。
  • RTC 兼容:与实时分块(参见下一部分)配合使用实现响应式推理。
lerobot-train \
  --policy.type=pi0_fast \
  --dataset.repo_id=lerobot/aloha_sim_insertion_human \
  --policy.device=cuda

实时分块(RTC)

实时分块是来自 Physical Intelligence 的推理时技术,使流匹配策略的响应速度大幅提升。它无需等待完整行动块完成后再规划,而是持续将新预测与进行中的行动融合,产生更平顺和更灵敏的行为。

RTC 不是独立的策略——它是一种增强技术,可以插入现有流匹配策略(Pi0 系列、SmolVLA 和 Diffusion)中。通过 --policy.rtc_config.enabled=true 配置。

对于延迟关键的真实部署,这是一个改变游戏规则的技术。阅读原始论文了解技术细节,或查看我们的文档。

Wall-X

Wall-X 是一个新的 VLA 策略,基于 Qwen2.5-VL 构建,采用流匹配行动预测。它将 Qwen2.5-VL 强大的视觉语言理解能力与流匹配头相结合,实现跨体现机器人控制。

pip install lerobot[wall_x]
lerobot-train \
  --policy.type=wall_x \
  --dataset.repo_id=lerobot/aloha_sim_insertion_human

X-VLA

X-VLA 将一个基于 Florence2 的 VLA 引入 LeRobot。基于微软的 Florence-2 视觉语言模型,X-VLA 为 VLA 策略提供了一个替代骨干,扩展了可用于机器人学习的基础模型的多样性。查看训练指南了解设置说明和基础模型。

pip install lerobot[xvla]
lerobot-train \
  --policy.type=xvla \
  --dataset.repo_id=lerobot/bimanual-so100-handover-cube

SARM

**SARM(阶段感知奖励建模)**解决了机器人学习中最难的问题之一:长视野任务。它不是使用单一的全局线性进度信号跨越整个片段,而是通过预测任务阶段和该阶段内的进度来以阶段感知的方式建模进度。这使得为复杂的多步操作任务训练策略变得容易得多。按照文档开始体验。

PEFT 支持

你现在可以使用 LoRA(和其他 PEFT 方法)微调大型 VLA,而无需修改核心训练管道。PEFT 配置位于策略级别,使得用计算能力的一小部分将大规模基础模型适配到你的特定机器人和任务变得简单直接。阅读文档了解更多。

lerobot-train \
  --policy.type=pi0 \
  --policy.peft_config.use_peft=true \
  --dataset.repo_id=lerobot/aloha_sim_insertion_human

数据集:更快的录制、更快的训练

数据集管道在本次发布中获得了重大性能改进,使数据收集和训练的速度都大幅加快。

流式视频编码

之前,录制数据集意味着每个片段后都要等待视频编码完成。不再需要了。 通过流式视频编码,帧在被捕获时实时编码——意味着片段之间零等待时间。只需完成一个片段,立即开始下一个。

流式编码还支持硬件编码器自动检测,因此如果你的系统有 GPU 加速视频编码器,LeRobot 将自动使用它:

dataset = LeRobotDataset.create(
    repo_id="my/dataset",
    fps=30,
    video_backend="auto",       # 自动检测最佳硬件编码器
    streaming_encoding=True,    # 实时编码
)

流式编码的性能可能因硬件和录制设置(摄像头数量、分辨率等)而差异很大。在启用前,务必查看流式视频编码文档。

图像训练快 10 倍,编码快 3 倍

在底层,我们修复了关键的数据访问瓶颈并彻底改革了图像处理:

  • 图像训练快 10 倍:改进了图像转换支持,修复了曾经默默拖累训练速度的数据访问瓶颈。
  • 编码快 3 倍:平行编码现在是所有平台上的默认设置,具有自适应压缩级别,可根据数据集类型(视频或图像)进行调整(不使用流式编码时)。
  • 更好的 CPU 利用率:在录制和数据集创建期间更高效的资源使用。

新的数据集工具

数据集编辑工具包继续增长:

  • 子任务支持:在片段中标注和查询子任务,用于分层任务学习。
  • 图像到视频转换:将现有的基于图像的数据集转换为视频格式,以获得更好的存储效率,支持单个视频文件中的多个片段。
  • 更多编辑操作:用于检查数据集的新 info 操作、任务修改工具,以及对现有操作的众多修复。

相似文章

LeRobot v0.6.0: 想象、评估、改进

Hugging Face Blog

LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。

RoboTTT: Context Scaling for Robot Policies

Hugging Face Daily Papers

RoboTTT将视觉运动上下文扩展到机器人策略的8K时间步长,实现了从人类视频演示中一次模仿、即时策略改进以及对扰动的鲁棒性。它比基线提高了87%,并完成了一个五分钟、十阶段的组装任务,而基线无法完成。