LeRobot v0.6.0: 想象、评估、改进
摘要
LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。
查看缓存全文
缓存时间: 2026/07/06 16:35
LeRobot v0.6.0:想象、评估、改进
来源:https://huggingface.co/blog/lerobot-release-v060 返回文章列表 (https://huggingface.co/blog)
- TL;DR (https://huggingface.co/blog/lerobot-release-v060#tldr)
- 目录 (https://huggingface.co/blog/lerobot-release-v060#table-of-contents)
- 世界模型:会想象的策略 (https://huggingface.co/blog/lerobot-release-v060#world-models-policies-that-imagine)- VLA-JEPA (https://huggingface.co/blog/lerobot-release-v060#vla-jepa) - LingBot-VA (https://huggingface.co/blog/lerobot-release-v060#lingbot-va) - FastWAM (https://huggingface.co/blog/lerobot-release-v060#fastwam)
- VLA:不断壮大的模型动物园 (https://huggingface.co/blog/lerobot-release-v060#vlas-the-model-zoo-keeps-growing)- GR00T N1.7 (https://huggingface.co/blog/lerobot-release-v060#gr00t-n17) - MolmoAct2 (https://huggingface.co/blog/lerobot-release-v060#molmoact2) - EO-1 (https://huggingface.co/blog/lerobot-release-v060#eo-1) - Multitask DiT (https://huggingface.co/blog/lerobot-release-v060#multitask-dit) - EVO1 (https://huggingface.co/blog/lerobot-release-v060#evo1)
- 奖励模型:判断机器人是否成功 (https://huggingface.co/blog/lerobot-release-v060#reward-models-knowing-when-your-robot-succeeds)- Robometer (https://huggingface.co/blog/lerobot-release-v060#robometer) - TOPReward (https://huggingface.co/blog/lerobot-release-v060#topreward)
- 数据集:加载更快,数据更丰富 (https://huggingface.co/blog/lerobot-release-v060#datasets-faster-loading-richer-data)- 你的编码器,你说了算 (https://huggingface.co/blog/lerobot-release-v060#your-codec-your-rules) - 深度支持,端到端 (https://huggingface.co/blog/lerobot-release-v060#depth-support-end-to-end) - 规模化语言标注 (https://huggingface.co/blog/lerobot-release-v060#language-annotations-at-scale) - 数据加载速度提升2倍 (https://huggingface.co/blog/lerobot-release-v060#up-to-2x-faster-data-loading)
- 基准测试:一个CLI评估所有 (https://huggingface.co/blog/lerobot-release-v060#benchmarks-one-cli-to-evaluate-them-all)
- 训练与推理 (https://huggingface.co/blog/lerobot-release-v060#training–inference)-
lerobot-rollout:部署有了专属CLI (https://huggingface.co/blog/lerobot-release-v060#lerobot-rollout-deployment-gets-its-own-cli) - FSDP:训练超过GPU内存容量的模型 (https://huggingface.co/blog/lerobot-release-v060#fsdp-train-models-bigger-than-your-gpu) - 使用HF Jobs进行云端训练 (https://huggingface.co/blog/lerobot-release-v060#cloud-training-with-hf-jobs) - 代码库:更精简,更干净 (https://huggingface.co/blog/lerobot-release-v060#codebase-leaner-and-cleaner)
- 社区与生态系统 (https://huggingface.co/blog/lerobot-release-v060#community–ecosystem)
- 结语 (https://huggingface.co/blog/lerobot-release-v060#final-thoughts)
本次新版本旨在闭环机器人学习流程:能够在行动前预想未来的策略、能告诉你机器人是否成功的奖励模型、可将失败转化为训练数据的部署CLI,以及六个全新的仿真基准测试来全面评估这一切。此外,还带来了深度感知、VLM驱动的数据集标注、自定义视频编码、基于HF Jobs的云端训练,以及显著精简的安装过程。
https://huggingface.co/blog/lerobot-release-v060#tldrTL;DR
LeRobot v0.6.0 引入了学会想象未来的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),一波新的VLA模型(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),以及一个新的奖励模型API(Robometer、TOPReward)。它提供了统一在 lerobot-eval 下的六个全新仿真基准测试、带有DAgger风格人工介入纠正的 lerobot-rollout CLI、FSDP训练以及与HF Jobs集成的云端训练。数据集方面获得了深度支持、自动语言标注流程、自定义视频编码以及高达2倍的数据加载速度提升,所有这些都基于一个更精简的安装包。
LeRobot 0.6.0 (https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/lerobot-blog/release-v0.6.0/lerobot%20v0.6.0.png)
https://huggingface.co/blog/lerobot-release-v060#table-of-contents目录
- LeRobot v0.6.0:想象、评估、改进 (https://huggingface.co/blog/lerobot-release-v060#lerobot-v060-imagine-evaluate-improve)- TL;DR (https://huggingface.co/blog/lerobot-release-v060#tldr) - 目录 (https://huggingface.co/blog/lerobot-release-v060#table-of-contents) - 世界模型:会想象的策略 (https://huggingface.co/blog/lerobot-release-v060#world-models-policies-that-imagine)- VLA-JEPA (https://huggingface.co/blog/lerobot-release-v060#vla-jepa) - LingBot-VA (https://huggingface.co/blog/lerobot-release-v060#lingbot-va) - FastWAM (https://huggingface.co/blog/lerobot-release-v060#fastwam) - VLA:不断壮大的模型动物园 (https://huggingface.co/blog/lerobot-release-v060#vlas-the-model-zoo-keeps-growing)- GR00T N1.7 (https://huggingface.co/blog/lerobot-release-v060#gr00t-n17) - MolmoAct2 (https://huggingface.co/blog/lerobot-release-v060#molmoact2) - EO-1 (https://huggingface.co/blog/lerobot-release-v060#eo-1) - Multitask DiT (https://huggingface.co/blog/lerobot-release-v060#multitask-dit) - EVO1 (https://huggingface.co/blog/lerobot-release-v060#evo1) - 奖励模型:判断机器人是否成功 (https://huggingface.co/blog/lerobot-release-v060#reward-models-knowing-when-your-robot-succeeds)- Robometer (https://huggingface.co/blog/lerobot-release-v060#robometer) - TOPReward (https://huggingface.co/blog/lerobot-release-v060#topreward) - 数据集:加载更快,数据更丰富 (https://huggingface.co/blog/lerobot-release-v060#datasets-faster-loading-richer-data)- 你的编码器,你说了算 (https://huggingface.co/blog/lerobot-release-v060#your-codec-your-rules) - 深度支持,端到端 (https://huggingface.co/blog/lerobot-release-v060#depth-support-end-to-end) - 规模化语言标注 (https://huggingface.co/blog/lerobot-release-v060#language-annotations-at-scale) - 数据加载速度提升2倍 (https://huggingface.co/blog/lerobot-release-v060#up-to-2x-faster-data-loading) - 基准测试:一个CLI评估所有 (https://huggingface.co/blog/lerobot-release-v060#benchmarks-one-cli-to-evaluate-them-all) - 训练与推理 (https://huggingface.co/blog/lerobot-release-v060#training–inference)-
lerobot-rollout:部署有了专属CLI (https://huggingface.co/blog/lerobot-release-v060#lerobot-rollout-deployment-gets-its-own-cli) - FSDP:训练超过GPU内存容量的模型 (https://huggingface.co/blog/lerobot-release-v060#fsdp-train-models-bigger-than-your-gpu) - 使用HF Jobs进行云端训练 (https://huggingface.co/blog/lerobot-release-v060#cloud-training-with-hf-jobs) - 代码库:更精简,更干净 (https://huggingface.co/blog/lerobot-release-v060#codebase-leaner-and-cleaner) - 社区与生态系统 (https://huggingface.co/blog/lerobot-release-v060#community–ecosystem) - 结语 (https://huggingface.co/blog/lerobot-release-v060#final-thoughts)
https://huggingface.co/blog/lerobot-release-v060#world-models-policies-that-imagine世界模型:会想象的策略
机器人领域正在探讨一个重大问题:世界模型真的能帮助机器人策略吗?v0.6.0 为 LeRobot 带来了三种策略来帮助回答这个问题。每种策略都在训练过程中学会想象未来,并且各自采用了不同的方法来保持这种想象的可实现性。
https://huggingface.co/blog/lerobot-release-v060#vla-jepaVLA-JEPA
VLA-JEPA 教导一个紧凑的 VLA(基于 Qwen3-VL-2B)在学习行动的同时,在潜在空间中预测未来:在训练期间,一个 JEPA 世界模型需要根据模型自身的行动来预测未来的帧。其诀窍在于,推理时这个世界模型会消失,因此你可以零额外推理成本获得世界模型的监督。Hub 上有三个可直接使用的检查点,包括一个用于微调的 DROID 预训练基础模型:
lerobot-train \ --policy.path=lerobot/VLA-JEPA-Pretrain \ --dataset.repo_id=${HF_USER}/my_dataset \ --policy.repo_id=${HF_USER}/my_finetuned_policy
查看 VLA-JEPA 文档 (https://huggingface.co/docs/lerobot/v0.6.0/vla_jepa) 和论文 (https://arxiv.org/abs/2602.10098) 了解更多信息。
https://huggingface.co/blog/lerobot-release-v060#lingbot-vaLingBot-VA
LingBot-VA 更进一步:一个自回归视频-动作模型,将未来的视频和动作一起逐块进行预测,并反馈真实的观测以保持其想象的接地性。你甚至可以保存机器人的想象结果(--policy.save_predicted_video=true)并与实际发生的情况进行比较。推理可以在单个 24-32 GB GPU 上运行。查看文档 (https://huggingface.co/docs/lerobot/v0.6.0/lingbot_va) 和论文 (https://arxiv.org/pdf/2601.21998) 了解技术细节。
LingBot-VA 想象的展开与实际展开对比 (https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/lerobot-blog/release-v0.6.0/gifs/lingbot_va_viz_1.gif)
https://huggingface.co/blog/lerobot-release-v060#fastwamFastWAM
FastWAM 在其论文标题中提出了一个问题:世界动作模型需要测试时的未来想象吗?它将一个约5B的视频生成专家与一个紧凑的动作专家配对在一个网络中,因此模型实际上学会了梦想自己的展开。在推理时,它完全跳过梦想过程,直接对动作块进行去噪。从 lerobot/fastwam_base (https://huggingface.co/lerobot/fastwam_base) 进行微调,并在文档 (https://huggingface.co/docs/lerobot/v0.6.0/fastwam) 中了解更多信息。
https://huggingface.co/blog/lerobot-release-v060#vlas-the-model-zoo-keeps-growingVLA:不断壮大的模型动物园
https://huggingface.co/blog/lerobot-release-v060#gr00t-n17GR00T N1.7
我们将 NVIDIA GR00T 集成升级到 GR00T N1.7,这是 NVIDIA 最新的开源跨实体基础模型。N1.7 将之前的 VLM 替换为 Cosmos-Reason2-2B(基于 Qwen3-VL),并馈送到一个流匹配动作头。我们的集成已与 NVIDIA 原始 Isaac-GR00T 实现进行过一致性测试:相同的输入,相同的输出。Flash-attention 现在是可选的,因此 pip install 'lerobot[groot]' 可以直接使用,并且你可以直接加载 NVIDIA 发布的检查点 (https://huggingface.co/nvidia/GR00T-N1.7-3B)。
GR00T N1.7 在 LeRobot 中取代了 N1.5。如果你需要 N1.5,请固定版本
lerobot==0.5.1。
https://huggingface.co/blog/lerobot-release-v060#molmoact2MolmoAct2
Allen Institute for AI 的视觉-语言-动作模型 MolmoAct2 现已移植到 LeRobot,并覆盖了完整生命周期:微调(全参数或 LoRA)、评估和真实机器人部署。内置了校准校正的现成检查点,意味着你可以在 SO-100/101 上零样本运行它:
lerobot-rollout \ --policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \ --task="pick up the red cube" --duration=30
推理在 bf16 下仅需约 12 GB,LoRA 微调可在单个 24 GB GPU 上进行。查看 MolmoAct2 文档 (https://huggingface.co/docs/lerobot/v0.6.0/molmoact2) 获取完整部署指南。
MolmoAct2 在 LeRobot 中的零样本表现 (https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/lerobot-blog/release-v0.6.0/gifs/molmoact2_4.gif)
https://huggingface.co/blog/lerobot-release-v060#eo-1EO-1
EO-1,一个在交错视觉-文本-动作数据上进行预训练的 VLA,加入了 LeRobot:它使用 Qwen2.5-VL-3B 骨干网络和流匹配动作头,由该论文的一位作者贡献。使用标准的 lerobot-train 工作流,通过 --policy.type=eo1 进行训练。详情见文档 (https://huggingface.co/docs/lerobot/v0.6.0/eo1) 和论文 (https://arxiv.org/abs/2508.21112)。
https://huggingface.co/blog/lerobot-release-v060#multitask-ditMultitask DiT
Multitask Diffusion Transformer 策略将 TRI Large Behavior Models 的方法引入 LeRobot:一个约450M参数的扩散 transformer,以 CLIP 视觉和语言嵌入为条件,因此一个模型可以通过自然语言学习多个选择的任务。它同时支持扩散和流匹配目标,并且体积足够小,你可以自己训练。查看文档 (https://huggingface.co/docs/lerobot/v0.6.0/multi_task_dit)。
https://huggingface.co/blog/lerobot-release-v060#evo1EVO1
VLA 不必都很大。EVO1 将其策略压缩到 0.77B 参数,采用 InternVL3-1B 骨干网络和流匹配动作头,足够小,可以在中等 GPU 上进行微调并实时运行。它内置了两阶段微调和实时分块支持。查看 EVO1 文档 (https://huggingface.co/docs/lerobot/v0.6.0/evo1) 和论文 (https://arxiv.org/abs/2511.04555)。
https://huggingface.co/blog/lerobot-release-v060#reward-models-knowing-when-your-robot-succeeds奖励模型:判断机器人是否成功
成功检测和进度评估是机器人学习循环中缺失的部分,v0.6.0 为它们提供了家园。LeRobot 现在拥有一个统一的奖励模型 API(lerobot.rewards),镜像了策略 API,在统一接口背后提供了四个奖励模型——HIL-SERL 奖励分类器、SARM,以及两个新成员:
https://huggingface.co/blog/lerobot-release-v060#robometerRobometer
Robometer 是一个预训练的通用奖励模型:指向任何 LeRobot 数据集上的 lerobot/Robometer-4B (https://huggingface.co/lerobot/Robometer-4B),它就能根据原始视频和语言指令对任务进度和成功进行评分,无需特定任务的训练。它基于 Qwen3-VL-4B 构建,并在包含超过一百万条机器人轨迹的数据集上通过轨迹比较进行训练(RSS 2026 论文 (https://arxiv.org/abs/2603.02115))。
LeRobot Robometer (https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/lerobot-blog/release-v0.6.0/gifs/rm_robometer.gif)
https://huggingface.co/blog/lerobot-release-v060#toprewardTOPReward
TOPReward 完全零样本:根本不需要奖励权重。它包装一个现成的 VLM(Qwen3-VL),并根据轨迹视频和任务指令读取 Token “True” 的对数概率。任何有能力的 VLM 都可以成为一个奖励函数。
两者都附带了标注脚本,可以将每帧的进度曲线写入你的数据集,为奖励感知的行为克隆(RA-BC)、数据集质量检查和进度叠加视频做好准备。查看 Robometer (https://huggingface.co/docs/lerobot/v0.6.0/robometer) 和 TOPReward (https://huggingface.co/docs/lerobot/v0.6.0/topreward) 文档。
https://huggingface.co/blog/lerobot-release-v060#datasets-faster-loading-richer-data数据集:加载更快,数据更丰富
https://huggingface.co/blog/lerobot-release-v060#your-codec-your-rules你的编码器,你说了算
录制不再局限于单一的硬编码编码器。新的 --dataset.rgb_encoder.* 选项暴露了完整的编码设置(编码器、质量、像素格式、GOP、预设),vcodec=auto 会探测硬件编码器(如 NVENC、VideoToolbox、VAAPI、QSV),然后回退到默认的软件 AV1 编码器。对于现有数据集,一条命令即可重新编码所有内容:
lerobot-edit-dataset \ --repo_id ${HF_USER}/my_dataset \ --operation.type reencode_videos \ --operation.rgb_encoder.vcodec h264 \ --operation.rgb_encoder.crf 23
完整细节见视频编码文档 (https://huggingface.co/docs/lerobot/v0.6.0/video_encoding_parameters)。
https://huggingface.co/blog/lerobot-release-v060#depth-support-end-to-end深度支持,端到端
插上 Intel RealSense,设置 `use_d
相似文章
LeRobot v0.5.0:全面扩展
LeRobot v0.5.0 是一个重大版本,支持 Unitree G1 人形机器人、新的策略架构(Pi0-FAST VLAs、实时分块)、用于提升 3 倍训练速度的流式视频编码,以及用于从 Hugging Face Hub 加载仿真环境的 EnvHub。
@NVIDIARobotics: 机器人技术建立在合作之上。听听 @huggingface CSO 兼联合创始人 Thomas Wolf 解释开源如何为开发者提供更强的构建基础……
LeRobot v0.6.0 引入了新的世界模型、奖励模型、更快的数据加载以及改进的基准测试,用于机器人学习,从而闭环机器人学习过程。
NVIDIA和Hugging Face为开源机器人社区向LeRobot引入新模型与框架
NVIDIA和Hugging Face正在将NVIDIA的Isaac GR00T 1.7机器人基础模型、Isaac Teleop框架以及即将推出的Cosmos 3世界模型整合到开源LeRobot库中,以加速开源机器人开发。
@LeRobotHF: VLA-JEPA 刚刚在 LeRobot 中发布。这个模型的特别之处在于它不仅学习从观测中采取什么行动……
VLA-JEPA,一种集成了 JEPA 世界模型以学习动作相关动态的新模型,已在 LeRobot 中发布。它支持使用人类视频进行预训练,仅需少量微调即可获得强大性能,并在 NVIDIA DGX Spark 上实时运行。
@robbyant_brain: LingBot-VLA 2.0 现已开源——我们新一代的具身基础模型。6万小时高质量预训练数据…
LingBot-VLA 2.0,一个开源的具身基础模型,已发布,拥有6万小时预训练数据,支持17个品牌的20种机器人配置,在RTX 4090上推理时间低于130毫秒。