@LeRobotHF: VLA-JEPA 刚刚在 LeRobot 中发布。这个模型的特别之处在于它不仅学习从观测中采取什么行动……
摘要
VLA-JEPA,一种集成了 JEPA 世界模型以学习动作相关动态的新模型,已在 LeRobot 中发布。它支持使用人类视频进行预训练,仅需少量微调即可获得强大性能,并在 NVIDIA DGX Spark 上实时运行。
查看缓存全文
缓存时间: 2026/06/08 05:14
VLA-JEPA 刚刚在 LeRobot 中发布
这个模型的特别之处在于,它不仅学习从给定的观测中应采取什么行动,还利用 JEPA 世界模型来学习与动作相关的动态。
训练过程中,VLA 通过条件化其预测器来利用 V-JEPA2。这一巧妙技巧为训练增加了世界建模目标,也允许在人类视频上进行预训练。 推理时,世界模型被完全丢弃,只保留标准的 VLA 架构:Qwen 主干和动作头。
这里的演示仅对 13 个示例进行了微调,展示了强大的预训练能力,并在 @NVIDIARobotics DGX Spark 上实时运行!
VLA-JEPA 是第一个移植到 LeRobot 的世界模型,我觉得它不会是最后一个
@Thom_Wolf @ClementDelangue
相似文章
@TheTuringPost: 来自@ylecun、@randall_balestr及其同事的一篇新论文,扩展了LeJEPA——这次应用于视频。LeVJEPA的目标是m…
LeVJEPA将LeJEPA扩展到视频以实现高效训练,仅使用一个编码器和投影器处理5%的视频块,在计算量显著降低的情况下匹配或超越V-JEPA 2。
DVD-JEPA:一个开源、完全可复现的JEPA世界模型 [P]
DVD-JEPA 是一个开源、极简的 JEPA 世界模型,它通过预测未来嵌入而非像素来从视频中学习表示。它使用弹跳的 DVD 标志来演示位置恢复、梦境生成和异常检测,所有这些都在浏览器中运行。
LeRobot v0.6.0: 想象、评估、改进
LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。
AV-JEPA: 将LeJEPA扩展到音视频自监督学习
AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。