@LeRobotHF: VLA-JEPA 刚刚在 LeRobot 中发布。这个模型的特别之处在于它不仅学习从观测中采取什么行动……

X AI KOLs Following 模型

摘要

VLA-JEPA,一种集成了 JEPA 世界模型以学习动作相关动态的新模型,已在 LeRobot 中发布。它支持使用人类视频进行预训练,仅需少量微调即可获得强大性能,并在 NVIDIA DGX Spark 上实时运行。

VLA-JEPA 刚刚在 LeRobot 中发布 这个模型的特别之处在于它不仅学习从给定观测中采取什么行动,还利用 JEPA 世界模型学习动作相关动态。 在训练过程中,VLA 通过调节其预测器来利用 V-JEPA2。这个巧妙的技巧为训练增加了世界建模的目标,从而也允许在人类视频上进行预训练。 在推理时,世界模型被完全丢弃,只保留标准的 VLA 架构:Qwen 主干网络和动作头部。 这里的演示仅用 13 个示例进行微调,展示了强大的预训练能力,并在 @NVIDIARobotics DGX Spark 上实时运行! VLA-JEPA 是第一个移植到 LeRobot 的世界模型,我觉得这不会是最后一个 @Thom_Wolf @ClementDelangue
查看原文
查看缓存全文

缓存时间: 2026/06/08 05:14

VLA-JEPA 刚刚在 LeRobot 中发布

这个模型的特别之处在于,它不仅学习从给定的观测中应采取什么行动,还利用 JEPA 世界模型来学习与动作相关的动态。

训练过程中,VLA 通过条件化其预测器来利用 V-JEPA2。这一巧妙技巧为训练增加了世界建模目标,也允许在人类视频上进行预训练。 推理时,世界模型被完全丢弃,只保留标准的 VLA 架构:Qwen 主干和动作头。

这里的演示仅对 13 个示例进行了微调,展示了强大的预训练能力,并在 @NVIDIARobotics DGX Spark 上实时运行!

VLA-JEPA 是第一个移植到 LeRobot 的世界模型,我觉得它不会是最后一个

@Thom_Wolf @ClementDelangue

相似文章

DVD-JEPA:一个开源、完全可复现的JEPA世界模型 [P]

Reddit r/MachineLearning

DVD-JEPA 是一个开源、极简的 JEPA 世界模型,它通过预测未来嵌入而非像素来从视频中学习表示。它使用弹跳的 DVD 标志来演示位置恢复、梦境生成和异常检测,所有这些都在浏览器中运行。

LeRobot v0.6.0: 想象、评估、改进

Hugging Face Blog

LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。

AV-JEPA: 将LeJEPA扩展到音视频自监督学习

arXiv cs.AI

AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。