@HuggingPapers:将视频预训练扩展到12万小时 ZimaBlue将视频缩放视为实现可泛化世界行动模型的途径……
摘要
将视频预训练扩展到12万小时,可将世界行动模型在真实机器人上的零样本成功率从36.1%提升至77.8%,实现更快的动作预测。
查看缓存全文
缓存时间: 2026/09/03 20:14
将视频预训练扩展至12万小时
ZimaBlue将视频扩展视为通往可泛化世界行动模型的途径。在真实机器人测试中,零样本成功率从36.1%跃升至77.8%,并实现了30赫兹的动作预测。https://t.co/qoauPCL21J
相似文章
ZimaBlue: 通过可扩展的视频预训练进化可泛化的世界行动模型
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。
Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models (29 minute read)
Dyna-2 is a world-action model pre-trained on over a million hours of human video, showing scaling laws on human data and a human-to-robot transfer scaling law for zero-shot robot performance.
小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放任务泛化
Zero-WAM 是一个因果视频-动作模型,通过基于上下文的人类视频指导,实现对未见过任务的零样本机器人操作,并利用 HumanGen 数据集和未来块预测目标来提高泛化能力。