标签
介绍了 worldproof,一个用于诊断世界模型的开源工具,并发现像素指标通常无法在真实机器人视频上对模型进行排名,因为评估视野缺乏区分能力;确定了一个可用的 8-24 步窗口。
CoRL 2026 上 Scaling H2R 研讨会的征文启事,聚焦于人类到机器人学习中的规模法则与多样性。提交截止日期:2026年10月7日。
Light Origins宣布推出一款人形机器人,其由单一感知全身策略驱动,能够自主决定在未见过的地形上是行走、攀爬还是跨越,推理时无需技能标签、状态机或运动生成器。
一篇综述论文,将机器人学习技术按照“冻结权重策略(VLA模型)”与“以代码形式自行编写可执行技能的智能体”这一轴线进行组织,提供了自我改进机制的分类法,并分析了新兴的机器人技能经济。
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
Sergey Levine 强调了从次优机器人数据中学习的重要性,并推广了 OopsieData——一个收集并开源那些丰富但未被充分利用的机器人失败交互片段的社区项目。
HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。
本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。
本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。
本文介绍了作者如何在 Daft 数据框架库中优化 LeRobot 视频读取器,通过按分片批量解码、分组行、排序目标以及每个聚类只进行一次寻址,最终将帧解码速度提升至原来的 15 倍。
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。
LeRobot v0.6.0 引入了新的世界模型、奖励模型、更快的数据加载以及改进的基准测试,用于机器人学习,从而闭环机器人学习过程。
本技术报告介绍了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,采用脑-小脑协作架构和四阶段训练策略,联合建模视觉、语言和动作,用于具身智能体。
SIEVE是一种面向视觉-语言-动作模仿学习的结构感知数据选择方法,能够识别可复用的视觉运动基元和转换接口,仅使用50%的演示数据和训练步骤即可超越全数据训练。
LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。
本文介绍了WGO-Bench,一个用于机器人视频子任务标注的基准测试,包含100个片段和743个分割段,发现Gemini模型表现最佳,分割F1分数为0.306,标注准确率为61%,开源流程每小时视频成本为2.64美元。
本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。
Lerobot SO-101 是一个框架,它将机器人学习从混乱的实验室魔法转变为干净、可复现的软件流水线,实现了结构化的数据收集、策略训练和部署,类似于 PyTorch 对深度学习所做的那样。
本文提出了一种基于头戴相机坐标系中相对手腕平移的桥梁动作表征,利用带有交错动作令牌和注意力掩码的视觉-语言-动作模型来处理具身差异,从而将人类操作技能迁移至双臂机器人。
SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。