robot-learning

标签

Cards List
#robot-learning

worldproof:诊断世界模型预测在何处失效,以及像素指标何时完全无法对模型进行排名的测量 [P]

Reddit r/MachineLearning · 昨天

介绍了 worldproof,一个用于诊断世界模型的开源工具,并发现像素指标通常无法在真实机器人视频上对模型进行排名,因为评估视野缺乏区分能力;确定了一个可用的 8-24 步窗口。

0 人收藏 0 人点赞
#robot-learning

@KimD0ing:征文启事:Scaling H2R @ CoRL 2026——人类数据已成为机器人学习最重要的数据。但随着其规模扩大,我们能期待什么?……

X AI KOLs Timeline · 6天前 缓存

CoRL 2026 上 Scaling H2R 研讨会的征文启事,聚焦于人类到机器人学习中的规模法则与多样性。提交截止日期:2026年10月7日。

0 人收藏 0 人点赞
#robot-learning

Light Origins的人形机器人能够自主观察、思考并作用于世界

Reddit r/singularity · 2026-08-03

Light Origins宣布推出一款人形机器人,其由单一感知全身策略驱动,能够自主决定在未见过的地形上是行走、攀爬还是跨越,推理时无需技能标签、状态机或运动生成器。

0 人收藏 0 人点赞
#robot-learning

权重还是技能?机器人学习技术综述:从预测动作的权重到自行编写技能的机器人

Hugging Face Daily Papers · 2026-08-03 缓存

一篇综述论文,将机器人学习技术按照“冻结权重策略(VLA模型)”与“以代码形式自行编写可执行技能的智能体”这一轴线进行组织,提供了自我改进机制的分类法,并分析了新兴的机器人技能经济。

0 人收藏 0 人点赞
#robot-learning

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers · 2026-08-03 缓存

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。

0 人收藏 0 人点赞
#robot-learning

@svlevine: 从次优数据中学习很重要,因为机器人自己会产生次优数据,而且机器人越多,产生的数据就越多……

X AI KOLs Following · 2026-07-31 缓存

Sergey Levine 强调了从次优机器人数据中学习的重要性,并推广了 OopsieData——一个收集并开源那些丰富但未被充分利用的机器人失败交互片段的社区项目。

0 人收藏 0 人点赞
#robot-learning

HiFi-UMI:仅依靠高保真UMI数据学习可部署的操作策略

Hugging Face Daily Papers · 2026-07-28 缓存

HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。

0 人收藏 0 人点赞
#robot-learning

具身操作的数据金字塔

Hugging Face Daily Papers · 2026-07-27 缓存

本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。

0 人收藏 0 人点赞
#robot-learning

为何第一人称视频对机器人学习可能很重要[D]

Reddit r/MachineLearning · 2026-07-25

本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。

0 人收藏 0 人点赞
#robot-learning

如何将 LeRobot 视频读取器的速度提升 15 倍

Hacker News Top · 2026-07-17 缓存

本文介绍了作者如何在 Daft 数据框架库中优化 LeRobot 视频读取器,通过按分片批量解码、分组行、排序目标以及每个聚类只进行一次寻址,最终将帧解码速度提升至原来的 15 倍。

0 人收藏 0 人点赞
#robot-learning

小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化

Hugging Face Daily Papers · 2026-07-16 缓存

小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。

0 人收藏 0 人点赞
#robot-learning

@NVIDIARobotics: 机器人技术建立在合作之上。听听 @huggingface CSO 兼联合创始人 Thomas Wolf 解释开源如何为开发者提供更强的构建基础……

X AI KOLs Following · 2026-07-10 缓存

LeRobot v0.6.0 引入了新的世界模型、奖励模型、更快的数据加载以及改进的基准测试,用于机器人学习,从而闭环机器人学习过程。

0 人收藏 0 人点赞
#robot-learning

iFLYTEK-Embodied-Omni Technical Report

arXiv cs.AI · 2026-07-07 缓存

本技术报告介绍了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,采用脑-小脑协作架构和四阶段训练策略,联合建模视觉、语言和动作,用于具身智能体。

0 人收藏 0 人点赞
#robot-learning

SIEVE:面向VLA模型模仿学习的结构感知数据选择方法

Hugging Face Daily Papers · 2026-07-07 缓存

SIEVE是一种面向视觉-语言-动作模仿学习的结构感知数据选择方法,能够识别可复用的视觉运动基元和转换接口,仅使用50%的演示数据和训练步骤即可超越全数据训练。

0 人收藏 0 人点赞
#robot-learning

LeRobot v0.6.0: 想象、评估、改进

Hugging Face Blog · 2026-07-07 缓存

LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。

0 人收藏 0 人点赞
#robot-learning

将机器人视频分割为可执行的子任务

Hacker News Top · 2026-06-29 缓存

本文介绍了WGO-Bench,一个用于机器人视频子任务标注的基准测试,包含100个片段和743个分割段,发现Gemini模型表现最佳,分割F1分数为0.306,标注准确率为61%,开源流程每小时视频成本为2.64美元。

0 人收藏 0 人点赞
#robot-learning

从动作到世界建模的可迁移动态先验学习

Hugging Face Daily Papers · 2026-06-28 缓存

本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。

0 人收藏 0 人点赞
#robot-learning

@oprydai: lerobot so-101 之所以有趣,是因为它让机器人学习感觉像是一个真正的软件流水线,而不是随机的实验室魔法……

X AI KOLs Following · 2026-06-26 缓存

Lerobot SO-101 是一个框架,它将机器人学习从混乱的实验室魔法转变为干净、可复现的软件流水线,实现了结构化的数据收集、策略训练和部署,类似于 PyTorch 对深度学习所做的那样。

0 人收藏 0 人点赞
#robot-learning

翻译作为桥梁动作:将人类操作技能迁移至机器人

Hugging Face Daily Papers · 2026-06-26 缓存

本文提出了一种基于头戴相机坐标系中相对手腕平移的桥梁动作表征,利用带有交错动作令牌和注意力掩码的视觉-语言-动作模型来处理具身差异,从而将人类操作技能迁移至双臂机器人。

0 人收藏 0 人点赞
#robot-learning

SimFoundry:模块化与自动化场景生成用于策略学习与评估

Hugging Face Daily Papers · 2026-06-26 缓存

SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈