标签
Sergey Levine 重点介绍了一篇新论文,该论文探讨了为什么动作分块在现代大规模机器人模仿学习中如此有效,并剖析了其背后的原因。
Khushi 分享了她在 Action Chunking Transformers 和 Diffusion Policy 上的阅读笔记,解释了如何通过动作分块与生成模型(如 VAE 和扩散模型)改进机器人模仿学习,以及如何通过解耦规划与执行来解决推理延迟问题。
This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.
HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。
本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。
DeepEpoch是一个无代码桌面应用,通过行为克隆观察用户操作来学习玩2D游戏,并支持人在回路中微调。
潜在行为在机器人领域越来越受关注,它使得从无动作标签的无标注视频中学习成为可能。DeepMind和FAIR的最新论文展示了从受控游戏环境到野外互联网视频的进展,有望实现模仿学习的可扩展训练。
本文提出了一种统一的模仿学习框架,利用泰勒级数模仿学习和分布鲁棒自适应控制,以应对策略驱动和不确定性驱动的分布偏移,并通过无人机(UAV)案例研究展示了在不确定性下的安全性。
本文讨论了机器人控制从反应式向基于预测的转变,重点介绍了LingBot-VA 2.0模型,该模型能够跟上快速移动的物体(如空气曲棍球),并且仅需少量演示即可学习。
本文介绍了一种算法无关的方法——反馈操控正则化(FMR),它利用评估性反馈改善模仿学习中的对齐效果,在Safety Gymnasium环境中实现了高达98%的对齐错误减少。
介绍使用动作条件世界模型进行数字遥操作,为机器人技术生成多样化训练数据,将数据收集与物理硬件解耦。该系统实现实时生成,并支持零样本Sim2Real迁移。
SIEVE是一种面向视觉-语言-动作模仿学习的结构感知数据选择方法,能够识别可复用的视觉运动基元和转换接口,仅使用50%的演示数据和训练步骤即可超越全数据训练。
介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。
Active-GRPO 引入了一个自适应模仿与自我改进推理框架,能够动态决定何时模仿参考、何时强化模型自身的发现以进行分子优化,在 TOMG-Bench-MolOpt 基准上取得了相较于先前方法具有统计显著性的改进。
本文提出一个噪声专家模型来解释离线与在线模仿学习之间的差距,表明从噪声轨迹中离线学习需要指数级样本复杂度,而在线策略蒸馏可实现多项式依赖。该分析引出一种替代损失函数,实验证实了理论发现。
ReGuide 提出了一种面向扩散策略的自改进框架,利用测试时引导生成纠正性轨迹,然后在该数据上微调策略,在 Robomimic 任务上实现了 1.3–7.7 倍的成功率提升。
Lerobot SO-101 是一个框架,它将机器人学习从混乱的实验室魔法转变为干净、可复现的软件流水线,实现了结构化的数据收集、策略训练和部署,类似于 PyTorch 对深度学习所做的那样。
本文介绍了GRID,一种社会学习方法,通过将每个智能体的奖励函数分解为通用奖励和特定奖励,从异构智能体中提取通用行为,从而得到一个避免模式平均偏差的通用智能体。
本文研究了逐阶段度量选择是否能改善行为克隆策略的演示筛选。作者发现,阶段门控筛选从未优于全局或统一度量应用,并且缺陷信号在各阶段间的稀释是失败的原因。
RL4IL 提出了一种强化学习引导的检索方法,利用对冻结演示库的软融合来处理推理时机器人模仿学习中的传感器模态缺失问题,在完全摄像头丢失的情况下实现了高成功率。