标签
本文通过信息论方法和实验验证,刻画了在部分可观测条件下模仿专家所需的最小递归行为记忆。
本文研究了在CARLA模拟器中基于离线专家演示训练的多模态行为克隆策略的闭环驾驶能力,展示了无碰撞的有效自动驾驶,并发布了所有相关成果。
本文进行了一项大规模实证研究,针对离线强化学习和模仿学习,分析了超过16万次训练运行,以理解超参数和数据集属性的影响,并介绍了JumpStart,这是一个用于可靠策略学习研究的资源套件。
这项研究探讨了将框架进化与模型适应相结合用于AI代理,发现直接模仿专家会损害较弱模型的性能,并提出了一种基于策略的纠正方法,以在不破坏框架适应企业任务的情况下提高性能。
本文比较了灵巧操作任务中专家和模仿学习策略的时间鲁棒性,发现模仿学习策略随执行速度增加而显著下降,主要原因是插入错位。
本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。
EXIMO 提出了一种高效的算法,用于微调VLA机器人策略,采用三阶段流程:VLM引导探索、模仿学习和残差强化学习,展示了样本效率和性能的提升。
SAGE是一种面向生产级RAG系统的基于学习的SLO感知自适应检索策略,能够根据每个查询动态选择检索段落数量,在几乎不损失质量的前提下提升SLO合规性并降低延迟与成本。
Sergey Levine 重点介绍了一篇新论文,该论文探讨了为什么动作分块在现代大规模机器人模仿学习中如此有效,并剖析了其背后的原因。
提出了门控后见蒸馏(GHD)方法,利用未来截图作为训练期间的特权信息,恢复移动GUI智能体的正确推理,在AndroidWorld和AndroidLab上两个视觉语言模型中提升了任务成功率。
Khushi 分享了她在 Action Chunking Transformers 和 Diffusion Policy 上的阅读笔记,解释了如何通过动作分块与生成模型(如 VAE 和扩散模型)改进机器人模仿学习,以及如何通过解耦规划与执行来解决推理延迟问题。
This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.
HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。
本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。
DeepEpoch是一个无代码桌面应用,通过行为克隆观察用户操作来学习玩2D游戏,并支持人在回路中微调。
潜在行为在机器人领域越来越受关注,它使得从无动作标签的无标注视频中学习成为可能。DeepMind和FAIR的最新论文展示了从受控游戏环境到野外互联网视频的进展,有望实现模仿学习的可扩展训练。
本文提出了一种统一的模仿学习框架,利用泰勒级数模仿学习和分布鲁棒自适应控制,以应对策略驱动和不确定性驱动的分布偏移,并通过无人机(UAV)案例研究展示了在不确定性下的安全性。
本文讨论了机器人控制从反应式向基于预测的转变,重点介绍了LingBot-VA 2.0模型,该模型能够跟上快速移动的物体(如空气曲棍球),并且仅需少量演示即可学习。
本文介绍了一种算法无关的方法——反馈操控正则化(FMR),它利用评估性反馈改善模仿学习中的对齐效果,在Safety Gymnasium环境中实现了高达98%的对齐错误减少。
介绍使用动作条件世界模型进行数字遥操作,为机器人技术生成多样化训练数据,将数据收集与物理硬件解耦。该系统实现实时生成,并支持零样本Sim2Real迁移。