imitation-learning

标签

Cards List
#imitation-learning

@svlevine: 动作分块是一种神秘而有效的方法。现代大规模模仿学习没有它基本无法工作……

X AI KOLs Following · 2天前 缓存

Sergey Levine 重点介绍了一篇新论文,该论文探讨了为什么动作分块在现代大规模机器人模仿学习中如此有效,并剖析了其背后的原因。

0 人收藏 0 人点赞
#imitation-learning

@starlitmatcha:今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是……的实现

X AI KOLs Timeline · 5天前 缓存

Khushi 分享了她在 Action Chunking Transformers 和 Diffusion Policy 上的阅读笔记,解释了如何通过动作分块与生成模型(如 VAE 和扩散模型)改进机器人模仿学习,以及如何通过解耦规划与执行来解决推理延迟问题。

0 人收藏 0 人点赞
#imitation-learning

Mirror Learning

arXiv cs.LG · 2026-08-03 缓存

This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.

0 人收藏 0 人点赞
#imitation-learning

HiFi-UMI:仅依靠高保真UMI数据学习可部署的操作策略

Hugging Face Daily Papers · 2026-07-28 缓存

HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。

0 人收藏 0 人点赞
#imitation-learning

为何第一人称视频对机器人学习可能很重要[D]

Reddit r/MachineLearning · 2026-07-25

本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。

0 人收藏 0 人点赞
#imitation-learning

我构建了一个无代码工具,通过观察你的操作学会玩任何2D游戏

Reddit r/ArtificialInteligence · 2026-07-20

DeepEpoch是一个无代码桌面应用,通过行为克隆观察用户操作来学习玩2D游戏,并支持人在回路中微调。

0 人收藏 0 人点赞
#imitation-learning

@aimalysheva: 潜在行为正当时,尤其在机器人领域:不再预测机器人的实际关节指令或游戏…

X AI KOLs Following · 2026-07-18 缓存

潜在行为在机器人领域越来越受关注,它使得从无动作标签的无标注视频中学习成为可能。DeepMind和FAIR的最新论文展示了从受控游戏环境到野外互联网视频的进展,有望实现模仿学习的可扩展训练。

0 人收藏 0 人点赞
#imitation-learning

分布鲁棒且安全的模仿学习

arXiv cs.LG · 2026-07-16 缓存

本文提出了一种统一的模仿学习框架,利用泰勒级数模仿学习和分布鲁棒自适应控制,以应对策略驱动和不确定性驱动的分布偏移,并通过无人机(UAV)案例研究展示了在不确定性下的安全性。

0 人收藏 0 人点赞
#imitation-learning

我观看了一个机器人以真实速度跟上冰球,它预测比赛而非仅做出反应

Reddit r/ArtificialInteligence · 2026-07-10

本文讨论了机器人控制从反应式向基于预测的转变,重点介绍了LingBot-VA 2.0模型,该模型能够跟上快速移动的物体(如空气曲棍球),并且仅需少量演示即可学习。

0 人收藏 0 人点赞
#imitation-learning

反馈操控正则化:实现模仿学习的离线智能体对齐

arXiv cs.AI · 2026-07-10 缓存

本文介绍了一种算法无关的方法——反馈操控正则化(FMR),它利用评估性反馈改善模仿学习中的对齐效果,在Safety Gymnasium环境中实现了高达98%的对齐错误减少。

0 人收藏 0 人点赞
#imitation-learning

RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型

Hugging Face Daily Papers · 2026-07-07 缓存

介绍使用动作条件世界模型进行数字遥操作,为机器人技术生成多样化训练数据,将数据收集与物理硬件解耦。该系统实现实时生成,并支持零样本Sim2Real迁移。

0 人收藏 0 人点赞
#imitation-learning

SIEVE:面向VLA模型模仿学习的结构感知数据选择方法

Hugging Face Daily Papers · 2026-07-07 缓存

SIEVE是一种面向视觉-语言-动作模仿学习的结构感知数据选择方法,能够识别可复用的视觉运动基元和转换接口,仅使用50%的演示数据和训练步骤即可超越全数据训练。

0 人收藏 0 人点赞
#imitation-learning

视觉语言导航中用于语义探索的路径级事后指令

arXiv cs.AI · 2026-07-03 缓存

介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。

0 人收藏 0 人点赞
#imitation-learning

Active-GRPO:用于分子优化的自适应模仿与自我改进推理

arXiv cs.LG · 2026-07-02 缓存

Active-GRPO 引入了一个自适应模仿与自我改进推理框架,能够动态决定何时模仿参考、何时强化模型自身的发现以进行分子优化,在 TOMG-Bench-MolOpt 基准上取得了相较于先前方法具有统计显著性的改进。

0 人收藏 0 人点赞
#imitation-learning

行为克隆并非所需全部:噪声专家反馈下在线策略蒸馏的最优性

arXiv cs.LG · 2026-07-01 缓存

本文提出一个噪声专家模型来解释离线与在线模仿学习之间的差距,表明从噪声轨迹中离线学习需要指数级样本复杂度,而在线策略蒸馏可实现多项式依赖。该分析引出一种替代损失函数,实验证实了理论发现。

0 人收藏 0 人点赞
#imitation-learning

ReGuide:从测试时引导到自改进扩散策略

arXiv cs.LG · 2026-06-30 缓存

ReGuide 提出了一种面向扩散策略的自改进框架,利用测试时引导生成纠正性轨迹,然后在该数据上微调策略,在 Robomimic 任务上实现了 1.3–7.7 倍的成功率提升。

0 人收藏 0 人点赞
#imitation-learning

@oprydai: lerobot so-101 之所以有趣,是因为它让机器人学习感觉像是一个真正的软件流水线,而不是随机的实验室魔法……

X AI KOLs Following · 2026-06-26 缓存

Lerobot SO-101 是一个框架,它将机器人学习从混乱的实验室魔法转变为干净、可复现的软件流水线,实现了结构化的数据收集、策略训练和部署,类似于 PyTorch 对深度学习所做的那样。

0 人收藏 0 人点赞
#imitation-learning

入乡随俗:从异构智能体学习通用行为

arXiv cs.LG · 2026-06-18 缓存

本文介绍了GRID,一种社会学习方法,通过将每个智能体的奖励函数分解为通用奖励和特定奖励,从异构智能体中提取通用行为,从而得到一个避免模式平均偏差的通用智能体。

0 人收藏 0 人点赞
#imitation-learning

阶段局部化筛选无益:针对演示过滤的逐阶段度量选择的负面结果

arXiv cs.LG · 2026-06-16 缓存

本文研究了逐阶段度量选择是否能改善行为克隆策略的演示筛选。作者发现,阶段门控筛选从未优于全局或统一度量应用,并且缺陷信号在各阶段间的稀释是失败的原因。

0 人收藏 0 人点赞
#imitation-learning

基于强化学习引导的软融合检索方法,用于缺失模态下的鲁棒多模态模仿学习

Hugging Face Daily Papers · 2026-06-13 缓存

RL4IL 提出了一种强化学习引导的检索方法,利用对冻结演示库的软融合来处理推理时机器人模仿学习中的传感器模态缺失问题,在完全摄像头丢失的情况下实现了高成功率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈