imitation-learning

标签

Cards List
#imitation-learning

在部分可观测条件下进行模仿学习的最小递归行为记忆

arXiv cs.LG ↗ · 昨天 缓存

本文通过信息论方法和实验验证,刻画了在部分可观测条件下模仿专家所需的最小递归行为记忆。

0 人收藏 0 人点赞
#imitation-learning

CARLA中的自动驾驶模仿学习

arXiv cs.AI ↗ · 2026-09-17 缓存

本文研究了在CARLA模拟器中基于离线专家演示训练的多模态行为克隆策略的闭环驾驶能力,展示了无碰撞的有效自动驾驶,并发布了所有相关成果。

0 人收藏 0 人点赞
#imitation-learning

JumpStart:基于16万次训练运行的经验加速策略学习

arXiv cs.LG ↗ · 2026-09-15 缓存

本文进行了一项大规模实证研究,针对离线强化学习和模仿学习,分析了超过16万次训练运行,以理解超参数和数据集属性的影响,并介绍了JumpStart,这是一个用于可靠策略学习研究的资源套件。

0 人收藏 0 人点赞
#imitation-learning

Salesforce 发现了更好的方法来共同进化代理及其控制机制(9分钟阅读)

TLDR AI ↗ · 2026-09-11 缓存

这项研究探讨了将框架进化与模型适应相结合用于AI代理,发现直接模仿专家会损害较弱模型的性能,并提出了一种基于策略的纠正方法,以在不破坏框架适应企业任务的情况下提高性能。

0 人收藏 0 人点赞
#imitation-learning

模仿学习是否在灵巧操作中保持时间鲁棒性?跨任务执行速度的专家与学习者比较

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

本文比较了灵巧操作任务中专家和模仿学习策略的时间鲁棒性,发现模仿学习策略随执行速度增加而显著下降,主要原因是插入错位。

0 人收藏 0 人点赞
#imitation-learning

使用潜空间世界模型预测后果并强化导航策略

arXiv cs.AI ↗ · 2026-08-28 缓存

本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。

0 人收藏 0 人点赞
#imitation-learning

EXIMO:VLM引导的VLA策略探索

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

EXIMO 提出了一种高效的算法,用于微调VLA机器人策略,采用三阶段流程:VLM引导探索、模仿学习和残差强化学习,展示了样本效率和性能的提升。

0 人收藏 0 人点赞
#imitation-learning

SAGE:面向生产级RAG系统的SLO感知自适应检索策略

arXiv cs.LG ↗ · 2026-08-11 缓存

SAGE是一种面向生产级RAG系统的基于学习的SLO感知自适应检索策略,能够根据每个查询动态选择检索段落数量,在几乎不损失质量的前提下提升SLO合规性并降低延迟与成本。

0 人收藏 0 人点赞
#imitation-learning

@svlevine: 动作分块是一种神秘而有效的方法。现代大规模模仿学习没有它基本无法工作……

X AI KOLs Following ↗ · 2026-08-07 缓存

Sergey Levine 重点介绍了一篇新论文,该论文探讨了为什么动作分块在现代大规模机器人模仿学习中如此有效,并剖析了其背后的原因。

0 人收藏 0 人点赞
#imitation-learning

下一张截图见分晓:移动GUI智能体的门控后见蒸馏

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

提出了门控后见蒸馏(GHD)方法,利用未来截图作为训练期间的特权信息,恢复移动GUI智能体的正确推理,在AndroidWorld和AndroidLab上两个视觉语言模型中提升了任务成功率。

0 人收藏 0 人点赞
#imitation-learning

@starlitmatcha:今天我读了几篇关于 Action Chunking Transformers (ACT) 和 Diffusion Policy 的论文,它们是……的实现

X AI KOLs Timeline ↗ · 2026-08-04 缓存

Khushi 分享了她在 Action Chunking Transformers 和 Diffusion Policy 上的阅读笔记,解释了如何通过动作分块与生成模型(如 VAE 和扩散模型)改进机器人模仿学习,以及如何通过解耦规划与执行来解决推理延迟问题。

0 人收藏 0 人点赞
#imitation-learning

Mirror Learning

arXiv cs.LG ↗ · 2026-08-03 缓存

This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.

0 人收藏 0 人点赞
#imitation-learning

HiFi-UMI:仅依靠高保真UMI数据学习可部署的操作策略

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。

0 人收藏 0 人点赞
#imitation-learning

为何第一人称视频对机器人学习可能很重要[D]

Reddit r/MachineLearning ↗ · 2026-07-25

本文讨论了使用第一人称视频进行机器人学习的潜在优势和挑战,指出虽然直接模仿有限,但视觉注意序列可能得以迁移。文章引用了LingBot-VLA 2.0,并呼吁进行控制实验以分离视角效应和数据量影响。

0 人收藏 0 人点赞
#imitation-learning

我构建了一个无代码工具,通过观察你的操作学会玩任何2D游戏

Reddit r/ArtificialInteligence ↗ · 2026-07-20

DeepEpoch是一个无代码桌面应用,通过行为克隆观察用户操作来学习玩2D游戏,并支持人在回路中微调。

0 人收藏 0 人点赞
#imitation-learning

@aimalysheva: 潜在行为正当时,尤其在机器人领域:不再预测机器人的实际关节指令或游戏…

X AI KOLs Following ↗ · 2026-07-18 缓存

潜在行为在机器人领域越来越受关注,它使得从无动作标签的无标注视频中学习成为可能。DeepMind和FAIR的最新论文展示了从受控游戏环境到野外互联网视频的进展,有望实现模仿学习的可扩展训练。

0 人收藏 0 人点赞
#imitation-learning

分布鲁棒且安全的模仿学习

arXiv cs.LG ↗ · 2026-07-16 缓存

本文提出了一种统一的模仿学习框架,利用泰勒级数模仿学习和分布鲁棒自适应控制,以应对策略驱动和不确定性驱动的分布偏移,并通过无人机(UAV)案例研究展示了在不确定性下的安全性。

0 人收藏 0 人点赞
#imitation-learning

我观看了一个机器人以真实速度跟上冰球,它预测比赛而非仅做出反应

Reddit r/ArtificialInteligence ↗ · 2026-07-10

本文讨论了机器人控制从反应式向基于预测的转变,重点介绍了LingBot-VA 2.0模型,该模型能够跟上快速移动的物体(如空气曲棍球),并且仅需少量演示即可学习。

0 人收藏 0 人点赞
#imitation-learning

反馈操控正则化:实现模仿学习的离线智能体对齐

arXiv cs.AI ↗ · 2026-07-10 缓存

本文介绍了一种算法无关的方法——反馈操控正则化(FMR),它利用评估性反馈改善模仿学习中的对齐效果,在Safety Gymnasium环境中实现了高达98%的对齐错误减少。

0 人收藏 0 人点赞
#imitation-learning

RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型

Hugging Face Daily Papers ↗ · 2026-07-07 缓存

介绍使用动作条件世界模型进行数字遥操作,为机器人技术生成多样化训练数据,将数据收集与物理硬件解耦。该系统实现实时生成,并支持零样本Sim2Real迁移。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈