imitation-learning

标签

Cards List
#imitation-learning

RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型

Hugging Face Daily Papers ↗ · 2026-07-07 缓存

介绍使用动作条件世界模型进行数字遥操作,为机器人技术生成多样化训练数据,将数据收集与物理硬件解耦。该系统实现实时生成,并支持零样本Sim2Real迁移。

0 人收藏 0 人点赞
#imitation-learning

SIEVE:面向VLA模型模仿学习的结构感知数据选择方法

Hugging Face Daily Papers ↗ · 2026-07-07 缓存

SIEVE是一种面向视觉-语言-动作模仿学习的结构感知数据选择方法,能够识别可复用的视觉运动基元和转换接口,仅使用50%的演示数据和训练步骤即可超越全数据训练。

0 人收藏 0 人点赞
#imitation-learning

视觉语言导航中用于语义探索的路径级事后指令

arXiv cs.AI ↗ · 2026-07-03 缓存

介绍 Φ-Nav,一种统一的在线策略框架,利用事后推理从探索轨迹中合成生成路径级指令,弥合视觉语言导航中的语义监督差距,并在 R2R-CE 和 RxR-CE 基准测试上以更少的专家演示取得了竞争性结果。

0 人收藏 0 人点赞
#imitation-learning

Active-GRPO:用于分子优化的自适应模仿与自我改进推理

arXiv cs.LG ↗ · 2026-07-02 缓存

Active-GRPO 引入了一个自适应模仿与自我改进推理框架,能够动态决定何时模仿参考、何时强化模型自身的发现以进行分子优化,在 TOMG-Bench-MolOpt 基准上取得了相较于先前方法具有统计显著性的改进。

0 人收藏 0 人点赞
#imitation-learning

行为克隆并非所需全部:噪声专家反馈下在线策略蒸馏的最优性

arXiv cs.LG ↗ · 2026-07-01 缓存

本文提出一个噪声专家模型来解释离线与在线模仿学习之间的差距,表明从噪声轨迹中离线学习需要指数级样本复杂度,而在线策略蒸馏可实现多项式依赖。该分析引出一种替代损失函数,实验证实了理论发现。

0 人收藏 0 人点赞
#imitation-learning

ReGuide:从测试时引导到自改进扩散策略

arXiv cs.LG ↗ · 2026-06-30 缓存

ReGuide 提出了一种面向扩散策略的自改进框架,利用测试时引导生成纠正性轨迹,然后在该数据上微调策略,在 Robomimic 任务上实现了 1.3–7.7 倍的成功率提升。

0 人收藏 0 人点赞
#imitation-learning

@oprydai: lerobot so-101 之所以有趣,是因为它让机器人学习感觉像是一个真正的软件流水线,而不是随机的实验室魔法……

X AI KOLs Following ↗ · 2026-06-26 缓存

Lerobot SO-101 是一个框架,它将机器人学习从混乱的实验室魔法转变为干净、可复现的软件流水线,实现了结构化的数据收集、策略训练和部署,类似于 PyTorch 对深度学习所做的那样。

0 人收藏 0 人点赞
#imitation-learning

入乡随俗:从异构智能体学习通用行为

arXiv cs.LG ↗ · 2026-06-18 缓存

本文介绍了GRID,一种社会学习方法,通过将每个智能体的奖励函数分解为通用奖励和特定奖励,从异构智能体中提取通用行为,从而得到一个避免模式平均偏差的通用智能体。

0 人收藏 0 人点赞
#imitation-learning

阶段局部化筛选无益:针对演示过滤的逐阶段度量选择的负面结果

arXiv cs.LG ↗ · 2026-06-16 缓存

本文研究了逐阶段度量选择是否能改善行为克隆策略的演示筛选。作者发现,阶段门控筛选从未优于全局或统一度量应用,并且缺陷信号在各阶段间的稀释是失败的原因。

0 人收藏 0 人点赞
#imitation-learning

基于强化学习引导的软融合检索方法,用于缺失模态下的鲁棒多模态模仿学习

Hugging Face Daily Papers ↗ · 2026-06-13 缓存

RL4IL 提出了一种强化学习引导的检索方法,利用对冻结演示库的软融合来处理推理时机器人模仿学习中的传感器模态缺失问题,在完全摄像头丢失的情况下实现了高成功率。

0 人收藏 0 人点赞
#imitation-learning

@IlirAliu_: ETH Zurich 刚刚开源了他们2026年机器人学习课程的完整内容。不是MOOC。是实际课程。幻灯片、讲座录…

X AI KOLs Timeline ↗ · 2026-06-10 缓存

ETH Zurich 已开源其2026年机器人学习课程的完整内容,包括幻灯片、讲座录像、编程作业和GitHub仓库,内容涵盖从模仿学习到机器人基础模型等主题,并邀请了行业领袖进行客座讲座。

0 人收藏 0 人点赞
#imitation-learning

APT:动作专家预训练提升视觉-语言-动作策略的指令泛化能力

Hugging Face Daily Papers ↗ · 2026-06-10 缓存

研究人员提出APT,一种两阶段训练方法,先在视觉-动作对上预训练动作专家,再整合语言条件,显著提升视觉-语言-动作策略在分布外指令上的泛化能力。

0 人收藏 0 人点赞
#imitation-learning

强化学习中流策略的测试时梯度引导

Hugging Face Daily Papers ↗ · 2026-06-09 缓存

QGF 是一种强化学习算法,通过使用价值梯度来指导预训练的流策略,在测试时改进策略,避免了训练时的不稳定性,同时保持了竞争力的性能。

0 人收藏 0 人点赞
#imitation-learning

@RuohanZhang76:很高兴介绍由 @EvansXuHan 主导的 StereoPolicy。StereoPolicy 是一种为现代机器人策略模型添加几何线索的有效方法……

X AI KOLs Following ↗ · 2026-06-03 缓存

介绍 StereoPolicy 框架,该框架利用同步立体图像对来提升机器人操作策略的几何推理能力,避免了 RGB-D 和点云的脆弱性。它可以集成到基于扩散和视觉-语言-行动的策略中,在仿真和现实任务中均展现出稳定的改进效果。

0 人收藏 0 人点赞
#imitation-learning

基于丰富反馈的分布式DAgger强化学习

Hugging Face Daily Papers ↗ · 2026-06-03 缓存

介绍DistIL,一种从丰富反馈中进行强化学习的方法,保证策略单调改进,在科学推理、编程和数学推理上优于现有方法。

0 人收藏 0 人点赞
#imitation-learning

在符号世界模型上学习双层策略以实现长时域规划

arXiv cs.AI ↗ · 2026-05-18 缓存

提出了BISON系统,该系统将学习到的低层神经策略与高层符号规划相结合,用于长时域具身任务,展现了强大的泛化能力和效率。

0 人收藏 0 人点赞
#imitation-learning

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers ↗ · 2026-05-14 缓存

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。

0 人收藏 0 人点赞
#imitation-learning

信任域逆强化学习:利用局部策略更新进行显式对偶上升

arXiv cs.LG ↗ · 2026-05-13 缓存

本文介绍了信任域逆强化学习(TRIRL),这是一种结合了单调对偶改进与高效局部策略更新的方法,其性能优于最先进的模仿学习方法。该方法通过使用信任域约束,解决了逆强化学习中稳定性与计算成本之间的权衡问题。

0 人收藏 0 人点赞
#imitation-learning

学习局部通信以解决大规模多智能体路径规划

Hugging Face Daily Papers ↗ · 2026-05-12 缓存

本文介绍了LC-MAPF,一种带有可学习通信模块的预训练模型,用于多智能体路径规划,它改善了协调性,并在保持可扩展性的同时优于现有基于学习的求解器。

0 人收藏 0 人点赞
#imitation-learning

通过视频预训练学习玩 Minecraft

OpenAI Blog ↗ · 2022-06-23 缓存

OpenAI 推出了视频预训练(VPT),这是一种半监督方法,通过学习 70,000 小时的未标注人类游戏视频和少量标注数据集来训练神经网络玩 Minecraft。该模型使用原生人类界面(键盘和鼠标)学习复杂的序列任务,展示了制作钻石工具和柱子跳跃等能力,代表了朝向通用计算机使用代理的进步。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈