标签
引入Movement Trend Guidance以增强机器人操作中的3D扩散策略,通过无显式轨迹提供预见性,在RoboTwin2.0和LIBERO-40等基准测试上实现性能提升。
一个通用代理通过解读视觉证据、编写可执行程序,并基于物理反馈在多样化的操作任务中调整动作,直接控制物理机器人,无需针对特定任务的训练,便能实现高成功率。
MaP-WAM 引入了一个框架,通过将基于记忆的规划与执行分离,使用情景记忆保持固定的推理延迟,并取得了最先进的结果。
研究人员通过使用触觉传感和先进的摩擦模型,控制滑动,使简单的机器人夹爪能够实现精确的手内物体操作,模仿人类灵巧性。
本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。
PhysCaP 是一个基于物理信息的代码生成代理,它通过主动探索物体来推断隐藏的物理属性,以实现高效的机器人操作。
GOAG 是一种深度生成抓取规划器,它学习特定抓手的接触面分布,为未见物体采样有效抓取,无需针对特定物体的训练,在 MultiDex 数据集上实现了灵巧机器人操作的最先进结果。
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型,利用几何注意力编码、深度估计和蒸馏来预测未来的观察结果,在 WorldArena 2.0 挑战赛中取得了顶尖成绩。
TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。
TableVerse 引入了一个完全自动化的 Real2Sim 流水线,将非结构化、野外图像转换为高保真、可模拟的桌面环境,具有精确的度量标准和物理稳定性,同时提供了一个大规模数据集(TableVerse-100K),用于可泛化的机器人操作。
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
RynnWorld-4D是一个生成式世界模型,它通过统一的扩散过程,从单张RGB-D图像和语言指令中联合生成未来的RGB、深度和光流,通过逆动力学策略学习实现高效的机器人操作。该模型在真实世界的双手操作任务上达到了最先进水平。
PhysisForcing 是一种训练框架,通过基于 DiT 架构的像素级轨迹对齐和语义级关系对齐损失来强制物理一致性,从而增强机器人操作的具身视频生成,在基准测试上取得了显著改进。
Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
介绍Qwen-RobotManip,一个用于机器人操控的视觉-语言-动作基础模型,通过在表征、运动和行为维度上的统一对齐实现泛化,从而能够在多样化的数据源上进行大规模训练。它在多个分布外基准测试中优于先前的最先进模型,并展现出涌现能力,如零样本指令跟随和跨本体迁移。
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。
WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。