标签
DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。
介绍了W2-VLA,一种用于精细机器人操作的视觉-语言-动作模型,该模型对任务条件下的未来手腕观测进行建模,在基准测试和真实世界任务中实现了改进的操作性能。
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。
πR^2 提出了一种面向机器人操作的反应式实时流策略,将条件输入分为快速通道和慢速通道,并采用延迟自适应流调度,使得闭环重规划速度比基线策略快约4倍,成功率最高提升30%。
Grabette 是一个开放、低成本的系统,通过手持夹爪和摄像头记录机器人操作数据,旨在构建用于机器人学习的共享数据集。
介绍B-spline Policy (BSP),它将动作参数化为连续的B样条曲线,而不是离散的固定速率动作块,从而在低成本机器人臂上实现更快更平滑的操作。
CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。
本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。
InternVLA-A1.5 将预训练的视觉语言模型与潜在空间中的未来预测相结合,以实现具有组合泛化和长视界执行能力的高效机器人操作,在模拟基准测试中取得了最先进的结果。
VLA-Corrector 提出了一种轻量级的检测与纠正推理框架,可在无需重新训练的情况下自适应调整视觉-语言-动作策略中的动作视野,提升机器人操控任务的鲁棒性和效率。
Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。
3D HAMSTER利用带深度编码的视觉-语言模型生成用于点云控制的三维轨迹,从而增强机器人操作能力,其表现优于二维引导的基线方法。
本文描述了ICRA 2026上LeHome Challenge的获奖解决方案,该方案中双臂机器人通过新颖的强化学习方法学习折叠各种衣物,采用了自包含价值函数、异步训练和大量模拟到真实增强。
Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。
研究人员提出APT,一种两阶段训练方法,先在视觉-动作对上预训练动作专家,再整合语言条件,显著提升视觉-语言-动作策略在分布外指令上的泛化能力。
AEGIS 使用激活探针早期预警,在长时域机器人操作中故障累积之前切换到更强的策略,恢复的故障次数是预算匹配升级策略的两倍。
AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。
本文提出了几何基本结构(GPS),这是一种用于机器人操作中关节部件感知的新表示方法,支持高效的VR标注,无需微调即可达到73%的成功率。