标签
MemBodied 引入了一种具有联想状态和情节锚点的固定大小情景记忆,旨在增强视觉-语言-动作模型在历史依赖型操作任务中的能力,并显著超越了基线方法的性能。
一项研究合作介绍了ARLI,这是一种通过异步推理使用实时分块来启用视觉-语言-动作模型的强化学习微调的方法,通过让强化学习策略观察更近期的图像来改善机器人行为。
本文介绍了一种方法,将视觉-语言-动作模型中的动作生成分离为慢层和快层,从而实现实时反应式机器人控制,并将成功率从42%提高到97%,仅需10分钟的在线数据。
本文介绍了THAW-VLA,一种将世界模型表示蒸馏到视觉-语言-动作模型中的方法,用于机器人学,增强了在模拟和真实硬件上的鲁棒性和性能,而不会增加推理开销。
CARE是一个面向视觉-语言-动作策略的框架,通过从执行失败中学习生成纠正动作来增强机器人操作,在模拟和现实世界任务中展示了成功率的提升。
GeminiSpace,一款基于Google Gemini的自主室内导航系统,在Gemini 3首尔黑客松中荣获一等奖,其功能是将全景照片转化为可导航地图及机器人路径。
本文介绍了HuRo,一个将人类视频机器人化以创建可扩展VLA预训练数据的流程,展示了在真实世界操作任务中任务完成率和鲁棒性的显著提升。
本文介绍了ActionPiece,一种用于自回归视觉-语言-动作模型的新型动作分词方法,该方法利用物理秩一致性来提高动作关系的保真度,并在LIBERO和SimplerEnv等基准测试中进行了评估。
本文提出时频几何交叉注意力(TFGCA),这是一种即插即用模块,用于分块视觉-语言-动作模型,通过将分块分解为时频表示并捕捉几何关系来改进动作轨迹预测,从而在基准测试和真实机器人任务中实现显著性能提升。
Dynin-Robotics是一个多模态统一扩散模型,整合了视觉、语言和动作,用于语言条件下的机器人控制,通过联合去噪和测试时缩放提高适应性和成功率。
LayerRoute 为视觉-语言-动作策略引入了一种动作条件路由接口,该接口动态调整对 VLM 层表示的访问,以最小的额外参数提升机器人操作性能。
本文批判了那种认为在人工智能突破后机器人学仅仅是一个集成问题的简化观点,强调了训练数据稀缺和视觉语言动作模型泛化能力的挑战。它将这些限制与通过传统自动化实现的专门工业机器人的可靠性进行了对比。
本研究探讨将希腊语添加到Cosmos3视觉-语言-动作机器人策略中,揭示了测量方面的挑战,并表明双语训练能提升性能但会过拟合到翻译者的措辞。结果强调了在低资源本地化中建立空基线和种子复制的必要性。
MobileVLA-R1 2.0是一个强化学习增强的视觉-语言-动作框架,将结构化推理与移动机器人控制相结合,在真实平台上的长期指令跟随方面取得了改进。
ShieldVLA 提出了一种用于视觉-语言-动作模型的安全对齐微调框架,使用 Hamilton-Jacobi 可达性来估计安全操作区域,将安全成本降低57%并提高机器人基准测试中的任务成功率。
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
StreamPI 引入了一个流式多模态时序建模框架,用于视觉-语言-动作模型,通过指令锚定注意力和随机间隔训练来改进机器人操作,无需额外参数。
MA-VLA 是一个用于多臂机器人协作的统一框架,它将协作行为分解为原子提示,并在训练时进行排列(Arm Shuffle)以实现对未见协调模式的泛化。
ForeTime-VLA引入了一种从世界动作模型中提取因果未来令牌的蒸馏方法,以提高动态传送带操作的性能,与现有VLA策略相比,实现了更高的抓取成功率。
本文提出意图蒸馏 (INDI),将行为意图蒸馏到视觉-语言-动作模型的动作解码器中,从而在SimplerEnv-Bridge等基准测试和现实世界任务中提高了性能。