测量机器人策略中的语言迁移:将希腊语添加到Cosmos3视觉-语言-动作策略
摘要
本研究探讨将希腊语添加到Cosmos3视觉-语言-动作机器人策略中,揭示了测量方面的挑战,并表明双语训练能提升性能但会过拟合到翻译者的措辞。结果强调了在低资源本地化中建立空基线和种子复制的必要性。
机器人基础模型主要用英语训练和评估,而大多数语言的机器人演示语料库不存在。我们研究了仅使用机器重述的指令且不改变架构,向开源视觉-语言-动作堆栈添加希腊语。主要挑战在于测量而非翻译。多种可能的测量工具得出了错误结论:颜色直方图指标奖励了噪声,单一目标基准在正确希腊语下得分84.6%,在故意错误指令下得分82.6%,训练损失无法预测希腊语成功,单次运行比较被种子变异主导。在包含三个种子每臂的区分性九十任务套件中,没有希腊语演示的多语言文本塔仍处于其错误指令基线,而仅希腊语训练最多超过其控制2.7个百分点。双语训练比其控制持续高出6.7-7.1个百分点,达到英语性能的大约五分之二。该策略还过拟合到翻译者的措辞;每个任务训练七种措辞大约减半了这种惩罚。从语言适应的世界模型进行热启动和解冻文本塔都会降低性能。结果支持低资源机器人策略本地化的两个实际要求:在信任指标之前建立有保证的空基线,并跨种子复制低资源语言结果。
相似文章
@dair_ai: // 行动胜于言语 // 多语言智能体评估比较最终答案,却将轨迹丢弃…
微软研究院的新研究通过比较动作轨迹而非最终答案,来衡量使用工具的智能体的跨语言策略保留率。在去除五个混淆因素后,四个前沿模型在跨语言条件下保留了71%–73%的动作策略,并发布了代码和238万次rollout数据。
基于VLM智能体的上下文机器人学习
本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。
翻译作为桥梁动作:将人类操作技能迁移至机器人
本文提出了一种基于头戴相机坐标系中相对手腕平移的桥梁动作表征,利用带有交错动作令牌和注意力掩码的视觉-语言-动作模型来处理具身差异,从而将人类操作技能迁移至双臂机器人。
@robotsdigest: 机器人策略常常因为一个令人惊讶的简单原因而失败:它们从训练图像中学习捷径。LIT, Latent …
Latent Interface Training (LIT) 通过先在无视觉输入的情况下教授动作,然后使用姿态监督的潜在接口来保留动作所需的几何结构,从而解决机器人策略从训练图像中学习捷径的问题。
Geometric Action Model 用于机器人策略学习
Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。