EmbodiedSWE: 用于长期灵巧机器人任务的编码代理

Hugging Face Daily Papers 论文

摘要

本文介绍了 EmbodiedSWE,这是一个使用编码代理来解决复杂、长期的灵巧机器人任务,并通过模拟基准生成演示以训练机器人策略的框架。

我们研究用于长期灵巧机器人任务的编码代理,并探讨其解决方案是否能为学习通用机器人策略提供可扩展的监督。为了测试这一点,我们开发了 EMBODIEDSWE-BENCH,这是一个面向编码代理的模拟基准,涵盖接触丰富的操作、可变形物体以及需要长达半小时连续交互的长期任务。我们发现,前沿编码代理能够解决复杂的长期任务,并将先前解决方案在不同任务和实体之间迁移。我们还设计了辅助工具,以帮助代理更有效地解决这些任务。然而,生成的解决方案需要大量的迭代交互,并且通常专门针对单个任务实例。因此,我们引入了 EMBODIEDSWE-GEN,它将编码代理的单个解决方案扩展为大量多样化的轨迹,用于训练 VLA。VLA 性能随着更多生成的演示而提高,而代理辅助的多样化改进了对未见任务变体的泛化能力。我们还展示了一个仅基于编码代理生成的模拟演示进行微调的 VLA 在真实机器人上完成了长期任务。总之,我们的框架使用编码代理来解决复杂的机器人任务,并将经过验证的解决方案转化为机器人策略的可扩展监督。
查看原文
查看缓存全文

缓存时间: 2026/09/24 07:40

论文页面 - EmbodiedSWE:面向长时程灵巧机器人的编程智能体

来源:https://huggingface.co/papers/2609.27308 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们研究面向长时程、灵巧操作的编程智能体,并探究其解决方案能否为学习通用机器人策略提供可扩展的监督。为此,我们开发了EMBODIEDSWE-BENCH,这是一个用于编程智能体的仿真基准,涵盖接触丰富的操作、可变形物体以及需要长达半小时连续交互的长时程任务。我们发现,前沿的编程智能体能够解决复杂的长时程任务,并将先验解决方案跨任务、跨机器人形态进行迁移。我们还设计了辅助工具,以帮助智能体更有效地解决这些任务。然而,所得解决方案需要大量的迭代交互,且通常针对单个任务实例专门化。因此,我们推出了EMBODIEDSWE-GEN,它将编程智能体生成的单个解决方案扩展为大规模的多样化轨迹,用于训练VLA模型。VLA的性能随着生成演示数量的增加而提升,而借助智能体进行的多样化操作提升了对未见任务变体的泛化能力。我们还表明,仅在编程智能体生成的仿真演示上微调的VLA模型,能够在真实机器人上完成长时程任务。总而言之,我们的框架利用编程智能体解决复杂的机器人任务,并将经过验证的解决方案转化为可用于机器人策略的可扩展监督信号。

查看arXiv页面 (https://arxiv.org/abs/2609.27308) 查看PDF (https://arxiv.org/pdf/2609.27308) 项目页面 (https://embodiedswe.github.io/) GitHub16 (https://github.com/EmbodiedSWE/EmbodiedSWE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.27308)

在您的智能体中获取此论文:

hf papers read 2609.27308

没有最新版CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.27308 以从本页面链接。

引用本文的数据集 0

无数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.27308 以从本页面链接。

引用本文的Spaces 0

无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.27308 以从本页面链接。

包含本文的合集 0

无合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

Self-Evolving Embodied Agents via Skill-Harness Evolution

arXiv cs.CL

This paper introduces SHAPER, a self-evolving framework for embodied agents that keeps model parameters frozen and improves performance by evolving reusable skills and context-code harnesses through target-environment rollouts. Evaluated on VLABench and ESI-Bench, it proposes a practical alternative to fine-tuning when training is expensive or unavailable.