EmbodiedSWE: 用于长期灵巧机器人任务的编码代理
摘要
本文介绍了 EmbodiedSWE,这是一个使用编码代理来解决复杂、长期的灵巧机器人任务,并通过模拟基准生成演示以训练机器人策略的框架。
查看缓存全文
缓存时间: 2026/09/24 07:40
论文页面 - EmbodiedSWE:面向长时程灵巧机器人的编程智能体
来源:https://huggingface.co/papers/2609.27308 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们研究面向长时程、灵巧操作的编程智能体,并探究其解决方案能否为学习通用机器人策略提供可扩展的监督。为此,我们开发了EMBODIEDSWE-BENCH,这是一个用于编程智能体的仿真基准,涵盖接触丰富的操作、可变形物体以及需要长达半小时连续交互的长时程任务。我们发现,前沿的编程智能体能够解决复杂的长时程任务,并将先验解决方案跨任务、跨机器人形态进行迁移。我们还设计了辅助工具,以帮助智能体更有效地解决这些任务。然而,所得解决方案需要大量的迭代交互,且通常针对单个任务实例专门化。因此,我们推出了EMBODIEDSWE-GEN,它将编程智能体生成的单个解决方案扩展为大规模的多样化轨迹,用于训练VLA模型。VLA的性能随着生成演示数量的增加而提升,而借助智能体进行的多样化操作提升了对未见任务变体的泛化能力。我们还表明,仅在编程智能体生成的仿真演示上微调的VLA模型,能够在真实机器人上完成长时程任务。总而言之,我们的框架利用编程智能体解决复杂的机器人任务,并将经过验证的解决方案转化为可用于机器人策略的可扩展监督信号。
查看arXiv页面 (https://arxiv.org/abs/2609.27308) 查看PDF (https://arxiv.org/pdf/2609.27308) 项目页面 (https://embodiedswe.github.io/) GitHub16 (https://github.com/EmbodiedSWE/EmbodiedSWE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.27308)
在您的智能体中获取此论文:
hf papers read 2609.27308
没有最新版CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.27308 以从本页面链接。
引用本文的数据集 0
无数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.27308 以从本页面链接。
引用本文的Spaces 0
无Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.27308 以从本页面链接。
包含本文的合集 0
无合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
Socratic-SWE:基于轨迹派生的智能体技能实现自进化编码智能体
Socratic-SWE 提出了一种用于软件工程智能体的闭环自进化框架,该框架利用历史求解轨迹生成针对性修复任务,经过三次迭代后在 SWE-bench Verified 上达到 50.40%。
Self-Evolving Embodied Agents via Skill-Harness Evolution
This paper introduces SHAPER, a self-evolving framework for embodied agents that keeps model parameters frozen and improves performance by evolving reusable skills and context-code harnesses through target-environment rollouts. Evaluated on VLABench and ESI-Bench, it proposes a practical alternative to fine-tuning when training is expensive or unavailable.
SWE-Touch:当用户修改代码时对编码智能体的基准测试
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。
SWE-Together: 在交互式用户会话中评估代码代理
SWE-Together 是一个基于真实用户-代理交互创建的多轮代码基准测试,采用反应式LLM模拟器,根据最终正确性和交互效率评估代理。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。