InterEvolve:面向人形机器人移动操作的奖励程序测试时进化

Hugging Face Daily Papers 论文

摘要

InterEvolve 引入了面向人形机器人移动操作的奖励程序测试时进化方法,利用物体感知的前向-行为(FB)基础模型以及在上下文中修订分阶段奖励程序的 LLM 智能体,来解锁未训练过的技能,并将进化后的行为自主部署在实体 Unitree G1 机器人上。

我们研究人形机器人移动操作的测试时进化:在无需重新训练的前提下,通过重新利用控制器已有的技能、从自身尝试中改进并保留所学到的能力,来解决控制器从未针对其训练过的任务。我们的核心洞察是:一个通用的控制器本身已经蕴含了新任务所需的大部分能力,而通过一个规划与控制之间的接口——该接口既具有足够的表达力来指定接触丰富、多阶段的交互,又具有足够的可执行性与可度量性,使执行反馈能够基于经验引导规划——这种能力就能被访问到。InterEvolve 通过两个组件实现了这一接口。首先,我们开发了一个物体感知的前向-行为(FB)行为基础模型,其在冻结的全身先验之上学习的物体残差,能够在测试时将关于身体或物体的新奖励转化为移动操作行为。其次,我们将任务指定为奖励程序:带有完成条件和可调常数的分阶段奖励。一个大语言模型(LLM)智能体在上下文中结合执行反馈和由已验证程序构成的技能库来修订程序结构,而数值优化器则负责调节其常数。每个候选程序都会在并行仿真场景中得到验证,程序通过不断探索,以新的方式引发、复用和组合控制器已有的运动能力来完成当前任务,从而在迭代中持续改进。实验表明,人工设计的奖励未能充分利用 FB 模型中的移动操作能力,而 InterEvolve 进化出的程序则释放了这一能力,有时甚至通过全新的策略实现。此外,该方法能在仿真中针对多样化的任务、复杂场景和长时程组合生成行为,并且进化后的技能能够基于机载第一人称感知在实体 Unitree G1 机器人上自主运行。
查看原文
查看缓存全文

缓存时间: 2026/10/02 08:28

论文页面 - InterEvolve:面向人形机器人 loco-manipulation 的奖励程序测试时进化

来源:https://huggingface.co/papers/2610.02196

摘要

我们研究人形机器人 loco-manipulation(移动-操作)的测试时进化:通过重新利用控制器已有的技能来解决它从未被训练过的任务,使其从自身的尝试中不断改进,并在无需重训练的情况下保留所学到的能力。我们的核心洞察是:一个通用的控制器已经具备新任务所需的大部分能力,而这种能力可以通过一个位于规划与控制之间的接口变得可及——该接口既足够有表现力,能够刻画接触密集、多阶段的交互,又足够可执行且可测量,使执行反馈能够依据经验反过来引导规划。InterEvolve 通过两个组件来实现这一接口。首先,我们开发了一个物体感知的前向-后向(forward-backward,FB)行为基础模型,其在冻结身体先验上得到的物体残差,能在测试时将关于身体或物体的新奖励转化为 loco-manipulation 行为。其次,我们将任务指定为奖励程序(reward programs):由带有完成条件和可调常数的分阶段奖励构成。一个大语言模型(LLM)智能体在上下文中修正程序结构,利用执行反馈和一个包含经过验证的程序的技能库,同时由数值优化器来调优其常数。由于每个候选方案都会在并行仿真场景中进行验证,该程序会探索新的方式,以诱导、复用和组合控制器现有的运动能力来应对当前任务,从而在迭代中不断改进。实验表明,人工设计的奖励未能充分挖掘 FB 模型的 loco-manipulation 能力,而 InterEvolve 进化出的程序则释放了这种能力,有时甚至通过全新的策略来实现。它还能够在仿真中为多样的任务、复杂的场景以及长时程的组合生成行为,并且进化出的技能可在实体 Unitree G1 上借助基于自我中心的机载感知自主运行。

[查看 arXiv 页面 (https://arxiv.org/abs/2610.02196)] [查看 PDF (https://arxiv.org/pdf/2610.02196)] [项目页面 (https://sirui-xu.github.io/InterEvolve/)] [添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2610.02196)]

在你的智能体中获取该论文:

hf papers read 2610.02196

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型与该论文关联

在模型 README.md 中引用 arxiv.org/abs/2610.02196 即可从本页面链接过去。

引用该论文的数据集 0

没有数据集与该论文关联

在数据集 README.md 中引用 arxiv.org/abs/2610.02196 即可从本页面链接过去。

引用该论文的 Spaces 0

没有 Space 与该论文关联

在 Space README.md 中引用 arxiv.org/abs/2610.02196 即可从本页面链接过去。

包含该论文的合集 0

没有合集包含该论文

[将该论文添加到合集 (https://huggingface.co/new-collection) 即可从本页面链接过去。]

相似文章

EvoTest:面向自我改进智能体系统的进化式测试时学习

arXiv cs.CL

EvoTest 引入了 J-TTL,一个衡量智能体测试时学习能力的基准,并提出了一个进化框架,其中 Actor 智能体玩游戏,而 Evolver 智能体在不进行微调的情况下迭代改进系统的提示、记忆和超参数。该方法在基于复杂文本的游戏中表现出优于基于反思和记忆的基线方法的性能。

CoEvolve:通过智能体-数据互进化训练LLM智能体

arXiv cs.CL

CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。