InterEvolve:面向人形机器人移动操作的奖励程序测试时进化
摘要
InterEvolve 引入了面向人形机器人移动操作的奖励程序测试时进化方法,利用物体感知的前向-行为(FB)基础模型以及在上下文中修订分阶段奖励程序的 LLM 智能体,来解锁未训练过的技能,并将进化后的行为自主部署在实体 Unitree G1 机器人上。
查看缓存全文
缓存时间: 2026/10/02 08:28
论文页面 - InterEvolve:面向人形机器人 loco-manipulation 的奖励程序测试时进化
来源:https://huggingface.co/papers/2610.02196
摘要
我们研究人形机器人 loco-manipulation(移动-操作)的测试时进化:通过重新利用控制器已有的技能来解决它从未被训练过的任务,使其从自身的尝试中不断改进,并在无需重训练的情况下保留所学到的能力。我们的核心洞察是:一个通用的控制器已经具备新任务所需的大部分能力,而这种能力可以通过一个位于规划与控制之间的接口变得可及——该接口既足够有表现力,能够刻画接触密集、多阶段的交互,又足够可执行且可测量,使执行反馈能够依据经验反过来引导规划。InterEvolve 通过两个组件来实现这一接口。首先,我们开发了一个物体感知的前向-后向(forward-backward,FB)行为基础模型,其在冻结身体先验上得到的物体残差,能在测试时将关于身体或物体的新奖励转化为 loco-manipulation 行为。其次,我们将任务指定为奖励程序(reward programs):由带有完成条件和可调常数的分阶段奖励构成。一个大语言模型(LLM)智能体在上下文中修正程序结构,利用执行反馈和一个包含经过验证的程序的技能库,同时由数值优化器来调优其常数。由于每个候选方案都会在并行仿真场景中进行验证,该程序会探索新的方式,以诱导、复用和组合控制器现有的运动能力来应对当前任务,从而在迭代中不断改进。实验表明,人工设计的奖励未能充分挖掘 FB 模型的 loco-manipulation 能力,而 InterEvolve 进化出的程序则释放了这种能力,有时甚至通过全新的策略来实现。它还能够在仿真中为多样的任务、复杂的场景以及长时程的组合生成行为,并且进化出的技能可在实体 Unitree G1 上借助基于自我中心的机载感知自主运行。
[查看 arXiv 页面 (https://arxiv.org/abs/2610.02196)] [查看 PDF (https://arxiv.org/pdf/2610.02196)] [项目页面 (https://sirui-xu.github.io/InterEvolve/)] [添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2610.02196)]
在你的智能体中获取该论文:
hf papers read 2610.02196
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
没有模型与该论文关联
在模型 README.md 中引用 arxiv.org/abs/2610.02196 即可从本页面链接过去。
引用该论文的数据集 0
没有数据集与该论文关联
在数据集 README.md 中引用 arxiv.org/abs/2610.02196 即可从本页面链接过去。
引用该论文的 Spaces 0
没有 Space 与该论文关联
在 Space README.md 中引用 arxiv.org/abs/2610.02196 即可从本页面链接过去。
包含该论文的合集 0
没有合集包含该论文
[将该论文添加到合集 (https://huggingface.co/new-collection) 即可从本页面链接过去。]
相似文章
EvoTrainer:面向自主智能体强化学习的LLM策略与训练框架协同进化
EvoTrainer提出了一种自主训练框架,通过经验反馈协同进化LLM策略与训练框架,在数学推理、代码生成以及长期软件工程任务上超越了人工设计的强化学习基线。
RoboEvolve:在有限数据下实现机器人操作的计划器与模拟器协同进化
RoboEvolve是一个框架,它协同进化VLM规划器和VGM模拟器用于机器人操作,仅用500张无标签种子图像就实现了数据效率以及鲁棒的持续学习。
LUCID:基于想象动力学的潜在技能统一控制,用于长时域人形机器人移动操作
本文介绍了LUCID,一种用于长时域人形机器人移动操作的分层基于模型的强化学习框架。它学习可复用的潜在技能和宏动力学世界模型,通过想象展开实现高层规划,并提高模拟多物体重排任务中的成功率。
EvoTest:面向自我改进智能体系统的进化式测试时学习
EvoTest 引入了 J-TTL,一个衡量智能体测试时学习能力的基准,并提出了一个进化框架,其中 Actor 智能体玩游戏,而 Evolver 智能体在不进行微调的情况下迭代改进系统的提示、记忆和超参数。该方法在基于复杂文本的游戏中表现出优于基于反思和记忆的基线方法的性能。
CoEvolve:通过智能体-数据互进化训练LLM智能体
CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。