面向机器人学习的进度奖励建模:综合综述
摘要
本综述为机器人学习的进度奖励建模提供了统一视角,将领域组织为三个步骤:接口、方法和数据/基准。
arXiv:2607.21655v1 Announce Type: cross
Abstract: 机器人学习发生在具有大行为空间的动态环境中。终端成功信号仅告知机器人任务是否完成,而无法解释当前行为是在取得进展、保持不变,还是撤销了之前的进展。因此,近年来的研究越来越多地探索在任务执行过程中提供反馈的进度奖励。然而,当前文献缺乏一个共享框架。现有方法使用不同的观测、目标规范、输出信号、监督源和评估协议,这使得难以比较它们并理解其结果实际验证的内容。在本综述中,我们为机器人学习的进度奖励建模提供了统一视角。我们将该领域组织为三个相互关联的步骤。首先,我们研究进度模型的接口。这从外部定义问题,询问模型接收什么信息,以及产生什么形式的进度信号。然后,我们进入模型内部,研究用于构建该信号的方法,揭示进度估计和奖励生成背后的不同假设和机制。最后,我们检查支持这些方法的数据和基准,展示如何获得进度监督以及不同评估实际测量的内容。这三个视角共同连接了进度模型是什么、如何构建以及如何验证其质量。我们进一步总结了当前方法的主要限制,并讨论了未来的研究方向。
查看缓存全文
缓存时间: 2026/07/27 07:41
# 机器人学习中的进度奖励建模:综合综述 来源:https://arxiv.org/html/2607.21655 1\]西北大学 2\]卡内基梅隆大学 3\]威斯康星大学麦迪逊分校 4\]加利福尼亚大学圣塔芭芭拉分校 5\]伊利诺伊大学厄巴纳-香槟分校\\contribution\[\*\]同等贡献 Keliang WuHaoran LuAnbang LiuCe ZhangWeijie YinChengxuan QianXiyuan YangZhenyu PanGuo YeHan Liu\\[\[\[\[ ###### 摘要 机器人学习在动态且行为空间巨大的环境中进行。一个最终成功信号只能告诉机器人任务是否完成,却无法说明当前行为是否在取得进展、保持不变,或是退回到了之前的进度。因此,近年来的研究越来越多地探索在任务执行过程中提供反馈的进度奖励。然而,当前文献缺乏一个共享框架。现有方法使用不同的观测、目标规格、输出信号、监督来源和评估协议。这使得比较这些方法、理解其结果的真正验证内容变得困难。在本综述中,我们为机器人学习的进度奖励建模提供了一个统一的视角。我们将该领域组织为三个相互关联的步骤。首先,我们研究进度模型的**接口**。这从外部定义了问题,询问模型接收什么信息以及产生何种形式的进度信号。然后,我们深入模型内部,研究用于构建此信号的**方法**。这揭示了进度估计和奖励生成背后的不同假设和机制。最后,我们考察支持这些方法的**数据和基准**。这展示了如何获得进度监督,以及不同的评估实际衡量了什么。这三个视角共同联系了进度模型是什么、如何构建以及如何验证其质量。我们还总结了当前方法的主要局限,并讨论了未来的研究方向。 ## 1 引言 机器人学习发生在动态、序列化且高维的环境中\(garmentlab;11128651;generalist2025gen0;Intelligence2026pi07AS;Nvidia2025GR00TNA\)。机器人必须在多个步骤中与物体和物理世界交互,相似的动作根据当前状态和目标,可能对任务进度产生截然不同的影响\(Intelligence202505AV;Ye2026WorldAM\)。相同的任务也可以通过不同的动作序列完成\(yuan2026fastwamworldactionmodels;baumli2023visionlanguage\)。这些特性产生了巨大的行为空间,使得仅从最终任务结果学习变得困难。 大多数机器人学习系统依赖最终成功信号\(liu2023liberobenchmarkingknowledgetransfer;chen2026robodojo;lu2026magicsimunifiedinfrastructureexecutable\)。这种信号告诉机器人任务最终是否完成,但几乎不提供中间执行过程的信息。它无法解释一个动作是否推动了任务进展、没有产生有意义的变化,还是撤销了先前的进度。这个问题在长时域任务中变得更加严重,此时成功结果罕见,且需要在收到任何有用反馈之前做出许多决策\(chen2026rmbenchmemorydependentroboticmanipulation;yong2026generalizabledenserewardlonghorizon\)。 进度奖励通过描述任务执行随时间的变化,提供了更丰富的信号。它们可以在任务完成前提供密集的反馈,并在策略学习期间改进信用分配。它们还可以帮助区分有用行为与无关运动,识别停滞或倒退,以及在最终结果出来前检测失败。除了策略学习,进度信号还能支持在线监控、轨迹重排序、数据过滤、规划、动作选择和失败恢复。因此,一个可靠的进度模型不仅可以用作奖励函数,还可以作为机器人持续行为的一般评估器。 然而,估计进度比预测任务是否成功要困难得多。成功检测通常是一个二分类决策,判断是否达到了最终目标。进度估计则必须将当前观测置于较长任务的演进执行中。模型必须推断任务的哪些部分已经完成,当前正在发生什么,以及执行距离目标还有多远。这种映射也是任务条件化的,因为相同的观测在不同任务下可能代表不同的阶段或不同的进度量。此外,当前观测本身可能不包含足够的信息,因为进度可能依赖于先前的动作、已完成的子目标,以及先前的进度是否被撤销。因此,进度是一个潜在且依赖历史的任务状态,而不是图像或帧的直接可观测属性。一个进度模型必须决定哪些证据是相关的,以及这些证据应如何映射到任务进展。 近年来,进度奖励建模快速增长,如图[1](https://arxiv.org/html/2607.21655#S1.F1)所示。早期研究从演示、时间顺序和视觉目标结构中学习目标接近度和奖励表示\(NEURIPS2021\_868b7df9;ma2023vipuniversalvisualreward;pmlr\-v202\-ma23b;sermanet2017unsupervisedperceptualrewardsimitation\)。后来的工作探索了基础模型相似性分数和语言条件奖励\(baumli2023visionlanguage;rocamonde2024visionlanguage;pmlr\-v164\-nair22a\)、基于偏好的奖励学习\(wang2024rlvlmf;pmlr\-v235\-liu24o;yang2024rank2rewardlearningshapedreward\),以及使用语言模型自动生成奖励\(xietext2reward;pmlr\-v229\-yu23a;ma2024eureka;venuto2024code\)。更近期的系统使用大型视觉-语言模型来估计任务进度和完成度\(zhang2026progresslmprogressreasoningvisionlanguage;liang2026robometerscalinggeneralpurposerobotic;lee2026roborewardgeneralpurposevisionlanguagereward;chen2026toprewardtokenprobabilitieshidden\)、比较状态转换并建模进度变化\(zhai2025vision;tan2025robo;mao2026armadvantagerewardmodeling\)、检测任务成功\(pmlr\-v232\-du23b\),以及通过显式时间记忆对长执行进行推理\(zhang2026recurrentreasoningvisionlanguagemodels\)。这个不断增长的工作表明进度建模正成为机器人学习中的一个重要方向。 参考图注图1:机器人学习进度奖励建模的演变尽管取得了这些进展,文献仍然碎片化。在类似术语下描述的方法常常解决不同的问题。一种方法可能从单张图像预测成功概率,而另一种方法从视频估计进度百分比、比较两个轨迹,或生成可执行的奖励程序。它们还在任务目标如何指定、监督如何获取以及输出如何使用上有所不同。它们的评估同样异构:时间顺序、标量预测误差、偏好准确性、成功检测和下游策略性能验证了不同的属性。因此,难以直接比较方法或确定其报告的结果实际证明了什么。 在本综述中,我们为机器人学习的进度奖励建模提供了一个统一的视角。我们将这个多样化的领域组织为三个相互关联的步骤。首先,第[2](https://arxiv.org/html/2607.21655#S2)节研究进度模型的**接口**。我们将每个模型视为一个任务条件化的黑盒,考察它如何表示当前任务状态、如何指定任务目标,以及产生何种形式的与进度相关的输出。这一视角允许具有不同架构的方法通过共同的输入-输出结构进行比较。 其次,第[3](https://arxiv.org/html/2607.21655#S3)节打开这个黑盒,考察**如何构建进度奖励**。我们根据进度信号的来源及其转换为可用奖励的机制来组织现有方法。这一视角揭示了冻结基础模型评分、时间与相对学习、指令调优的进度预测以及编程奖励构建背后的假设。 第三,第[4](https://arxiv.org/html/2607.21655#S4)节将这些方法与其**数据和评估证据**联系起来。我们考察如何通过人工标注、人工辅助自动化或完全自动化程序产生进度监督。然后,我们将进度忠实度的基准与鲁棒性、泛化性和下游实用性的评估区分开来。这一区分很重要,因为奖励可能改进策略却未忠实表示进度,而准确的进度估计器也可能不适合闭环控制。 #### 范围与贡献。 本综述聚焦于机器人学习中的进度和类似进度的奖励模型。我们不将所有奖励模型视为单一类别,而是研究它们如何定义、构建、监督和评估任务进展。我们的贡献有三方面。首先,我们引入基于接口的视图,通过任务状态表示、目标规格和输出形式来组织进度模型。其次,我们提供了用于构建进度奖励的主要机制的分类法,并阐明其基本假设。第三,我们将数据构建流程与评估协议联系起来,并解释不同基准能够和不能验证什么。我们还在第[5](https://arxiv.org/html/2607.21655#S5)节总结了当前方法的主要局限,并讨论了未来方向。 ## 2 接口:进度模型的输入与输出 参考图注图2:进度模型的接口。我们从三个角度组织现有进度模型接口:当前任务状态表示、任务目标规格和模型输出形式。进度模型的接口决定了模型可以访问哪些证据以及它可以提供何种进度或奖励信号。如图[2](https://arxiv.org/html/2607.21655#S2.F2)所示,我们围绕三个问题组织接口。对于输入接口,关键问题是:(i)当前任务状态如何表示(第[2.1](https://arxiv.org/html/2607.21655#S2.SS1)节)以及(ii)任务目标如何指定(第[2.2](https://arxiv.org/html/2607.21655#S2.SS2)节)。对于输出接口,关键问题是:(iii)模型输出采取何种形式(第[2.3](https://arxiv.org/html/2607.21655#S2.SS3)节)。 ### 2.1 输入接口:当前任务状态如何表示? **单一观测**输入是最简单的:模型接收当前观测和一个任务条件,直接估计奖励、成功度、价值或目标接近度。这种设计假设当前状态包含足够的证据来判断进度。它出现在任务完成或感知奖励模型\(singh2019endtoendroboticreinforcementlearning;NEURIPS2021\_868b7df9;yang2024rank2rewardlearningshapedreward;sermanet2017unsupervisedperceptualrewardsimitation\)中,以及基于CLIP或现代VLM的奖励方法中,这些方法将观测与语言或视觉目标进行比较\(baumli2023visionlanguage;rocamonde2024visionlanguage;pmlr\-v162\-mahmoudieh22a;pmlr\-v168\-cui22a;pmlr\-v202\-ma23b;yang2023robotfinetuningeasypretraining;hung2025victor;zhang2026progresslmprogressreasoningvisionlanguage\)。优势是低延迟且易于在线使用;局限是视觉上相似的状态可能因执行历史而有不同含义。 **时间上下文**通过向模型输入一系列观测来部分解决这种歧义性。对于可以在任务仍在进行时直接输出的在线进度估计,许多方法使用轨迹前缀或短近邻窗口,允许模型在预测当前进度之前推断已经发生的事情\(chen2026toprewardtokenprobabilitieshidden;mao2026armadvantagerewardmodeling;zhang2025rewindlanguageguidedrewardsteach;alakuijala2025videolanguagecritictransferablereward;NEURIPS2023\_d9042abf;zhang2026recurrentreasoningvisionlanguagemodels;liang2026robometerscalinggeneralpurposerobotic;lee2026roborewardgeneralpurposevisionlanguagereward;chen2025sarmstageawarerewardmodeling;pmlr\-v232\-du23b;kim2025subtask\)。其他方法在任务执行后使用完整轨迹作为输入来评分行为、对 rollout 排序、生成偏好标签或离线分析时间进度\(guan2024tasksuccess;chen2021learninggeneralizableroboticreward;ma2025vision;budzianowski2025opengvl;pmlr\-v235\-liu24o\)。关键权衡是明确的:**更长的上下文提供更强的时间证据,但削弱了在线可用性**。 第三种接口通过**比较**来估计进度。模型不是独立判断单个状态的好坏,而是比较两个或多个参考状态,例如动作前后的状态、初始与当前观测、当前与目标状态,或两个候选 rollout。在这种表述中,进度成为一种关系判断,而非单个观测的内在属性。前后比较自然适合估计进度增量、密集奖励和偏好标签\(zhai2025vision;pmlr\-v164\-nair22a;ma2023vipuniversalvisualreward;wang2024rlvlmf\)。初始-当前比较提供了执行从起点移动了多远的更全局视角\(yan2026progressvlaprogressguideddiffusionpolicy;yong2026generalizabledenserewardlonghorizon\),而目标条件比较将当前状态或转换与期望终点相结合\(bhateja2023roboticofflinerlinternet;tan2025robo\)。基于比较的接口通常**信息更丰富、更直观**,但局部比较仍可能遗漏长时域依赖,并且当通过一系列成对判断推断进度时,可能遭受累积误差。 最后,一些方法使用**状态访问接口**,例如环境代码、模拟器API、训练统计数据或本体感受特征来构建奖励\(pmlr\-v229\-yu23a;xietext2reward;ma2024eureka;venuto2024code;pmlr\-v267\-chen25at;cabi2020scalingdatadrivenroboticsreward\)。当相关任务状态被显式表示且可直接访问时,这些接口可能非常有效。然而,这种假设在现实环境中常常不现实,因为进度相关变量通常有噪声、不完整、依赖任务,或者无法通过干净的API获得。因此,**状态访问接口在模拟或设备化环境中最为实用,但对于开放式的现实物理场景不太适用**。 ### 2.2 输入接口:任务目标如何指定? **语言条件目标**用于大多数进度奖励模型\(liang2026robometerscalinggeneralpurposerobotic;chen2026toprewardtokenprobabilitieshidden;zhai2025vision;baumli2023visionlanguage;rocamonde2024visionlanguage;xietext2reward;lee2026roborewardgeneralpurposevisionlanguagereward;hung2025victor;guan2024tasksuccess;pmlr\-v164\-nair22a;pmlr\-v162\-mahmoudieh22a;mao2026armadvantagerewardmodeling;pmlr\-v229\-yu23a;pmlr\-v202\-ma23b;budzianowski2025opengvl;pmlr\-v205\-nair23a;zhang2025rewindlanguageguidedrewardsteach;chen2025sarmstageawarerewardmodeling;pmlr\-v232\-du23b;wang2024rlvlmf;alakuijala2025videolanguagecritictransferablereward;yang2023robotfinetuningeasypretraining;kim2025subtask\)。主要原因是语言目标**易于编码**,与现有语言或视觉-语言模型兼容,并且对于相对简单的任务通常**有效**。然而,语言可能**未能充分指定物理细节**。
相似文章
@svlevine: 我们可以学习一个模型,为机器人强化学习提供塑造的“过程奖励”,它会随着策略的改进而自动演变…
这项工作提出了一个模型,该模型学习塑造的“过程奖励”用于机器人强化学习,该奖励会随着策略的改进而自动演变,从而在基准测试和实际环境中提升性能。
机器人学习中的世界模型:全面综述
本综述全面回顾了机器人学习中世界模型的文献,涵盖其在策略学习、规划和模拟中的作用。文章突出了预测建模在具身智能体中的关键范式、基准测试及未来发展方向。
奖励作为具身世界模型的智能体
本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。
多目标强化学习:具有挑战性的机器人环境与研究建议
OpenAI 推出了一套具有挑战性的多目标强化学习任务,使用 Fetch 和 Shadow Dexterous Hand 硬件,集成到 OpenAI Gym 中,并提出了改进强化学习算法的研究方向。
大模型时代的奖励黑客:机制、涌现错位与挑战
综述提出“代理压缩假设”,解释 RLHF 及相关方法如何在大型语言与多模态模型中系统性地诱发奖励黑客、欺骗与监督博弈。