迈向机器人技术的通用后训练(18分钟阅读)

TLDR AI 论文

摘要

文章认为,机器人技术需要类似语言模型的后训练以实现高可靠性,并探讨了机器人系统中通用后训练面临的挑战和潜在方法。

机器人技术需要一个类似语言模型的通用后训练方案,以实现可靠的自主部署。现有的方法,如模仿学习,更多依赖于直觉而非结构化过程,而强化学习的不稳定性阻碍了机器人技术的发展。EXPO-FT的开发展示了一种稳定的强化学习方法,强调了标准化协议、奖励规范、人类反馈系统和可扩展流程的必要性,以增强机器人技术的可靠性。
查看原文
查看缓存全文

缓存时间: 2026/09/24 14:41

# 走向机器人领域的通用后训练 —— Perry Dong 来源:https://pd-perry.github.io/posts/post-training.html ← 返回博客 (https://pd-perry.github.io/blog.html) 2026年9月 · 阅读时长13分钟 本文目录 1. 可扩展的可靠性 (https://pd-perry.github.io/posts/post-training.html#scalable-reliability) 2. 我们曾见过类似的剧本 (https://pd-perry.github.io/posts/post-training.html#seen-before) 3. 配方所需的两要素 (https://pd-perry.github.io/posts/post-training.html#two-things) 4. 为何机器人学是一个与大语言模型不同的强化学习问题? (https://pd-perry.github.io/posts/post-training.html#different-rl-problem) 5. 为何我们不能直接使用现有的基于价值函数的强化学习方法? (https://pd-perry.github.io/posts/post-training.html#value-based-rl) 6. 机器人强化学习算法可能是什么样子? (https://pd-perry.github.io/posts/post-training.html#algorithm) 7. 标准训练流程 (https://pd-perry.github.io/posts/post-training.html#protocols) 8. 走向通用后训练 (https://pd-perry.github.io/posts/post-training.html#towards-universal) 自故事诞生之初,人们就一直想象着机器人与人类并肩工作的场景。2026年,这一愿景比以往任何时候都更接近现实。Physical Intelligence、Generalist、DeepMind等领先机构都展示了能够完成真正复杂任务的预训练模型,以至于前沿机器人模型的发展看起来与GPT-2时代的语言模型发展颇为相似。 但复杂行为不等于可靠性。一个在摆放餐具时有95%成功率的机器人,在一个满是玻璃器皿、宠物和孩子的家庭环境中,每周都会打碎点东西。预训练的通用策略在可靠性达到更高水平之前,无法被部署为自主完成家务或投入工厂工作。 ## 我们曾见过类似的剧本 在语言模型的早期,我们恰好面临这个问题。像GPT-2或GPT-3这样的大型预训练模型虽然流畅、知识丰富,但完全不可靠。如果你问GPT-2“我该如何烤一整只鸡?”,可能会得到类似这样的回答: > 我在锅里烤一整只鸡。我在一个有盖子的锅里烤一整只鸡。我在一个有盖子的锅里烤一整只鸡。如果你不确定锅是什么,问问你的屠夫。有时候,当我烤肉时,我会用锅烤,这更像冰箱或冰柜,我用一个小冰柜、大冰柜或更大的冰柜烤。我为什么要怕鸡?因为它们太可爱了。——GPT-2 有时它回答了问题。有时它用三个问题续问你的问题。有时它会跑偏到一个它自己幻想出来的Reddit帖子中。虽然这可以构成有趣的对话,但并非可以部署应用的产物。 幸运的是,我们确切地知道这个问题是如何被解决的:后训练,特别是监督指令微调、基于人类反馈的强化学习,以及基于可验证奖励的强化学习,将“令人印象深刻的演示”变成了“实际可用的东西”。 更重要的是,该领域为后训练语言模型形成了一个共同的流程: 1. 从一个强大的预训练模型出发。 2. 定义环境和奖励,即可验证的奖励或学习到的偏好模型。 3. 使用特定族系的算法进行强化学习优化,并锚定在参考模型上。 4. 监控并解决已知的病态问题,如奖励欺骗。 有了这个具体的配方,任何想在下游任务上微调最新大语言模型的人都有了一条清晰的路径,每一步都有记录的失败模式和合理的默认设置。正是这一点使得大语言模型的后训练能够在大规模上变得可行。 机器人学正处在语言建模曾经的节点:预训练已经出色地扩展。我们已经拥有非常好的预训练策略——在海量数据上训练的视觉-语言-动作模型(VLA)和世界-动作模型(WAM)——它们能执行复杂行为。缺失的是另一半:模型从自身经验中学习,为此,我们需要一个后训练配方。而且对机器人学而言,它需要比大语言模型更可靠。一段由大语言模型生成的糟糕代码脚本,在投入生产前会被人类审核员捕获。而一个糟糕的机器人动作不会等待人类审核,它直接就发生了。 ## 那么,为何这尚未实现? 近期机器人领域的许多进步由模仿学习驱动,它几乎免费继承了监督学习的所有优点,使其在动作分块和良好遥操作接口等技术发展后变得如此简洁易用。损失函数不会因看似神秘的原因而爆炸;你知道对性能重要的少数几个超参数;损失曲线与性能相关。 强化学习在训练前沿机器人模型方面展现出巨大前景,但**它尚未成型为一个配方。它更像是一门手艺。** 让它工作需要大量直觉,就像一位好厨师凭感觉调味一样。在实践中,这意味着让强化学习后训练可靠地工作仅限于少数人能做到。大语言模型曾经也是如此,直到该领域形成了一个共同的配方。 为了让机器人能够大规模部署,我们认为它需要语言建模所拥有的东西:一个通用的后训练配方。 本文的剩余部分将讨论如何弥合这一差距、前沿机器人模型强化学习的现状、它为何不同于大语言模型的强化学习,以及将这门手艺转变为配方需要什么。 ## 配方所需的两要素 我们认为,从手艺到配方的跨越需要两样东西。 第一个是**一种专门为微调前沿机器人模型而构建的算法**,它在应用于数十亿参数的模型时保持稳定,并且能从足够少量的经验中学习,以便在真实的硬件上实用,因为在真实机器人上的每一次尝试都耗费宝贵的时间。 第二个更容易被忽视,但同样重要:**围绕该算法的一套标准实践**。定义何为成功的默认方式。在尝试之间重置场景的默认方式,以便机器人可以重试。人类提供反馈并将反馈转化为学习的默认方式。算法及其配套的流程,为将前沿机器人后训练扩展到规模定义了一套具体的默认值。 ## 为何机器人学是一个与大语言模型不同的强化学习问题? 但我们不是已经搞定了大规模强化学习吗?强化学习后训练推动了语言模型最近的大部分进步,在真实的规模和生产环境中。为什么机器人学的强化学习会有所不同? 要回答这个问题,不妨退一步看看深度强化学习最初立足之处。第一个获得广泛认可的深度强化学习系统之一是AlphaGo,它在2016年击败了围棋选手李世石。AlphaGo通过大量重复的自我对弈学习了一个策略,用于在给定局面下预测最优动作。这与语言模型的强化学习非常相似,后者使用大量并行文本生成来查看哪些响应获得高奖励。在这两种情况下,生成动作和验证动作的成本都很低,这是那种已经证明可扩展的强化学习的关键要素。 通过大规模并行模拟学习 每个方格是一整局围棋,从当前策略采样并在结束时即时评分 **288**局游戏并行进行 **0**局游戏完成评分 策略 **v0** 黑方胜 | 白方胜 策略在样本成本低廉的场景下进行策略梯度强化学习:并行生成数千局游戏,每局都由游戏规则免费验证,并且每次更新后,旧游戏被丢弃,新策略再玩一批新局。那种已经证明可扩展的强化学习类型是基于策略的策略梯度RL,它通过直接在奖励上进行爬山法学习,并且每次更新都需要新采样的数据。这对围棋和大语言模型来说没问题。机器人学是另一个故事,因为生成数据的成本要高得多。一个在现实世界学习叠衣服的机器人,无法在每个底层控制步骤尝试一千种不同的动作,尤其当单个任务可能串联成千上万的步骤时。虽然人们探索过模拟,但在模拟中精确建模真实物体往往比学习任务本身更难。因此,研究重点大量放在利用历史数据的能力上,例如来自策略学习过程中许多更新步骤之前的数据。 即使是一个简单的任务也可能需要做出500个决策 拿起一个杯子看起来像一个动作,但策略必须连续输出500个小的指令,而唯一的奖励在最后才出现 **500**个控制步骤 每20毫秒一个**7维**动作 奖励 **0** 正向指令 | 负向指令 一个简单操作任务的一个完整片段。策略在每个控制步骤(夹爪路径上的橙色点)输出一个新的动作,但成功只在第500步观察到。为了从那一个信号中学习,智能体必须推断出之前500个动作中哪些是关键因素。 除此之外,大语言模型强化学习和机器人学强化学习解决的是形态不同的问题。大语言模型的强化学习通常被框架化为生成一个**响应**,并为该响应分配一个奖励。机器人学则涉及为单个任务生成数百到数千个低级动作甚至更多。策略需要学习的奖励通常只在最后时刻出现,表明任务是否成功。此外,像语言或围棋这样的任务环境是确定性的,如果你生成一个动作,该动作就会被执行。在机器人学中,环境本身可以是随机的,这意味着即使向机器人发送两次完全相同的命令,也可能产生略微不同的结果。这意味着智能体必须跨越在时间跨度上累积的环境变化,将功劳归因于数千步之前采取的动作。 样本成本高昂和长时域结构的结合,推动该领域转向**基于价值函数的强化学习**:学习评分模型(价值函数)以在长时间跨度上分配功劳的方法。而基于价值函数的大规模强化学习,其验证程度远低于大语言模型大规模的强化学习后训练模式。 ## 为何我们不能直接使用现有的基于价值函数的强化学习方法? 在PPO(大语言模型后训练的主流方法)被开发出来的同一时期,另一条基于价值函数的方法路线,例如DDPG、TD3和SAC,也在机器人控制领域涌现,并且它们已被证明在现实任务上有效。但将它们直接应用于前沿机器人模型会遇到两个问题。 第一个问题是**这些模型如何表征其决策**。较早的算法假设策略从正态分布中抽取动作:一个平均动作加上其周围的一些噪声。当正确行为确实就是某一个动作加上一些噪声时,这种方法没问题。但现代机器人模型是为存在多种正确动作可能性的场景而构建的。例如,想象抓取杯子的任务,可以抓手柄或抓底座,两者都是正确的。为了考虑这一点,前沿机器人模型使用更丰富的机制,如**扩散模型**来生成动作(与图像生成使用的方法相同,尝试从噪声中生成样本),而不是简单的钟形曲线。较早的强化学习方法根本没有为这些模型构建。 第二个问题是**稳定性**。深度强化学习存在众所周知的不稳定性倾向,这在模型变得更大时尤其如此。基于价值函数的强化学习方法以一种特定的方式加剧了这一点:它们不仅从真实结果中学习,还通过预测自身的未来预测进行部分学习,并将这些预测重复用作真实值。这个过程中的微小误差会随着时间累积。当扩展到更大、能力更强的策略(如数十亿参数的VLA策略)时,这种稳定性会变得更糟。 (此处原文有一段缺失或表述不清,大意是:已经有人尝试将基于价值函数的学习应用于VLA等前沿机器人模型。一种方法是将学习信号通过模型的整个生成过程反向传播,但由于信号需要经过长链的去噪步骤,往往不稳定。第二种方法是完全不动模型,例如生成少量候选动作,并执行价值函数评分最高的那个。虽然安全,但这浪费了性能,因为模型本身从未真正学会哪些动作好、哪些不好。第三种选项是学习输入到模型的噪声,该噪声决定下游动作生成。你不触碰模型权重,而是用强化学习来搜索更好的输入噪声。这很有吸引力,因为风险低。无论选择什么噪声,结果仍然是模型已经知道如何生成的动作,因此更难产生不合理的结果。它在实践中也相当有效,因为搜索噪声比直接搜索动作容易得多。但这是有代价的。你只能重组模型已经具备的行为。如果机器人需要的技能不在基础模型预训练所学内容之中,再多的噪声搜索也无法生成该动作,机器人最终能变得多好以及改善速度,都受限于原始模型已有的知识。) 为了超越模型已知的范畴,学习过程需要以稳定的方式直接更新其权重,以便利用模型的全部能力来表征复杂、多样的行为。 ## 机器人学强化学习算法可能是什么样子? 一个算法要能良好地后训练前沿机器人模型,关键在于拥有一种稳定的方法来改进依赖现代生成技术(如扩散模型)的大型策略,同时利用动作好坏的估计值。**EXPO(-FT)** 是我们基于设想中该算法可能样貌而构建的系统,我们在真实机器人上进行了真实任务的测试:将一串节日灯穿过钩子并插入电源点亮它;将台球击入袋中;将一支花插入酒瓶口;煎蛋翻面。在开始时,前沿预训练模型无法可靠地完成这些任务。 EXPO(-FT) 的工作原理是通过强化学习,利用一个轻量级策略的小幅修改,学习如何反复改进来自前沿模型的动作,然后将改进吸收进前沿模型本身。为了在执行时获得最佳可能的动作,机器人从前沿模型生成少量候选动作,为每个动作生成一个经过编辑的、更高价值的版本,并使用价值函数估计每个候选动作的表现,然后选择最佳的一个。因为编辑被刻意保持微小,一次“推动”不会让机器人执行危险动作,并且所有强化学习的波动性都局限于小型模型。同时,因为预训练模型持续在那些被选中并奏效的动作上训练,编辑发现的改进会被吸收到基础模型本身。这意味着模型下次会提出更好的方案,让大型预训练模型能够运用其全部能力来学习新行为。 预训练模型动作 → 编辑策略动作 → 更高价值动作 → 编辑策略对基础模型的动作提出微小、有界的调整,将每个动作从其低价值区域“推动”向其自身模式的更高价值峰值(橙色点),而从不偏离基础模型已知的能力太远。 在整个在线学习过程中,一名人类监督机器人,并可以在其开始出错时随时干预。

相似文章

解密语言模型的强化学习后训练

arXiv cs.LG

本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。