@dair_ai: // 自对弈加上一点人类数据 // 结合人类演示和自对弈强化学习的超酷论文。30分钟…

X AI KOLs Following 论文

摘要

一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。

// 自对弈加上一点人类数据 // 结合人类演示和自对弈强化学习的超酷论文。 30分钟的人类数据,比模仿学习少2500倍,足以让自对弈策略与真实人类协调。 纯自对弈能学到高效但人类无法驾驶的陌生规则。通常的解决方法是脆弱的奖励工程和领域随机化。 而这项工作则将一小部分人类演示作为正则化目标,叠加在最小安全到达目标奖励之上。 为什么重要? 得到的策略能与保留的人类轨迹协调,并在单个消费级GPU上15小时完成训练。这一经验远不止适用于驾驶。一个小的演示正则化器可能是我们自对弈中最便宜的对齐手段。 论文:https://arxiv.org/abs/2606.19370 在我们的学院学习构建有效的AI智能体:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/06/22 07:33

// 自我博弈配上一小撮人类数据 //

一篇非常酷的论文,结合了人类演示和自博弈强化学习。

仅需30分钟的人类数据(比模仿学习少2500倍),就足以让自我博弈策略与真实人类进行协调。

纯自我博弈学习到了有效但非人类习惯的惯例,人类无法与之并驾齐驱。通常的解决方法是脆弱且耗时的奖励工程和领域随机化。

而这项工作则将一小部分人类演示视为一种正则化目标,附加在一个最小的安全到达目标奖励之上。

为什么这很重要?

由此产生的策略能够与留出的人类轨迹协调,并在单个消费级GPU上于15小时内完成训练。这一经验远不止于驾驶领域。一个小型演示正则化器可能是我们针对自我博弈最便宜的(行为)对齐旋钮。

论文: https://arxiv.org/abs/2606.19370

在我们的学院中学习构建有效的人工智能智能体: https://academy.dair.ai


人类类自主体从自我博弈和一撮人类数据中涌现

来源: https://arxiv.org/html/2606.19370 Daphne Cornelisse1 & Julian Hunt2 & Zixu Zhang3 & Waël Doulazmi4,5 & Kevin Joseph2 & Jaime Fernández Fisac3 & Eugene Vinitsky1

1纽约大学坦登工程学院 2纽约大学库朗数学科学研究所 3普林斯顿大学 4巴黎高等矿业学院机器人中心 5易立信

摘要

自我博弈强化学习最近成为一种无需任何人类数据即可训练驾驶策略的方法。它利用廉价的大规模模拟来替代昂贵的大规模人类驾驶演示。这种方法的一个关键局限性是,通过纯自我博弈训练的策略可能学习到有效但非人类习惯的驾驶惯例,与人类不相容。先前的工作试图通过广泛的奖励工程和领域随机化来缓解此类行为失调,这些方法既脆弱又耗时。与完全放弃人类演示不同,我们的方法将人类演示视为一种正则化目标,附加在一个最小的安全到达目标奖励之上。就像好炖菜里的调料一样,我们发现一点点人类数据就能产生巨大效果:我们的方法仅使用30分钟的人类演示,比同等规模的模仿学习方法少2500倍。由此产生的策略能够与留出的人类轨迹协调,并在单个消费级GPU上于15小时内完成训练。视频和完整源代码可在 https://spiced-self-play.com/ 获取。

关键词: 自我博弈强化学习, 模仿学习, 自动驾驶

1 引言

[无标题图片]自我博弈强化学习(RL)已在策略游戏[1 (https://arxiv.org/html/2606.19370#bib.bib1),2 (https://arxiv.org/html/2606.19370#bib.bib2),3 (https://arxiv.org/html/2606.19370#bib.bib3)]中产生了超人级别的智能体,并且最近在现实世界领域(如自动驾驶)显示出潜力[4 (https://arxiv.org/html/2606.19370#bib.bib4),5 (https://arxiv.org/html/2606.19370#bib.bib5),6 (https://arxiv.org/html/2606.19370#bib.bib6),7 (https://arxiv.org/html/2606.19370#bib.bib7)]。该方法巧妙地规避了多智能体学习中的一个核心困难——如何对对手建模——通过以下思路:智能体的对手是其自身的副本。其吸引力在于,随着智能体的改进,其协作者也随之改进。这就产生了一个自动演进的课程[8 (https://arxiv.org/html/2606.19370#bib.bib8)],将策略从随机行为逐步提升到熟练技能,完全通过合成模拟经验实现。

在零和博弈中,这种机制加上一个稀疏的成功度量(例如,在国际象棋中获胜得+1分),足以产生对抗任意对手的强力表现。然而,许多现实世界环境并非零和。例如,驾驶可以被视为一种混合动机游戏:每个玩家都有个体目标(安全到达目的地),但也必须通过遵守共同的规范、期望和惯例来与其他道路使用者协调。仅具有高层成功目标的自我博弈RL无法保证这种对齐;策略可能收敛到有效但“非人类”的策略,这些策略与人类伙伴不相容[9 (https://arxiv.org/html/2606.19370#bib.bib9)]。具体来说,一个被训练为“安全到达目的地”的智能体很可能学会以倒车、侧向或逆行等方式到达目的地,如果这些约束未在奖励中指定的话。

看图注图1: 加香自我博弈RL从30分钟人类数据和60年模拟经验中实现类人类协调。左图: 针对人类驾驶数据的安全任务完成率(任务完成率减去有责碰撞率),使用人类重放代理进行评估。使用约30分钟人类驾驶数据作为行为锚(我们的方法: 0.994),优于无正则化的自我博弈(0.979)和基于完整Waymo数据集训练的 IL 方法 SMART-tiny CLSFT[10 (https://arxiv.org/html/2606.19370#bib.bib10)](0.830)。米色箭头显示相对于每个基线的改进。中图: 每种方法使用的总训练转换次数。两种自我博弈变体消耗了200亿次转换(约63年,以10 Hz计)的廉价合成经验;SMART使用了4500万到2.25亿次人类记录转换(约52天到7个月;见附录E (https://arxiv.org/html/2606.19370#A5))。右图: 示例运行(见视频 (https://spiced-self-play.com/))。自我博弈策略()驾驶激进,穿梭于空隙;正则化策略()耐心等待其他智能体。深蓝色车辆是受控智能体,以绿色目标目的地为目标。灰色智能体跟随日志重放。先前的工作通过两种方式解决了这种失调。一条工作线涉及手动奖励工程,即迭代添加奖励项,直到所需的策略和惯例出现[5 (https://arxiv.org/html/2606.19370#bib.bib5),11 (https://arxiv.org/html/2606.19370#bib.bib11)]。虽然有效,但这种策略本质上是劳动密集型的、特定领域的,并且脆弱,因为要弄清楚什么奖励会产生所需的类人类行为并非易事[12 (https://arxiv.org/html/2606.19370#bib.bib12)]。一个例子是 GIGAFLOW[5 (https://arxiv.org/html/2606.19370#bib.bib5)],它需要九个单独调整的奖励项以及若干领域随机化技术来产生自然和谨慎的驾驶策略。在光谱的另一端,我们有模仿学习[13 (https://arxiv.org/html/2606.19370#bib.bib13),14 (https://arxiv.org/html/2606.19370#bib.bib14),15 (https://arxiv.org/html/2606.19370#bib.bib15),IL]。在IL中,策略被优化为直接模仿人类驾驶数据,从而完全避免了定义奖励函数的需要。然而,鲁棒性需要广泛的状态覆盖,因此这些方法通常需要大量的人类演示[16 (https://arxiv.org/html/2606.19370#bib.bib16)]。

我们采取了一种不同的方法,基于一个关于经验生成成本结构变化的实际观察。现代RL框架和模拟基础设施可以在单个消费级GPU上每秒生成30万到2000万个环境步骤[17 (https://arxiv.org/html/2606.19370#bib.bib17),18 (https://arxiv.org/html/2606.19370#bib.bib18)],使得合成经验生成几乎无限。相比之下,人类驾驶数据需要手动收集,并且扩展缓慢。这暗示了人类数据在协作游戏中的自然角色:不是作为训练信号的主要来源,而是作为一个轻量级的锚,引导策略远离有效但行为异常的策略。事实上,将自我博弈RL正则化到这样一个锚上,已在《外交》[19 (https://arxiv.org/html/2606.19370#bib.bib19),20 (https://arxiv.org/html/2606.19370#bib.bib20)]和驾驶[21 (https://arxiv.org/html/2606.19370#bib.bib21),22 (https://arxiv.org/html/2606.19370#bib.bib22),7 (https://arxiv.org/html/2606.19370#bib.bib7)]中显示出产生人类兼容智能体的前景,然而,达到人类兼容所需的数据量,据我们所知,尚未被检验。

我们对此进行了测量。将自我博弈RL锚定到来自Waymo开放运动数据集[23 (https://arxiv.org/html/2606.19370#bib.bib23),WOMD]的人类驾驶数据,我们发现令人惊讶的少量演示数据就能改善与人类代理的协作。配上约60年的自我博弈经验,30分钟的人类驾驶数据(完整WOMD训练集的0.04%)带来了显著的改进,而无需任何奖励工程或领域随机化。这种效果类似于文献中已有的一个类比:有充分证据表明,注入一小部分有害数据会导致模型灾难性退化,这一现象被称为数据投毒[24 (https://arxiv.org/html/2606.19370#bib.bib24),25 (https://arxiv.org/html/2606.19370#bib.bib25),26 (https://arxiv.org/html/2606.19370#bib.bib26)]。据我们所知,我们是第一个在自我博弈RL中报告相反方向类似效果的;一小部分有益数据不成比例地改善了行为。就像一小撮辣椒粉能改变整道菜的味道一样,少量人类数据似乎能够改变自我博弈策略的行为。反映这种效果,我们称之为数据加香,并将我们的方法命名为加香自我博弈。

具体来说,我们在一个稀疏的奖励(用于安全到达目标)下训练一个PPO策略[27 (https://arxiv.org/html/2606.19370#bib.bib27)],同时将其正则化到一个行为克隆锚上,该锚拟合了少量人类驾驶数据。我们观察到:

  • •30分钟到3小时的人类驾驶数据,结合大规模的自我博弈,足以在不进行奖励工程或领域随机化的情况下改善与人类代理的协作(图1 (https://arxiv.org/html/2606.19370#S1.F1);第4.1 (https://arxiv.org/html/2606.19370#S4.SS1) 和 4.3 (https://arxiv.org/html/2606.19370#S4.SS3) 节)。
  • •加香策略不仅碰撞率更低,而且在分布现实性[28 (https://arxiv.org/html/2606.19370#bib.bib28)]和碰撞严重性分布[29 (https://arxiv.org/html/2606.19370#bib.bib29)]方面表现出更类人类的行为(第4.2 (https://arxiv.org/html/2606.19370#S4.SS2) 节)。
  • •为了便于复现和基于当前结果进行扩展,我们开源了完整代码库。策略可以在单个消费级GPU上于15小时内进行端到端训练。

2 相关工作

自动驾驶的模仿学习。

驾驶策略的生成是端到端自动驾驶[30 (https://arxiv.org/html/2606.19370#bib.bib30),31 (https://arxiv.org/html/2606.19370#bib.bib31),32 (https://arxiv.org/html/2606.19370#bib.bib32),33 (https://arxiv.org/html/2606.19370#bib.bib33)]、多智能体轨迹预测[34 (https://arxiv.org/html/2606.19370#bib.bib34)]和反应式交通模拟[28 (https://arxiv.org/html/2606.19370#bib.bib28),35 (https://arxiv.org/html/2606.19370#bib.bib35)]中的一个基本挑战。受大规模人类驾驶数据集广泛可用性的驱动[36 (https://arxiv.org/html/2606.19370#bib.bib36),23 (https://arxiv.org/html/2606.19370#bib.bib23),37 (https://arxiv.org/html/2606.19370#bib.bib37)],模仿学习已成为所有这些领域的主导方法[38 (https://arxiv.org/html/2606.19370#bib.bib38)]。在这种模仿学习范式下,涌现了广泛应用的方法来拟合历史数据,从边际[39 (https://arxiv.org/html/2606.19370#bib.bib39),40 (https://arxiv.org/html/2606.19370#bib.bib40),41 (https://arxiv.org/html/2606.19370#bib.bib41)]和联合[42 (https://arxiv.org/html/2606.19370#bib.bib42),43 (https://arxiv.org/html/2606.19370#bib.bib43),44 (https://arxiv.org/html/2606.19370#bib.bib44),45 (https://arxiv.org/html/2606.19370#bib.bib45)]预测,到标记化轨迹的自回归序列建模[46 (https://arxiv.org/html/2606.19370#bib.bib46),15 (https://arxiv.org/html/2606.19370#bib.bib15),10 (https://arxiv.org/html/2606.19370#bib.bib10)],以及通过扩散和可提示世界模型的连续分布学习[47 (https://arxiv.org/html/2606.19370#bib.bib47),48 (https://arxiv.org/html/2606.19370#bib.bib48),49 (https://arxiv.org/html/2606.19370#bib.bib49),50 (https://arxiv.org/html/2606.19370#bib.bib50),51 (https://arxiv.org/html/2606.19370#bib.bib51)]。虽然这些生成方法产生了多样化的开环行为,但它们从根本上受到所需人类数据规模的约束,并且经常在闭环部署中遭受累积协变量偏移[16 (https://arxiv.org/html/2606.19370#bib.bib16)]。为了缓解这些偏移,最近的混合方法整合了强化学习[52 (https://arxiv.org/html/2606.19370#bib.bib52),53 (https://arxiv.org/html/2606.19370#bib.bib53),54 (https://arxiv.org/html/2606.19370#bib.bib54)],然而它们通常仍依赖大量人类驾驶数据作为主要的优化信号。我们的方法系统地颠倒了这种平衡:我们不是依赖人类驾驶数据作为核心监督,而是利用合成的多智能体RL自我博弈作为发现鲁棒交互行为的主要引擎,仅保留一个非常小的人类数据集作为行为锚,以确保符合现实的交通规范。

博弈中的自我博弈强化学习。

自我博弈强化学习在从围棋和国际象棋[1 (https://arxiv.org/html/2606.19370#bib.bib1),55 (https://arxiv.org/html/2606.19370#bib.bib55)]到《星际争霸II》[56 (https://arxiv.org/html/2606.19370#bib.bib56)]和《战略》[2 (https://arxiv.org/html/2606.19370#bib.bib2)]的游戏中产生了超人级别的智能体,且无需人类数据。然而,超人级的玩法并不等同于人类兼容的玩法。许多游戏存在多个均衡点,自我博弈不必收敛到与人类伙伴兼容的均衡点[9 (https://arxiv.org/html/2606.19370#bib.bib9),57 (https://arxiv.org/html/2606.19370#bib.bib57)]。这种失败已在诸如《花火》[58 (https://arxiv.org/html/2606.19370#bib.bib58)]和《外交》[9 (https://arxiv.org/html/2606.19370#bib.bib9)]等合作游戏中得到证实,其中自我博弈智能体发展了内部一致的惯例,但难以迁移到人类伙伴。原因是奖励的欠指定:当奖励被定义为最大化的分数时,通常有多种实现方式。换句话说,解空间很大。先前的工作试图通过手工设计奖励来解决这个问题[5 (https://arxiv.org/html/2606.19370#bib.bib5),11 (https://arxiv.org/html/2606.19370#bib.bib11)]。例如,GIGAFLOW[5 (https://arxiv.org/html/2606.19370#bib.bib5)]展示了奖励工程和领域随机化可在规模上产生自然行为,代价是九个单独调整的奖励项。我们完全避免了奖励工程。少量人类数据即可作为行为锚,而自我博弈完成其余工作。这将一个劳动密集型的设计问题简化为一个小时的收集流程。

人类正则化的自我博弈强化学习与搜索。

奖励工程的一种替代方案是将自我博弈正则化到一个人工锚策略上。这个想法已在《外交》中得到探索,其中在搜索和学习过程中对人工先验进行KL正则化,产生了与人类伙伴更有效协作的智能体[19 (https://arxiv.org/html/2606.19370#bib.bib19),20 (https://arxiv.org/html/2606.19370#bib.bib20)]。Jacob et al. [59 (https://arxiv.or

相似文章

@dair_ai: https://x.com/dair_ai/status/2053495521243799717

X AI KOLs Following

DAIR AI 的每周精选汇总了多项重磅研究论文,包括通过内化并行推理提升模型性能的 HeavySkill,以及利用强化学习优化智能体编排的 Sakana AI Conductor。此外,还涵盖了 Meta FAIR 关于自我改进预训练的研究工作。