入乡随俗:从异构智能体学习通用行为

arXiv cs.LG 论文

摘要

本文介绍了GRID,一种社会学习方法,通过将每个智能体的奖励函数分解为通用奖励和特定奖励,从异构智能体中提取通用行为,从而得到一个避免模式平均偏差的通用智能体。

arXiv:2606.18537v1 Announce Type: new 摘要:人类通常通过观察他人来获取新技能,因为观察到的行为隐式揭示了如何在环境中行动。然而,从异构群体中获得的观察会引入冲突的行为信号,使得难以判断哪些行为值得模仿。我们通过通用奖励推理与解耦(GRID)来应对这一挑战,这是一种社会学习方法,能够从追求不同目标的异构示范者群体中提取普遍有用的行为。GRID将每个智能体的奖励函数分解为通用奖励(捕捉所有智能体共享的行为)和特定奖励(捕捉个体偏好和目标)。仅基于通用奖励进行训练提供了一种通用预训练的新范式,得到一个内化环境通用能力(如安全和基本任务熟练度)的通用智能体,且避免了标准模仿学习技术中常见的模式平均偏差。该通用智能体可作为微调到下游任务的优越先验,包括训练中未出现的偏好。在合成基函数分解、多智能体Craftax和连续自动驾驶模拟器(Highway-Env)上的实验证实,GRID能够以语义有意义的方式成功解耦奖励结构,超越标准模仿学习基线,并实现更高效、更稳定的专业化。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:44

# 入乡随俗:从异质智能体中学习通用行为
来源:https://arxiv.org/html/2606.18537
Caleb Chang¹, Davin Win Kyi¹, Natasha Jaques∗¹, Karen Leung∗¹,² ¹华盛顿大学, ²NVIDIA *表示同等贡献。通信:[email protected]

###### 摘要

人类常常通过观察他人来习得新技能,因为观察到的行为隐式地揭示了如何在环境中行动。然而,从异质群体中获得的观察会引入冲突的行为信号,使得难以判断哪些行为值得模仿。我们通过**通用奖励推理与解耦(GRID)** 来应对这一挑战,这是一种社会学习方法,能够从追求不同目标的异质示范者群体中提取普遍有用的行为。GRID将每个智能体的奖励函数分解为一个通用奖励(捕捉所有智能体共享的行为)和多个特定奖励(捕捉个体偏好和目标)。仅基于通用奖励进行训练,提供了一种新的通才预训练范式,产生一个内化了普遍环境能力(如安全性和基本任务熟练度)的通才智能体,且没有标准示范学习技术中出现的模态平均偏差。该通才智能体作为微调到下游任务的优越先验,包括训练中未见过的偏好。在合成基函数分解、多智能体Craftax和连续自动驾驶模拟器(Highway-Env)上的实验证实,GRID能够以语义上有意义的方式成功解耦奖励结构,优于标准的示范学习基线,并实现更高效、更稳定的专业化。

## 1 引言

“入乡随俗”——但我们应该跟随**哪个**罗马人?观察到的个体行为隐式地揭示了如何在环境中行动,但并非所有智能体都遵循相同的目标,盲目模仿其中任何一个都可能是危险或适得其反的。想象一个机器人被放置在交通路口的拥挤人群中:不同的行人要去往不同的目的地,因此他们朝不同方向过马路——但所有人都尊重人行横道信号灯。机器人必须推断出,人行横道状态是相关的共享线索,而个体目的地及其追求这些目的地的行为则不是。或者考虑一个在建筑物中导航的机器人,那里沿着最短路径有一块湿滑的地板。人类会自然地避开这块区域,无论目的地是哪里都会选择更长的路线。一个智能智能体不需要知道任何个体的目标就能提取有价值的信息:回避行为是所有智能体共有的。通过识别每个智能体持续执行的行为,独立于其个体目标,学习智能体可以推断出哪些行为是普遍重要的,并将这些行为据为己用。

挑战在于从异质群体中提取这些共享信号。标准的示范学习(LfD)容易受到潜在冲突的多模态示范的影响,需要额外的机制来处理变化 [31 (https://arxiv.org/html/2606.18537#bib.bib896)]。逆强化学习(IRL)是LfD的一个子集,它恢复一个未知的奖励函数。当群体追求异质目标时,标准IRL算法倾向于将冲突的目标平均在一起,产生一个无法有效完成任何特定任务的次优策略 [20 (https://arxiv.org/html/2606.18537#bib.bib902)]。强化学习(RL)通过从已知奖励函数的环境反馈中直接学习来规避这个问题 [32 (https://arxiv.org/html/2606.18537#bib.bib919)]。然而,RL通常样本效率低下且对环境变化脆弱,导致泛化能力差。简而言之,RL和标准LfD都不能很好地处理从追求不同未知目标的多样的智能体群体中学习,尽管这些智能体可能揭示非常有价值的信息。

这引出了一个基本问题:*代理应该从这样一个群体中学到什么?* 我们认为最有价值的信号是那些*在智能体之间共享的*信号——这些行为之所以普遍,正是因为它们反映了通用能力、安全性和环境规范,而不是任何个体的特定目标。所有行人无论目的地在哪都会遵守人行横道信号。所有熟练的驾驶员无论前往何处都会保持安全的跟车距离。所有导航器无论目标在哪都会避开湿滑地板。这些共享行为是值得采纳的“罗马习俗”——任何有能力的智能体都会隐式遵循的环境通用规范。

社会学习是RL和IRL的结合,朝这个方向迈出了一步。在这个框架中,一个智能体通过观察环境中的其他智能体来推断相关的环境信息和目标,并利用这些知识通过自身与环境的交互经验来指导自己的行为。先前的工作 [8 (https://arxiv.org/html/2606.18537#bib.bib897), 2 (https://arxiv.org/html/2606.18537#bib.bib895)] 明确地将环境的共享特征与智能体特定目标解耦,但并没有分离出一个代表普遍期望行为的共享奖励信号。据我们所知,现有工作没有明确地将异质智能体的底层奖励分解为普遍共享的能力和个体偏好。我们通过**通用奖励推理与解耦(GRID)** 来弥补这一空白。

参见图注
图1:**通用奖励推理与解耦(GRID)** 是一种社会学习方法,从追求不同目标的异质示范者群体中提取普遍有用的行为。学习到的通用行为可用于训练通才智能体,随后可针对新任务进行微调。GRID采用一种新颖的深度学习架构,使用信息论目标同时捕捉个体特定行为和智能体之间共有的通用行为。具体来说,我们假设通过RL环境或IRL获得的个体奖励函数能够表达个体行为。然后,我们将每个奖励函数分解为通用奖励和个体特定奖励之和。通用奖励捕捉普遍共享的结构,即每个有能力的智能体无论其个人目标都会执行的行为。基于此通用奖励进行RL训练,得到一个内化了所观察群体环境规范的通才智能体。关键在于,这个智能体作为下游适应的强大先验,因为它已经知道该做什么和避免什么,并且可以比从头训练更高效地针对任何特定任务进行微调。与传统的专家智能体必须为每个新目标从头学习基本物理和安全约束不同,我们的通才智能体已经知道如何在环境中安全操作,并且可以高效地微调到特定任务。

**贡献声明。** (1) 我们介绍了GRID架构及其信息论训练目标,该目标联合解耦了通用和特定奖励结构。(2) 我们通过跨合成域和多智能体域的奖励分解的可解释可视化,提供了通用与特定奖励结构的直觉,并确认了与真实奖励组件的语义对齐。(3) 我们证明了GRID通才智能体在广泛适用的能力和对未见任务的微调上优于模态平均LfD和RL基线。(4) 我们通过消融研究验证了架构设计选择。

## 2 相关工作

GRID处于三个研究目标的交汇点:从异质示范中学习、奖励分解、以及通才预训练。

**从异质示范中学习。** 标准LfD方法 [33 (https://arxiv.org/html/2606.18537#bib.bib914), 26 (https://arxiv.org/html/2606.18537#bib.bib263), 1 (https://arxiv.org/html/2606.18537#bib.bib28), 37 (https://arxiv.org/html/2606.18537#bib.bib29), 23 (https://arxiv.org/html/2606.18537#bib.bib513)] 和强大的生成方法 [11 (https://arxiv.org/html/2606.18537#bib.bib531), 10 (https://arxiv.org/html/2606.18537#bib.bib913)] 共享一个共同的假设:所有示范来自一个一致的示范者。然而,在大型数据集和现实世界中,示范通常是异质的,反映了不同示范者之间的技能、偏好和目标的差异。后续工作通过互信息最大化 [16 (https://arxiv.org/html/2606.18537#bib.bib900), 36 (https://arxiv.org/html/2606.18537#bib.bib373), 29 (https://arxiv.org/html/2606.18537#bib.bib915), 20 (https://arxiv.org/html/2606.18537#bib.bib902)] 来处理异质性,而其他工作则使用CVAEs和变分推理进行自动驾驶应用中的多模态人类行为建模 [27 (https://arxiv.org/html/2606.18537#bib.bib934), 12 (https://arxiv.org/html/2606.18537#bib.bib937), 25 (https://arxiv.org/html/2606.18537#bib.bib975)]。然而,所有这些方法都将异质性视为建模目标——目的是解释示范者之间的差异。相比之下,我们的方法明确地解释了示范者之间的共享共性。

**奖励分解。** GRID对结构化奖励分解日益增长的兴趣做出了贡献。van Seijen等人 [34 (https://arxiv.org/html/2606.18537#bib.bib917)] 手动将总奖励分解为独立的任务组件,并为每个组件训练一个专用的智能体,但分解完全是手工设计的,且不跨智能体泛化。Arjona-Medina等人 [3 (https://arxiv.org/html/2606.18537#bib.bib918)] 通过沿轨迹的相关状态-动作对重新分配奖励,解决了时间信用分配中的延迟奖励问题。Juozapaitis等人 [14 (https://arxiv.org/html/2606.18537#bib.bib920)] 将奖励分解为可解释的子组件以提高透明度,但也是手动完成的,且没有建模智能体异质性。GRID统一了这些线索:分解是学习的,无需手动奖励工程,具有语义性(通用 vs. 特定),并且直接支持可解释性和下游专业化。

**通才预训练与专业化。** 预训练通才模型并使其适应特定下游任务的范式已成为现代机器学习和机器人学的核心 [19 (https://arxiv.org/html/2606.18537#bib.bib933)]。Jaques等人 [13 (https://arxiv.org/html/2606.18537#bib.bib922)] 引入了KL控制微调以防止预训练先验的灾难性遗忘,该技术后来被用于将LLM与人类偏好对齐 [18 (https://arxiv.org/html/2606.18537#bib.bib923)]。Finn等人 [9 (https://arxiv.org/html/2606.18537#bib.bib387)] 学习参数初始化以实现快速适应,Rakelly等人 [22 (https://arxiv.org/html/2606.18537#bib.bib924)] 通过推理潜在任务表示将其扩展到测试时无任务标签的情况。相比之下,GRID通过奖励结构实例化了这一范式:通才智能体在共享的通用奖励上训练,专业化包括在编码个体偏好的特定奖励上进行微调。这使先验扎根于语义上有意义的分解中,使泛化的来源透明,适应目标明确。

**社会学习与后继特征。** 社会学习,即通过观察共享环境中的其他个体来获取行为,部分基于这样一个认识:同一环境中的智能体共享底层动态和规范。Ndousse等人 [17 (https://arxiv.org/html/2606.18537#bib.bib931)] 表明社会学习可以导致对新环境更好的泛化,最近的工作尝试使用后继特征(SFs)[4 (https://arxiv.org/html/2606.18537#bib.bib899)] 来增强社会学习 [8 (https://arxiv.org/html/2606.18537#bib.bib897), 2 (https://arxiv.org/html/2606.18537#bib.bib895)],这基于将SFs作为分解动态和奖励的方法的工作 [6 (https://arxiv.org/html/2606.18537#bib.bib921), 24 (https://arxiv.org/html/2606.18537#bib.bib925)]。虽然后继特征方法很优雅,但在实践中,如果不先验地知道共享特征表示,它们可能难以优化,或许因此未被广泛采用。此外,它们对共享表示的格式做出了限制性假设。

## 3 预备知识

**马尔可夫决策过程。** 环境被建模为马尔可夫决策过程(MDP),记为 ⟨S, A, R, T, γ⟩。S 表示状态空间,A 表示动作空间。T: S × A × S → [0,1] 是转移函数,表示从当前状态 s 通过动作 a 进入下一状态 s′ 的概率。R(s,a) 是从状态 s 采取动作 a 获得的奖励信号,智能体在轨迹 τ = ⟨s₀, a₀, ..., sₜ, aₜ⟩ 上的总折扣奖励为 R(τ) = ∑_{t=0}^T γ^t R(sₜ, aₜ),其中 γ ∈ [0,1) 是折扣因子。

**强化学习与逆强化学习。** RL的目标是学习一个最大化期望未来累积奖励的最优策略 π*: S → A:π* = argmax_π E_{τ∼π} R(τ)。RL假设可以访问奖励函数 R。相比之下,IRL在一个缺少R的MDP中操作,并接收一个由 N 条示范组成的集合 D = {τ₁, ..., τₙ}。其目标是恢复能够解释所观察行为的底层奖励函数 R。在我们的问题设置中,我们观察到一个在环境中行动的 P 个示范者群体。每个示范者 p 根据奖励函数 R^(p) 行动,该函数反映了其个人目标、偏好以及共享的通用奖励。我们假设通过RL环境或IRL可以访问 R^(p)。

## 4 通用奖励推理与解耦

我们介绍GRID框架(图 [1 (https://arxiv.org/html/2606.18537#S1.F1)])及其架构(图 2 (https://arxiv.org/html/2606.18537#S4.F2))。GRID通过提取在环境中行动的异质示范者群体间共享的奖励信号来训练通才智能体。首先,我们从周围的示范者构建 (智能体ID, 状态, 动作, 奖励) 或 (p, s, a, R^(p)) 的元组数据集。其次,GRID将 R^(p) 解耦为通用奖励 R_g(s,a) 和特定奖励 R_s(s,a, ω^(p)),其中后者捕捉个体智能体的偏好。基于 R_g 优化策略得到一个通才智能体。第三,通才智能体通过微调任务特定奖励来适应新任务。

### 4.1 数据集要求

有效的解耦依赖于一个覆盖引发通用行为的共享环境上下文以及区分不同智能体的个体特定上下文的 (p, s, a, R^(p)) 元组数据集。如果没有跨示范者足够的状态-动作覆盖,GRID可能无法...

相似文章

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。

面向交互式游戏的可教练代理

arXiv cs.AI

本文提出一个训练强化学习代理的框架,使其能在实时接受指导的同时,在执行核心任务时采用不同风格,并在《地平线:西之绝境》、《GT赛车》和一个人形行走领域进行了演示。

学习合作、竞争和沟通

OpenAI Blog

OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。

奖励作为具身世界模型的智能体

arXiv cs.AI

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。