人机自主团队中利用二阶心理理论同步信念(扩展版)

arXiv cs.AI 论文

摘要

本文将对偏好的奖励学习重新定义为人机自主团队问题,指出知道目标的教师能够设计出比学习者驱动的查询选择更高效的训练示例。文章引入了带有二阶心理理论的理解陈述,以保持教师对学习者模型的同步,并通过仿真表明该方法优于学习者主导的选择。

arXiv:2608.11229v1 公告类型:新 摘要:比较反馈——询问人们偏好两种行为中的哪一种——已成为在无法直接指定奖励时将机器人及智能体行为与人类意图对齐的标准方式。基于偏好的奖励学习通常将人类教师视为回答学习者所生成查询的被动神谕。我们认为这舍弃了教师的核心优势:对目标的了解。知道目标的教师能够比任何学习者驱动的获取策略更高效地构建训练示例,且这一优势随奖励特征维度的增长而扩大。然而,利用这一优势需要对学习者当前所知内容的准确模型。因此,我们将偏好学习重新定义为人机自主团队问题,耦合两种行为模型:教师维护学习者的模型以设计有信息量的课程,学习者维护教师模型的二阶模型,发出结构化的偏好约束(理解陈述),使教师的学习者模型保持同步。仿真表明,知情教师优于学习者主导的选择;交替教师下的教师模型漂移会削弱这一优势;而理解陈述可修复该优势,并且当教师对学习者的误差集中在特定方向而非均匀扩散时,二阶(ToM-2)陈述优于平均信念陈述。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:22

# 在人机自主团队中利用二阶心智理论同步信念
来源: https://arxiv.org/html/2608.11229

###### 摘要

比较式反馈——询问人们更偏好两种行为中的哪一种——已成为在无法直接指定奖励时,将机器人与智能体行为与人类意图对齐的标准方式。基于偏好的奖励学习通常将人类教师视为一个被动的预言机,负责回答学习者生成的查询。我们认为,这种做法放弃了教师最具决定性的优势:对目标(objective)的知晓。知道目标的教师能够比任何由学习者驱动的获取策略更高效地构造训练示例,这一优势会随着奖励的特征维度增长而扩大。然而,利用这一优势需要对学习者当前所知内容进行准确建模。因此,我们将偏好学习重新构建为一个耦合两种行为模型的人机自主团队(human-autonomy team)问题:教师维护一个关于学习者的模型,以设计信息丰富的课程;学习者维护一个关于教师模型的二阶模型,并发出结构化的偏好约束(*理解陈述*),使教师对学习者的模型保持同步。在仿真中,有信息的教师优于由学习者主导的选择;交替教师下的教师模型漂移会侵蚀这一优势;而理解陈述能够修复它,当教师对学习者的误差集中在某个特定方向而非均匀分散时,二阶(ToM-2)陈述优于均值信念陈述。

## I 引言

示范最优行为往往困难或不自然,因此机器人越来越多地转而从比较偏好反馈中学习奖励函数。在基于偏好的逆强化学习(IRL)中,人类被塑造成一个被动的预言机:学习者生成候选查询,人类对其进行标记[17 (https://arxiv.org/html/2608.11229#bib.bib1),3 (https://arxiv.org/html/2608.11229#bib.bib2)]。这种框架忽略了教学的定义性不对称:教师知道目标,而学习者不知道。我们不会要求学生只从自己提出的问题中学习;同样的教学法也适用于机器人奖励学习。让学习者驱动查询选择,会放弃教师最宝贵的资源:一条直达目标的路径。

这种放弃会带来维度上的代价。学习者只能探测当前不确定的方向;它无法瞄准尚未学习到的目标,而且随着特征空间的增长,盲目探测与目标对齐的机会越来越少。知道目标的教师会构造指向目标的示例,而且其瞄准能力不会随维度而退化。其结果是,教师引导的示例每一轮都有对齐优势,且该优势随着特征维度(从而随着机器人奖励的复杂度)而扩大(第V节 (https://arxiv.org/html/2608.11229#S5))。这一差距是*不知道*目标的属性,而非任何特定学习者启发式方法的属性;它约束着所有仅依赖信念的获取规则,无论是体积移除还是信息增益。

参见图1:ToM-2 学习者意识到教师对学习者的模型已经过时(气泡框):该模型未能反映学习者已经获得的知识。学习者发出一个理解陈述,即一个揭示该知识的偏好对,在下一轮查询之前修复教师的模型。然而,要使这种教师引导有效,教师需要掌握学习者当前所知内容的模型。当该模型准确时,每个查询都最大化信息量,既不冗余也不无法回答。当它发生漂移时,教师会给出学习者已经吸收的示例,维度优势随之被侵蚀。这种情况在多教师场景中尤其容易出现:每位教师的模型仅基于自己参与的那些轮次构建,因此一旦另一位教师接手,该模型就会立即变得过时,并且过时的方向正是那位教师所教的方向。考虑一个学习摆餐桌的家务机器人,由几位家庭成员在一周内分别教导,没有人在全程在场:一位在周一教盘子摆放,另一位在周中纠正银器摆放方式(图1)。这是一个典型的人机自主团队(HAT)问题[16 (https://arxiv.org/html/2608.11229#bib.bib15),1 (https://arxiv.org/html/2608.11229#bib.bib16)]:人与机器人共享一个目标,而教师对学习者的行为模型是决定团队绩效的变量。我们将多教师情形作为受控的漂移来源进行研究。

为了使这一模型保持同步,我们基于*理解陈述*(understanding statements)进行构建,这是一种二阶心智理论(ToM-2)机制,学习者通过它传递信息,修复教师对学习者所知内容的模型[6 (https://arxiv.org/html/2608.11229#bib.bib10),7 (https://arxiv.org/html/2608.11229#bib.bib9)]。我们将理解陈述重新应用于连续型基于偏好的奖励学习:学习者不是在枚举的特征集合上发出语言陈述,而是在教师用于教学的同一动作空间中发出一个偏好约束,并选择最能减少教师模型误差的那一个约束。我们进一步将该机制置于多教师环境中,在此情形下模型漂移源自交替教师之间的过时性,而非单一教师的偏差,并考察针对该误差的具体方向(ToM-2)是否比简单报告信念均值更有效。

我们贡献如下:

1. 1\. 偏好学习的人机自主团队形式化,其中教师对学习者的模型准确性是核心绩效变量(第III节 (https://arxiv.org/html/2608.11229#S3))。
2. 2\. 面向连续偏好学习的理解陈述公式化,其中陈述是教学动作空间中的一个偏好约束,并刻画了二阶(定向)陈述何时优于简单报告信念均值的一阶陈述,即当教师模型误差是各向异性时(第IV节 (https://arxiv.org/html/2608.11229#S4))。
3. 3\. 分析表明,教师引导的查询构造可实现每轮对齐 \(1/\sqrt{d}\),而 *任何* 仅依赖信念的获取规则(包括信息增益)只能达到 \(1/d\)([第V节](https://arxiv.org/html/2608.11229#S5))。
4. 4\. 多教师仿真研究,验证了教师的维度优势,并表明交替教师下的漂移会降低性能,而理解陈述可以修复该性能,其中二阶陈述优于均值信念陈述(第VI节 (https://arxiv.org/html/2608.11229#S6))。

## II 相关工作

#### 基于偏好的奖励学习

主动基于偏好的奖励学习将人类视为一个预言机,回答由学习者生成的、旨在去除信念体积的查询[17 (https://arxiv.org/html/2608.11229#bib.bib1)]或批量查询[3 (https://arxiv.org/html/2608.11229#bib.bib2)]。后来研究表明,体积移除可能产生退化查询;信息增益获取规则优于体积移除,并产生更简单的查询[4 (https://arxiv.org/html/2608.11229#bib.bib3)]。这些方法(包括 RLHF 系列[8 (https://arxiv.org/html/2608.11229#bib.bib4)])共享一个假设:人类不会引导课程。我们表明,这一假设放弃了教师每轮可获得的 \(\Theta(\sqrt{d})\) 对齐增益;教师知道目标并能针对目标进行构造。

#### 机器教学

机器教学研究目标已知的智能体如何选择示例,以驱动学习者趋向期望假设,其样本复杂度由教学维度决定[12 (https://arxiv.org/html/2608.11229#bib.bib5),19 (https://arxiv.org/html/2608.11229#bib.bib6)];在奖励学习中,算法选择的示范比自然选择的示范更快地识别目标奖励[5 (https://arxiv.org/html/2608.11229#bib.bib17)],机器人也通过选择对人类 IRL 具有信息量的示范来向人教授其策略,包括对当前信念的反事实推理[14 (https://arxiv.org/html/2608.11229#bib.bib18),15 (https://arxiv.org/html/2608.11229#bib.bib19)]。我们使用该框架来为*理解陈述*奠定基础:机器人学习者充当针对人类的机器教师,选择能最有效地将人类对学习者的模型推向学习者真实信念的偏好约束。此处的目标不是奖励,而是学习者自身的信念状态;运行选择的是学习者,而非人类。

#### 人机自主团队中的行为模型

协作型 IRL 将人类和机器人视为共同优化共享奖励的双方,人类可以教学而不只是示范[13 (https://arxiv.org/html/2608.11229#bib.bib7)],而可读性(legibility)使智能体的行为对其伙伴可解释[9 (https://arxiv.org/html/2608.11229#bib.bib8)]。在团队认知中,共享心智模型可预测协调性与绩效[1 (https://arxiv.org/html/2608.11229#bib.bib16)]。我们将教师对学习者的模型视为共享心智模型变量,并引入理解陈述作为一种低成本修复协议;这在 CIRL 基础上补充了一个从学习者到教师的信念同步通道。

#### HRI 中的心智理论

递归心理状态推断是动作理解[2 (https://arxiv.org/html/2608.11229#bib.bib11)]和教学推理的基础,其中教师和学习者相互建模[18 (https://arxiv.org/html/2608.11229#bib.bib12)]。I-POMDP 将这种嵌套信念建模形式化[10 (https://arxiv.org/html/2608.11229#bib.bib20)],并扩展为将沟通本身视为一种改变信念的行动,由决策论规划选择[11 (https://arxiv.org/html/2608.11229#bib.bib13)]。最直接的是,Callaghan 等人[6 (https://arxiv.org/html/2608.11229#bib.bib10),7 (https://arxiv.org/html/2608.11229#bib.bib9)]引入了*理解陈述*,通过它,一个 ToM-2 机器人学习者可以纠正人类教师对学习者所知内容的错误信念;人类研究发现,当教师受认知偏差影响时,理解陈述能引发更具信息量的教学。我们采用他们的机制,但在形式和场景上有所不同:我们的理解陈述是教师用于教学的同一动作空间中的偏好约束,而不是对枚举特征集的语言陈述;我们的教师模型误差源自交替教师之间的过时性,而非单一教师的认知偏差。

## III 问题描述

### III-A 从偏好中学习奖励

我们考虑线性奖励模型 \(r(\xi)=x\cdot\psi(\xi)\),其中 \(\psi(\xi)\in\mathbb{R}^{d}\) 是轨迹 \(\xi\) 的特征向量,\(x\in S^{d-1}\) 是单位超球面上的未知奖励权重向量。

一个偏好对 \((\xi_A,\xi_B)\) 诱导一个半空间约束:在无噪声情况下,教师偏好 \(\xi_A\) 当且仅当 \((\psi(\xi_A)-\psi(\xi_B))\cdot x\ge 0\),即 \(a\cdot x\ge 0\),其中 \(a=\Delta\psi/\|\Delta\psi\|\)。

学习者维护一个信念 \(\mathcal{B}_{t}=\{(x_i,w_i)\}_{i=1}^{N}\),其中 \(x_i\in S^{d-1}\),\(\sum_i w_i=1\),通过球冠粒子滤波更新。信念对齐为:

\[
\phi_{t}=\mathbb{E}_{x\sim\mathcal{B}_{t}}[x\cdot x^{*}]=\bar{x}_{t}\cdot x^{*},\quad \bar{x}_{t}=\textstyle\sum_i w_i x_i.
\tag{1}
\]

### III-B HAT 形式化

我们将教师建模为一个智能体,它拥有(i)真实奖励 \(x^{*}\) 的知识,(ii)一个显式的*学习者模型* \(\hat{\mathcal{B}}_{t}^{T}\)(教师对学习者当前信念的信念),以及(iii)一个课程策略,将 \(\hat{\mathcal{B}}_{t}^{T}\to(\xi_A,\xi_B)\)。

团队的共同目标是在固定的教学预算内最大化 \(\phi_{t}\)。我们研究的关键失败模式是*模型漂移*:当 \(\hat{\mathcal{B}}_{t}^{T}\) 与 \(\mathcal{B}_{t}\) 产生分歧时,教师会生成冗余约束,不增加任何信息,从而浪费教学预算。

### III-C 理解陈述

理解陈述是学习者传达给教师的一个约束,形式为“学习者的信念与 \(a\cdot x\ge 0\) 一致”,其中 \(a\in S^{d-1}\) 由算法选择。这不是自然语言;它是一对有序轨迹,选择用于最大程度地减少教师模型误差 \(D(\hat{\mathcal{B}}_{t}^{T}\|\mathcal{B}_{t})\)。这种机器教学行动与教师为学习者执行的行动是镜像的。

## IV 方法

### IV-A 查询构造

两种查询策略的分解方式相似:它们首先生成一组候选半空间方向,然后选择移除最多信念质量的那一个。对于约束 \(a\in S^{d-1}\),令 \(V(a)=\sum_{i:\,a\cdot x_i<0}w_i\) 为被移除的质量。每轮对齐更新满足

\[
\Delta\phi_{t}=\frac{V(a)}{1-V(a)}\,Q(a),\qquad Q(a)=\phi_{t}-\mu^{-}(a),
\tag{2}
\]

其中 \(\mu^{-}(a)=\frac{1}{V(a)}\sum_{i:\,a\cdot x_i<0}w_i(x_i\cdot x^{*})\) 是被移除粒子的对齐度。由于只要约束有效,\(x^{*}\) 就位于保留半空间中,因此 \(Q(a)\ge 0\),所以每次移除在期望上都是非负的,且 \(V(a)\) 是有效的选择分数。

#### 仅信念基线(EVR)

学习者引导条件选择最大化最坏情况下移除质量的均衡切分,仅使用自身信念:

\[
a_{\mathrm{EVR}}=\arg\max_{a\in S^{d-1}}\min\!\bigl(V(a),\,V(-a)\bigr).
\tag{3}
\]

这代表任何仅依赖信念的获取规则:它不能引用 \(x^{*}\),并且(第V节 (https://arxiv.org/html/2608.11229#S5))与信息增益和体积移除一样都受限于 \(\Theta(1/d)\) 的天花板。

#### 教师引导构造

教师知道 \(x^{*}\),这改变了选择目标。EVR 必须对冲两种预言机答案,因此采用 \(\min(V(a),V(-a))\) 的 max-min 形式;教师知道答案会将 \(x^{*}\) 置于保留半空间中,因此它直接最大化移除质量,

\[
a^{\star}=\arg\max_{a} V(a),
\tag{4}
\]

并基于其对学习者的模型 \(\hat{\mathcal{B}}_{t}^{T}\) 进行评分。这是相同的移除质量量,但摆脱了目标无关选择被迫采用的均衡切分约束。候选方向从指向 \(x^{*}\) 的反事实方向中抽取[15 (https://arxiv.org/html/2608.11229#bib.bib19)],\(a_k=(x^{*}-\mathrm{cf}_k)/\|x^{*}-\mathrm{cf}_k\|\),其中 \(\mathrm{cf}_k\sim\hat{\mathcal{B}}_{t}^{T}\),并辅以 top-\(M\) 协方差特征向量作为反事实采样在高维下退化时的下限(附录D (https://arxiv.org/html/2608.11229#A4))。

### IV-B ToM-2 理解陈述生成

理解陈述是一个偏好约束 \(a\cdot x\ge 0\),\(a\in S^{d-1}\),由学习者发出,并

相似文章

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。