反馈归因与表示几何:用于比较多智能体强化学习中个体与共享奖励的度量
摘要
本文提出 EffRank/n 和 D_act 作为低开销诊断指标,用于衡量协同多智能体强化学习中奖励归因的效果,并在 SMACv2 上进行测试,发现观测解释了几何结构,而奖励归因主要影响行为。
arXiv:2607.16524v1 公告类型:新
摘要:协同多智能体强化学习系统通常使用团队平均奖励,这是一种反馈归因选择,即无论个体贡献如何,每个智能体都获得团队结果。我们探究这是否会在学习到的表示上留下可测量的几何或行为特征。我们提出 EffRank/$n$(按智能体数量归一化的有效秩)和 $D_\text{act}$(智能体动作分布之间的平均成对KL散度)作为奖励归因效应的低开销诊断指标,然后在 SMACv2 \texttt{protoss\_5\_vs\_5} 中对有能力的MAPPO智能体进行测试,其中单位类型编码在观测中。在观测 $\times$ 奖励归因比较(单位类型可见 vs. 遮蔽;个体伤害贡献奖励 vs. 共享团队奖励)中,几何结构遵循观测而非奖励。当单位类型可见时,共享和个体奖励的 EffRank/$n$ 相似($0.31{\pm}0.03$ vs. $0.29{\pm}0.02$),探测准确率也相似($0.75{\pm}0.05$ vs. $0.73{\pm}0.05$,两者均 $\gg 1/3$ 概率),而 $D_\text{act}$ 在个体奖励下更高($1.23{\pm}0.06$ vs. $1.07{\pm}0.20$)。遮蔽单位类型将使高于概率的探测信号削减一半以上,在两个奖励分支中均降至 $0.49$。简而言之:个体奖励的智能体具有能力且可按角色区分,但在 SMACv2 上,观测解释了几何结构,而奖励归因主要体现在行为上。因此,几何诊断必须控制观测到的角色信息,并测试未直接观测到的持久角色。EffRank/$n$ 和 $D_\text{act}$ 仅增加 $<$5% 的开销。
查看缓存全文
缓存时间: 2026/07/21 06:49
# 多智能体强化学习中个体奖励与共享奖励比较的度量指标
来源:https://arxiv.org/html/2607.16524
## 反馈归因与表征几何:比较多智能体强化学习中个体与共享奖励的度量指标
###### 摘要
协作式多智能体强化学习系统通常使用团队平均奖励,这是一种反馈归因选择,即无论每个智能体的个体贡献如何,都给予其团队结果。我们探究这是否会在学习到的表征上留下可测量的特征,无论是几何特征还是行为特征。我们提出了 EffRank/\(n\)(按智能体数量归一化的有效秩)和 \(D_{\text{act}}\)(智能体动作分布间的平均成对 KL 散度)作为低开销的归因效应诊断工具,并在 SMACv2 的 protoss_5_vs_5 任务中对胜任的 MAPPO 智能体进行了测试,其中单位类型编码在观测中。在一个观测\(\times\)奖励归因比较(单位类型被观测与被遮蔽;个体伤害贡献奖励与共享团队奖励)中,几何特征跟随观测而非奖励。当单位类型被观测时,共享奖励下的 EffRank/\(n\) 与个体奖励下的相似(\(0.31\pm0.03\) 对比 \(0.29\pm0.02\)),探针准确率也相近(\(0.75\pm0.05\) 对比 \(0.73\pm0.05\),两者均远高于随机概率 \(1/3\)),而个体奖励下的 \(D_{\text{act}}\) 倾向于更高(\(1.23\pm0.06\) 对比 \(1.07\pm0.20\))。遮蔽单位类型将高于随机水平的探针信号削减了一半以上,两个奖励分支均降至 \(0.49\)。简而言之:获得个体奖励的智能体是胜任的,且可按角色区分,但在 SMACv2 中,观测解释了几何特征,而奖励归因主要影响行为。因此,几何诊断必须控制观测到的角色信息,并测试未被直接观测的持久角色。EffRank/\(n\) 和 \(D_{\text{act}}\) 带来的额外开销小于 5%。
关键词:多智能体强化学习,环境反馈,信用分配,表征几何,评估指标,嵌入有效秩
![[未附图注的图片]](https://arxiv.org/html/2607.16524v1/figures/teaser_geometry.png)
图1:角色可分离的几何特征追踪的是观测而非奖励归因。来自在 SMACv2 protoss_5_vs_5 上胜任的 MAPPO 策略的每个智能体 GRU 嵌入,在一个为分离单位类型而选择的线性投影中显示(大圆:角色质心;小点:每时间步嵌入)。该投影基于五个盟友槽中的三个进行拟合,并且仅绘制在拟合时未使用的两个槽上,因此角色结构必须在不同智能体间泛化,而非记忆槽身份。(a) 使用个体奖励时,三种神族角色占据不同区域(探针准确率 0.73,随机概率 1/3)。(b) 使用共享团队奖励时,几何结构基本不变(探针准确率 0.75)。(c) 遮蔽每个智能体自身的单位类型位会破坏聚类,并将探针准确率降至 0.49。在整个比较中,遮蔽观测会改变角色几何,而奖励归因则主要影响行为。
## 1 引言
多智能体强化学习将奖励设计转变为一个反馈归因问题。在单智能体强化学习中,归因问题很简单:智能体因其自身动作获得奖励。在协作式任务中,实践者通常用单个团队平均奖励替代每个智能体的个体贡献 (Yuet al., 2022; Rashid et al., 2018)。这种选择使智能体与联合目标对齐,但同时也意味着无论哪个动作导致了结果,每个智能体都得到相同的反馈。信用分配文献将其视为一个优化问题 (Foersteret al., 2018);在此我们探究个体奖励 vs. 共享奖励是否会在共享表征或行为中留下可测量的痕迹。我们提供了能够分离两种效应的诊断工具:奖励归因可以改变行为,而直接观测到的角色可以解释表面上看似角色几何的现象。
在大规模多智能体强化学习中,一个常见的失败模式是:Neural MMO (Suarezet al., 2019) 报告称在团队奖励下会产生同质化策略,而互补角色本应更有用,尤其是在 100 到 1000 个智能体的场景中。一个自然的几何假设是,共享反馈会将共享编码器压缩到低于角色分化所需的维度以下。我们引入了检验该假设的诊断工具,然后利用 SMACv2 展示了主要的混淆因素:当角色信息存在于观测中时,高角色探针准确率可能反映的是观测到的角色输入,而非奖励产生的专门化。因此,正确的比较是在控制观测已经提供的信息之后,再进行奖励归因的比较。
贡献。
首先,我们定义了两种可基于小批量计算得出的诊断工具:用于表征几何的 EffRank/\(n\) 和用于动作分布多样性的 \(D_{\text{act}}\)。其次,我们在训练了 400 万环境步骤且具备胜任能力的 SMACv2 protoss_5_vs_5 策略上验证了它们。第三,我们进行了观测\(\times\)奖励归因的比较,发现单位类型的几何结构跟随的是观测而非奖励,而奖励归因仍会影响行为。最后,我们将相同的诊断工具应用于一个包含 48 个智能体的 Tribal Village 环境。
## 2 相关工作
大规模多智能体强化学习。Neural MMO (Suarezet al., 2019, 2023) 研究持续、开放世界中的大规模智能体群体,并报告称共享团队奖励可能产生同质化策略而非互补角色。2.0 基准将该设置扩展到许多任务和智能体,使得角色形成和专门化在群体规模上可见。竞赛结果 (Suarezet al., 2024) 表明,强大的智能体通常使用个体奖励塑形来打破这些大规模团队设置中的对称性。这促使我们检验在不同奖励归因下,共享编码器是否真的保留了角色信息。
信用分配。COMA (Foersteret al., 2018) 使用反事实基线,在共享回报下将信用分配给个体智能体。VDN (Sunehaget al., 2018) 将团队价值分解为每个智能体的价值项,而 QMIX (Rashidet al., 2018) 学习一个单调混合网络用于集中式训练和分散式执行。这些方法在保持协作式团队目标的同时,改变了价值或策略更新归因于每个智能体的方式。我们的设置保持学习算法不变,并测量不同奖励归因所产生的表征和行为。
表征坍缩。单智能体强化学习中的秩坍缩工作 (Kumaret al., 2021; Sokaret al., 2023) 表明,强化学习训练可能降低表征维度,并导致网络存在不活跃或冗余特征。PRISM (Kimet al., 2025) 对多智能体策略使用频谱参数共享,LoRASA (Zhanget al., 2025) 则使用低秩智能体特定适应进行多智能体策略学习。这两种多智能体方法都在保留参数共享的同时,为智能体特定行为增加了架构容量。我们的度量指标询问的是,训练后的共享编码器中是否出现了这种智能体或角色分离。
行为多样性与角色。SND (Bettiniet al., 2023) 测量多智能体学习中的行为异质性。角色多样性 (Huet al., 2022) 诊断涌现的角色,而 ACORM (Liuet al., 2024) 和 MA2CL (Hanet al., 2023) 使用对比学习目标来学习或鼓励角色表征。这些工作将角色分化视为一个行为或表征学习目标,而非仅仅是一个标量回报目标。我们诊断性地使用同样的关注点,在训练后测量行为和表征几何。
## 3 方法
令 \(z_t^{(i)} \in \mathbb{R}^d\) 表示智能体 \(i\) 在时间步 \(t\) 的共享编码器嵌入;将小批量嵌入堆叠为 \(Z\)。
EffRank/\(n\)。有效秩 (Roy and Vetterli, 2007) 估计嵌入的维度:
\[
\text{EffRank}(Z) = \exp\left(-\sum_{i} \bar{\sigma}_i \log \bar{\sigma}_i\right), \quad \bar{\sigma}_i = \frac{\sigma_i}{\sum_j \sigma_j},
\]
其中 \(\sigma_i\) 是奇异值。在拥有 \(n\) 个智能体和 \(k\) 种角色类型的多智能体强化学习中,一个能分离角色的共享编码器只需维护 \(k\) 个几何上不同的方向。按 \(n\) 归一化得到 EffRank/\(n\):对于干净的角色表征,其期望上限是 \(k/n\)(每个角色一个方向),而接近 \(1/n\) 的值则表明坍缩到一个单一的共享方向。我们将其计算在按每个智能体时间平均的 GRU 嵌入质心上,这样度量反映的是智能体/角色几何结构,而非每个瞬态时间步。在实践中,我们结合探针,在匹配条件下比较性地解读 EffRank/\(n\)。其预期诊断解释是:保留每个智能体梯度信息的奖励信号,应能使共享编码器更容易保持不同的角色方向,而平均这些信号则可能消除分离它们的压力。
\(D_{\text{act}}\)。我们使用智能体动作分布间的平均成对 KL 散度来衡量行为多样性:
\[
D_{\text{act}} = \frac{1}{\binom{n}{2}} \sum_{i \neq j} D_{\text{KL}}\left(\pi(\cdot \mid o_i) \,\|\, \pi(\cdot \mid o_j)\right).
\]
\(D_{\text{act}}\) 是一个瞬时边际量,因此它捕获的是单步动作发散,而非仅在轨迹中展开的角色结构。由于策略是共享的,其绝对值也反映了观测多样性,其程度不亚于学习到的专门化。因此,我们跨保持环境和观测分布固定的匹配奖励条件进行比较,并与 EffRank/\(n\) 和探针一起解读,而不是作为独立的行为测试。在本文中,当 EffRank/\(n\) 和探针不变而 \(D_{\text{act}}\) 发生变化时,\(D_{\text{act}}\) 便具有信息量:这种模式表明奖励归因改变了行为,而未改变解码出的角色几何结构。
角色探针。我们冻结编码器,并使用留出一个智能体槽的交叉验证方法,拟合一个用于三分类单位类型(追踪者、狂热者、不朽者)的逻辑回归器。准确率高于随机水平(在 SMACv2 protoss_5_vs_5 中为 1/3)可检验几何多样性是否对应于可解码的角色信息;随机水平的准确率表明此特定角色标签发生了坍缩。高于随机水平的准确率仍需结合观测来解读:如果角色身份被观测到,解码它并不证明存在奖励归因效应。
参照图注
参照图注
图2:SMACv2 protoss_5_vs_5 (10gen_protoss)。五个己方神族单位对抗五个敌人;每个己方单位是从追踪者、狂热者或不朽者中按每个回合独立同分布采样。默认情况下观测包含单位类型,在消融实验中将其遮蔽,以测试几何结构是来自奖励归因还是直接观测到的角色身份。智能体训练 400 万步(各条件下确定性评估胜率约 24% 至 48%)。
表1:单位类型被观测。400 万步,3 个种子和每个种子 32 个确定性评估回合的平均值±标准差。个体奖励给予每个智能体与其伤害贡献成比例的奖励;共享奖励给予所有智能体相同的团队平均奖励。共享奖励并未导致 EffRank/\(n\) 或单位类型探针坍缩;只有行为上的 \(D_{\text{act}}\) 在个体奖励下更高。
表2:观测×奖励归因比较。SMACv2 的四种条件比较了单位类型被观测 vs. 被遮蔽,以及个体伤害贡献奖励 vs. 共享团队奖励,均在 400 万步时进行。EffRank/\(n\) 是质心有效秩;\(D_{\text{act}}\) 是仅在两个智能体都可用的动作上计算的成对 KL 散度;探针解码单位类型(随机概率 = 1/3);胜率是确定性评估胜率。遮蔽单位类型将探针准确率从约 0.74 降至两个奖励分支中的 0.49,而个体奖励主要改善了行为(\(D_{\text{act}}\) 和胜率)。
SMACv2 环境。我们使用 SMACv2 (Elliset al., 2022) 的 protoss_5_vs_5 (10gen_protoss):五个己方单位对抗五个敌人,每个己方单位类型在每个回合中独立同分布地从追踪者、狂热者和不朽者中抽取。单位类型就是角色标签。默认情况下,它通过单位类型位直接编码在每个智能体的观测中,因此 SMACv2 可以测试角色几何结构是否来自可见的角色输入。遮蔽运行会将每个智能体自身的单位类型位置零,但保留己方和敌方的状态特征。由于单位类型是按槽独立同分布抽取的,遮蔽智能体自身的位并不会泄露类型。
SMACv2 策略。所有智能体执行一个完全共享的 MAPPO (Yuet al., 2022) 策略:一个循环 GRU 编码器将每个智能体观测映射为一个嵌入,随后是线性 actor 和 critic 头。没有智能体特定的参数或条件化于角色的模块,因此任何角色结构都必须出现在共享编码器内部。
比较。我们训练每个条件 400 万步,并评估每个种子 32 个确定性回合,每一步选择最可能的有效动作。比较交叉了奖励归因和观测。奖励要么是个体的,与每个智能体的伤害贡献成正比;要么是共享的,给予所有智能体相同的团队平均奖励。观测要么是默认的单位类型被观测,要么通过 obs_mask_unit_type 遮蔽,即将每个智能体自身的单位类型位置零,同时保留其他特征。如果单位类型被观测的条件是由直接的单位类型输入解释的,那么遮蔽应该会降低探针准确率;然后我们询问,在没有这种输入的情况下,个体奖励是否能恢复结构,每个单元格使用 3 个种子。
度量计算。在 400 万步时,四个策略系列相对于内置 AI 都远高于接近零的随机基线,确定性评估胜率从 0.24±0.07 到 0.48±0.18 不等。度量是在确定性评估轨迹上计算的:EffRank/\(n\) 在时间平均的每个智能体 GRU 质心上计算,\(D_{\text{act}}\) 在两个智能体都可用的动作上计算,以及留出一个智能体槽的单位类型探针。留出一个槽的分割很重要:探针必须将单位类型信息泛化到未用于拟合的智能体槽,因此高准确率不仅仅是槽内的记忆。个体奖励条件保留了团队级别的信号,但根据伤害贡献在智能体间分配奖励。
Tribal Village 设置。我们还为名为 Tribal Village 的多智能体环境训练了个体和共享奖励的循环策略,并计算了 EffRank/\(n\) 和 \(D_{\text{act}}\)。
## 4 实验
我们对共享编码器进行了三项检验。首先,我们确认个体奖励能产生一个具有可解码角色几何结构且胜任的策略。其次,我们仅将奖励切换为共享团队奖励,并相似文章
揭示与缓解多奖励强化学习中聚合引发的奖励黑客行为
本文在大型语言模型的多奖励强化学习中识别出聚合引发的奖励黑客行为,并提出一种自适应投影方法 AMRP,以动态调整权重,实现更好的奖励平衡和性能。
DeltaRubric:通过联合规划与验证实现生成式多模态奖励建模
DeltaRubric 是一篇研究论文,介绍了一种使用单一多模态大语言模型(MLLM)的两步多模态偏好评估方法,通过联合规划与验证来提高奖励建模的可靠性。
LLM归因指标能否迁移?跨数据集与构念的检索增强生成评估审计
本文对RAG系统在三种评估构念下的八种自动归因指标进行了审计,发现同一构念内没有单一指标能在数据集间迁移,挑战了将它们视为可互换的常见做法。
基于语义合作博弈的LLM多智能体系统贡献分配方法
针对LLM多智能体系统中的贡献分配问题,提出语义合作博弈(SCG)和语义Shapley值(SSV)方法,并引入单轨迹算法SLIC,在保持与蒙特卡洛Shapley基线一致性的前提下,将计算成本降低93.3%。
合作博弈的非线性公理归因方法
本文提出了一类用于合作博弈的非线性公理归因方法,以克服线性Shapley值因零空间过大而导致的局限性。实验结果表明,与Shapley值变体相比,这些方法在包含AUC指标方面具有潜在的有效性。