基于内在动机的探索驱动个性化联邦强化学习

arXiv cs.LG 论文

摘要

本文介绍了EDPFRL-IM,一个将好奇心驱动的内在动机融入个性化联邦强化学习的框架,以在稀疏奖励、非平稳环境中改进探索,同时保护客户隐私。

arXiv:2608.10499v1 公告类型:新 摘要:个性化联邦强化学习(PFRL)采用去中心化的方式,基于过往经验存储和访问信息,同时在每个客户端学习策略时保持各自数据的私密性。目前许多PFRL方法严重依赖利用现有的强化学习奖励信号来为每个客户端推导最优策略,从而忽视了在非平稳或稀疏奖励环境中的探索。在这项工作中,我们引入了一种新的探索驱动框架——基于内在动机的探索驱动个性化联邦强化学习(EDPFRL-IM),该框架利用每个客户端固有的好奇心驱动探索来促进局部探索并保护客户隐私。此外,为了通过探索在先前未探索的状态空间中发现策略,客户端在其外在奖励中添加了内在随机网络蒸馏(RND)信号。另外,服务器无法访问客户的原始经验或局部梯度估计;相反,服务器发送全局探索先验,并从每个客户端收集最小的新颖性摘要,以实现客户端之间多样且协调的探索。在基准环境中的实验表明,我们的框架在策略个性化和样本效率方面优于平均PFRL基准,主要是在延迟和稀疏奖励系统中。总体而言,EDPFRL-IM能够在保护客户隐私的同时,将灵活的探索学习结构集成到联邦强化学习系统中。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:30

Source: https://arxiv.org/html/2608.10499

###### 摘要

个性化联邦强化学习(PFRL)采用了一种去中心化的方式,在保持每个客户端数据隐私的同时,基于过去经验存储和访问信息,并学习每个客户端的策略。目前许多 PFRL 方法严重依赖利用现有的强化学习奖励信号来为每个客户端推导最优策略,从而忽视了在非平稳或稀疏奖励环境中的探索。在这项工作中,我们引入了一个新的探索驱动框架——基于内在动机的探索驱动个性化联邦强化学习(EDPFRL-IM),它利用每个客户端内在的好奇心驱动探索来促进本地探索并保护客户端隐私。此外,为了通过探索在先前未探索的状态空间中促进策略发现,客户端将内在随机网络蒸馏(RND)信号添加到其外在奖励中。同时,服务器无法访问客户端的原始经验或本地梯度估计;相反,服务器发送全局探索先验,并从每个客户端收集最小化的新异性摘要,以实现客户端之间多样化且协调的探索。在基准环境中的实验表明,我们的框架在策略个性化和样本效率方面优于平均 PFRL 基准,主要是在延迟和稀疏奖励系统中。总体而言,EDPFRL-IM 在保持客户端隐私的同时,能够将灵活的探索性学习结构集成到联邦强化学习系统中。

## I 引言

强化学习(RL)是序贯决策的强大框架,使智能体能够通过与环境的交互来学习最优行为 [9 (https://arxiv.org/html/2608.10499#bib.bib12)]。联邦强化学习(FRL)使多个客户端能够在去中心化设置中协同训练强化学习智能体,而无需交换原始经验数据。个性化 FRL(PFRL)通过根据每个客户端特定环境和目标定制策略,进一步扩展了这一点。这使其适用于现实应用,如健康监测和机器人技术 [4 (https://arxiv.org/html/2608.10499#bib.bib1),8 (https://arxiv.org/html/2608.10499#bib.bib11)]。

尽管现有的 PFRL 框架 [4 (https://arxiv.org/html/2608.10499#bib.bib1),11 (https://arxiv.org/html/2608.10499#bib.bib2)] 侧重于策略优化和聚合,但它们往往忽视了在有限或延迟奖励下的探索作用。标准 RL 策略 [9 (https://arxiv.org/html/2608.10499#bib.bib12)],如 ε-贪婪或熵正则化,在联邦设置中效果会变差,因为客户端独立运行,且面临限制协调的隐私约束。因此,客户端可能学习到次优策略,尤其是在冷启动或非平稳条件下。虽然 FedRL [4 (https://arxiv.org/html/2608.10499#bib.bib1)]、FedAvg-RL [11 (https://arxiv.org/html/2608.10499#bib.bib2)] 和 pFedMe [10 (https://arxiv.org/html/2608.10499#bib.bib3)] 等方法解决了个性化或聚合问题,但它们假设了同质或监督设置。内在动机方法,如 RND [7 (https://arxiv.org/html/2608.10499#bib.bib6)]、ICM [3 (https://arxiv.org/html/2608.10499#bib.bib7)] 和基于计数的探索 [6 (https://arxiv.org/html/2608.10499#bib.bib8)],在集中式 RL 中显示出潜力,但在联邦场景中仍未得到充分探索。解决这一差距是释放更自适应、更智能的端侧学习能力的关键。

我们提出了 EDPFRL-IM 框架,将内在好奇心驱动的动机整合到个性化联邦强化学习中。它不仅能够在稀疏奖励下实现高效的本地探索,还能保护隐私并最小化通信开销。我们总结主要贡献如下:

- • 我们引入了 EDPFRL-IM,一种新颖的 FRL 框架,在去中心化设置中结合内在动机实现个性化探索。
- • 我们开发了通信高效的协议来压缩探索统计信息,使客户端能够协调其好奇心驱动的行为,同时避免泄露原始数据或策略。
- • 我们在稀疏奖励基准环境中对方法进行了实证评估,并展示了相对于现有联邦 RL 基线在个性化、探索效率和策略性能方面的显著改进。

## II 方法

### II-A 问题定义

我们考虑一个包含 N 个客户端的 PFRL 设置,每个客户端与一个本地马尔可夫决策过程(MDP)[5 (https://arxiv.org/html/2608.10499#bib.bib13)] \(\mathcal{M}_{i}=(\mathcal{S}_{i},\mathcal{A},\mathcal{P}_{i},R_{i},\gamma)\) 交互,其中 \(\mathcal{S}_{i}\) 和 \(R_{i}\) 是客户端特定的,而 \(\mathcal{A}\) 和 \(\gamma\) 是共享的。由于迁移动力学和奖励的异质性,每个客户端学习个性化策略 \(\pi_{i}(a|s)\) 以最大化其期望回报:

\(J_{i}(\pi_{i})=\mathbb{E}_{\pi_{i}}\left[\sum_{t=0}^{\infty}\gamma^{t}r_{i,t}\right]\)。(1)

客户端通过梯度上升更新其策略参数:

\(\theta_{i}\leftarrow\theta_{i}+\eta\nabla_{\theta_{i}}J_{i}(\pi_{\theta_{i}})\),(2)

其中学习率为 \(\eta\)。与全局 FL 或 RL 不同,PFRL 优化个体客户端策略,同时通过轻量级、隐私保护的探索统计信息实现协作。

### II-B 用于本地探索的内在动机

由于稀疏或延迟奖励,有效的探索在 PFRL 中至关重要。我们采用 RND,一种自监督方法,每个客户端使用固定的随机目标网络 \(f_{\text{tgt}}\) 和可训练预测器 \(f_{\text{pred}}\)。内在奖励是下一个状态 \(s_{t+1}\) 上的预测误差:

\(r_{t}^{\text{int}}=\left\|f_{\text{tgt}}(s_{t+1})-f_{\text{pred}}(s_{t+1})\right\|_{2}^{2}\)。(3)

这促进了对新状态的探索。总奖励将外在和内在项结合为

\(r_{t}^{\text{total}}=r_{t}^{\text{ext}}+\alpha_{i}\cdot r_{t}^{\text{int}}\),(4)

其中 \(\alpha_{i}\) 控制每个客户端的探索-利用权衡。这种本地 RND 设置无需外部塑形或手动调整即可实现自适应探索。

### II-C 基于探索摘要的联邦协调

不协调的探索可能导致跨客户端的冗余努力。为了实现高效协作,我们提出了一种联邦隐私保护协调机制。每个客户端生成紧凑的探索统计信息 \(\mathcal{E}_{i}\),例如访问次数、状态嵌入上的频率直方图,或基于内在奖励的 top-k 新异状态哈希。这些摘要是低维的,并保护敏感数据。

中央服务器聚合这些统计信息以形成全局探索概况:

\(\mathcal{G}=\text{Aggregate}(\{\mathcal{E}_{i}\}_{i=1}^{N})\),(5)

其中 \(\text{Aggregate}(\cdot)\) 组合客户端贡献,例如,对状态簇 \(k\) 的访问次数求和:

\(v_{\text{global}}[k]=\sum_{i=1}^{N}v_{i}[k]\)。(6)

然后服务器计算全局新异性先验,用于识别未被充分探索的状态:

\(\mathcal{P}_{\text{novel}}(s)=\frac{1}{1+v_{\text{global}}[\text{cluster}(s)]}\),(7)

其中 \(\text{cluster}(s)\) 将状态 \(s\) 映射到簇索引。该先验被广播给所有客户端以指导其探索。

每个客户端将全局新异性先验纳入其策略更新:

\(\theta_{i}\leftarrow\theta_{i}+\eta\nabla_{\theta_{i}}\mathbb{E}_{\pi_{\theta_{i}},p_{i}(s)}\left[\sum_{t=0}^{\infty}\gamma^{t}(r_{i,t}^{\text{ext}}+\alpha_{i}r_{i,t}^{\text{int}})\right]\),(8)

其中从客户端 \(i\) 的经验回放缓冲区 \(\mathcal{D}_{i}\) 中采样状态 \(s\) 的概率表示为

\(p_{i}(s)\propto\left(1+\beta\cdot\mathcal{P}_{\text{novel}}(s)\right)\cdot p_{i}^{\text{uniform}}(s)\),(9)

其中 \(p_{i}^{\text{uniform}}(s)=1/|\mathcal{D}_{i}|\) 是均匀基线概率,\(\beta\ge 0\) 控制全局先验的影响。这种方法确保客户端关注全局新异状态,促进多样化探索,同时维护隐私并保持低通信成本。

算法 1 (https://arxiv.org/html/2608.10499#alg1) 描述了 EDPFRL-IM 方法。每个客户端收集经验并使用 RND 计算内在奖励(第 5–7 行),然后调整其本地策略(第 8 行)。客户端将压缩的探索摘要发送到服务器(第 10 行),服务器将其聚合为全局新异性先验(第 12 行)并广播(第 13 行)。客户端使用该先验进行有偏经验采样(第 15 行),从而在不损害隐私的情况下实现协调探索。我们的框架概述如图 1 (https://arxiv.org/html/2608.10499#S2.F1) 所示。

**算法 1** EDPFRL-IM:基于内在动机的探索驱动个性化联邦强化学习

```
0: 客户端 {C_i}_{i=1}^N, 全局轮数 T, 本地轮数 E, RND 模块 (f_tgt, f_pred), 探索权重 α_i, 新异性偏置 β
1: for 全局轮数 t=1 到 T do
2:   for 客户端 C_i 并行 do
3:     初始化本地缓冲区 D_i
4:     for 本地步数 e=1 到 E do
5:       与环境交互收集 (s_t, a_t, r_t^ext, s_{t+1})
6:       计算内在奖励: r_t^int = ||f_tgt(s_{t+1}) - f_pred(s_{t+1})||_2^2
7:       将 (s_t, a_t, r_t^total, s_{t+1}) 存入 D_i, 其中 r_t^total = r_t^ext + α_i · r_t^int
8:       使用本地 RL 优化器 (例如 PPO, SAC) 更新策略 π_i
9:     end for
10:    计算探索摘要 (例如直方图, top-k 新异状态)
11:    将摘要发送到服务器
12:   end for
13:  服务器将摘要聚合成全局新异性先验 P_novel
14:  广播 P_novel 给所有客户端
15:  for 客户端 C_i do
16:    更新采样策略: p_i(s) ∝ (1 + β · P_novel(s)) · p_i^uniform(s)
17:  end for
18: end for
```

参见图注 图 1:所提出的 EDPFRL-IM 框架概述。基于本地经验,每个客户端使用内在激励进行强化学习(通过 RND)。客户端定期向中央服务器提供压缩的探索摘要,这些摘要被聚合成全局新异性先验。该先验被传回以指导定制探索,使客户端在保持私有信息的同时协同探索。

## III 实验

### III-A 仿真设置

环境:我们在具有稀疏奖励和异质动态的标准强化学习环境中测试 EDPFRL-IM 的性能。我们采用了修改版本的 MountainCar-v0 [2 (https://arxiv.org/html/2608.10499#bib.bib9)] 和 CartPole-sparse [1 (https://arxiv.org/html/2608.10499#bib.bib10)],选择它们是因为对探索质量敏感,并且在比较样本效率方面具有重要意义。

联邦设置:我们通过考虑 \(N=10\) 个客户端来模拟真实的 FRL 场景,每个客户端在由 MountainCar-v0 和修改的稀疏奖励 CartPole 环境构建的不同本地环境中运行。我们通过调整环境元素(包括重力、摩擦和奖励塑形)来创建客户端之间的异质性。例如,在 MountainCar-v0 中,客户端根据距离或速度获得额外的塑形激励,重力范围从 \(0.0025\) 到 \(0.006\)。在 CartPole-sparse 中,客户端的杆质量和推车摩擦不同,并且在平衡达到最小时长后才能获得奖励。作为示例,一个客户端的 MountainCar-v0 变体采用重力 \(0.0045\)、摩擦 \(0.005\),塑形奖励 \(r_t=-1+0.1\cdot|x-x_{\text{goal}}|\) 以促进目标导向的移动。这些差异导致不同的 MDP,表明在极端非 IID 条件下,有效的策略学习需要个性化。

基线比较:训练进行 \(T=100\) 个全局通信轮次,每个客户端每轮执行 \(E=10\) 次本地 PPO 更新。策略由全连接两层神经网络表示,具有 64 个隐藏单元和 ReLU 激活。每个客户端都有自己的随机网络蒸馏(RND)模块,目标网络和预测网络均由一个大小为 128 的隐藏层组成。内在奖励系数 \(\alpha_i\) 设置为 0.1,新异性采样偏置 \(\beta\) 设置为 0.5,除非另有说明。

实现细节:我们将我们的方法与以下基线进行比较: (i) Local RL,每个客户端在没有联邦协调的情况下独立训练; (ii) FedRL,一种常见的 FRL 方法,采用全局策略聚合; (iii) FedRL+RND,它在本地应用内在奖励但没有探索协调。对于表 III (https://arxiv.org/html/2608.10499#S3.T3) 中的更广泛比较,我们还报告了在非联邦设置中运行的单智能体内在动机方法(RND [7 (https://arxiv.org/html/2608.10499#bib.bib6)]、ICM [3 (https://arxiv.org/html/2608.10499#bib.bib7)] 和基于计数的探索(CBE)[6 (https://arxiv.org/html/2608.10499#bib.bib8)]),以及没有协调探索的联邦和个性化 FL 基线(FedAvg-RL [11 (https://arxiv.org/html/2608.10499#bib.bib2)]、pFedMe [10 (https://arxiv.org/html/2608.10499#bib.bib3)] 和 FedPer++ [12 (https://arxiv.org/html/2608.10499#bib.bib4)])。所有基线都在与 EDPFRL-IM 相同的环境配置、客户端数量和总通信预算下进行训练,以确保公平比较。所有模型均使用 Adam 优化器训练,折扣因子为 \(\gamma=0.99\),学习率为 \(3\times10^{-4}\)。

### III-B 仿真结果

主要性能比较:图 2 (https://arxiv.org/html/2608.10499#S3.F2) 显示了 MountainCar-v0(左)与 CartPole-sparse(右)在不同通信轮次中的平均回报。EDPFRL-IM 在初始轮次中始终优于所有基线(Local RL、FedRL 和 FedRL+RND),由于高效利用了可用样本,回报显著更高。在 MountainCar-v0 中,尽管存在稀疏奖励和困难的状态转移动力学,EDPFRL-IM 实现了快速收敛,学习曲线平滑。在 CartPole-sparse 中,EDPFRL-IM 具有类似优势。

相似文章

提示驱动探索

arXiv cs.LG

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

关于通过元强化学习学习探索的一些思考

OpenAI Blog

OpenAI研究人员引入了E-MAML和E-RL²两种元强化学习算法,旨在改进需要大量探索来发现最优策略的任务中的探索性能。该工作展示了这些算法在包括Krazy World和迷宫任务在内的新颖环境中的有效性。

推理还是记忆?LLM强化学习中的方向感知多样性探索

arXiv cs.AI

本文介绍了DiRL,一种方向感知的强化学习框架,能够在LLM探索中区分推理驱动的多样性和记忆驱动的多样性。它从模型表示中提取内在的推理-记忆方向,并塑造奖励以优先考虑与推理一致的探索,在数学和通用推理基准上表现出改进。