基于内在好奇心的强化学习中的内生探索
摘要
本文提出了一种使用内在好奇心进行内生探索的强化学习框架,适用于非平稳环境,在如LunarLander-v2和BipedalWalker-v3等基准测试上,与PPO和ICM等算法相比,达到了具有竞争力的性能。
arXiv:2609.05650v1 Announce Type: new
摘要:我们提出了一种强化学习框架,其中探索由内在好奇心驱动,旨在适用于环境非平稳且奖励稀疏、延迟、信息量低或不存在的场景。在我们的模型中,动作选择由外部奖励和认知动机机制的结合引导,该机制将智能体偏向结构化的探索方向。核心假设是,有效的探索在不一致性的中间水平上出现,而性能在过于刚性或过于无序的动态下都会下降。为测试这一想法,我们基于液态状态机(LSM)基座实现了该框架,并在两个标准基准测试上进行了评估:离散动作的LunarLanderv2和连续控制的BipedalWalkerv3。所提出的方法在两项任务上相对于已建立的深度强化学习算法(包括近端策略优化(PPO)和内在好奇心模块(ICM))都达到了具有竞争力的性能。我们进一步表明,在相同分析下,主动推理智能体中没有恢复好奇心窗口,这表明所提出的动态捕捉了一种独特的探索机制。
查看缓存全文
缓存时间: 2026/09/10 08:22
# 基于内在好奇心的强化学习内源性探索机制
来源:https://arxiv.org/html/2609.05650
2026年4月
###### 摘要
我们提出一种以内在好奇心驱动探索的强化学习框架,专为环境非平稳且奖励稀疏、延迟、信息缺失或完全缺失的场景设计。在我们的模型中,动作选择由外部奖励与一种认知动机机制的组合引导,该机制使智能体偏向结构化的探索方向。核心假设是:有效的探索产生于中等程度的不协调状态,而当动态过于僵化或过于混乱时性能都会下降。为验证此观点,我们在液态状态机(LSM)基底上实现该框架,并在两个标准基准任务——离散动作的LunarLander-v2与连续控制的BipedalWalker-v3上进行评估。相对于包括近端策略优化(PPO)和内在好奇心模块(ICM)在内的成熟深度强化学习算法,所提方法在两个任务上均展现出具有竞争力的性能。进一步分析表明,主动推理智能体在相同分析下未表现出好奇心窗口特性,这说明所提出的动态机制捕捉到了一种独特的探索模式。
关键词:好奇心窗口,液态状态机,主动推理,内在动机,储层计算,探索-利用权衡
## 1引言
自适应系统中的探索问题——智能体如何在不进行穷举搜索的情况下发现有用行为——始终是强化学习(RL)、认知科学及意识理论的核心议题。标准方法将探索视为外部机制:如ε贪婪策略、玻尔兹曼温度退火、基于计数的奖励或基于预测误差的好奇心信号(Pathak等,2017;Burda等,2018)。在每种情况下,探索驱动力都是*被设计植入*系统,而非从系统自身动态中涌现。
尽管取得了显著进展,大多数现代方法仍依赖于外部机制,如ε贪婪噪声、熵正则化或基于预测误差/状态新颖性的内在奖励代理。虽然这些方法在特定场景下改善了探索能力,但并未提供通用解决方案:它们需要精细调参,常在非平稳环境中失效,且易陷入过早利用或无结构随机行为的极端。较新的进展——包括柔性演员-评论家(SAC)、双延迟DDPG(TD3)以及ICM(Pathak等,2017)和RND(Burda等,2018)等好奇心驱动方法——虽提升了稳定性和性能,但仍将探索视为辅助目标而非智能体内在动态的内源性结果。因此,在奖励稀疏、缺失或动态变化的场景中它们仍显乏力,且缺乏关于何时应增强或减弱探索的原则性解释。这一差距表明核心问题在于概念层面:当前框架未能捕捉有意义的结构化探索应涌现的条件。
我们提出一种不同的方法。我们主张系统并非单一优化外部目标,而是通过功能分异场之间的*协调性*自我调节。当不协调程度达到中间区域时——既未低到使系统陷入停滞,也未高到导致系统解体——探索将内源性涌现。这一被称为*好奇心窗口猜想*的预测是本框架最具特色且可检验的主张。
本文首次通过液态状态机(LSM)基底对这些思想进行计算验证。我们展示了系统如何围绕好奇心窗口自组织,将我们的智能体与主动推理(AIF)基线进行比较,并检验内源性噪声调制能否在不依赖外部信号的情况下维持探索。我们的主要贡献包括:
1. 好奇心窗口:C₂度量(协调盆地数×全局重叠度×转移率)在中等噪声水平达到峰值,两侧均出现>1.5倍衰减(第4节)。
2. 内源性探索:好奇心窗口是我们模型独有的特性——AIF智能体未显示类似峰值(第5.3节)。
3. 扩展动态:空间耦合、沉淀学习与非平稳适应性得到验证(第5.4节)。
## 2协调框架概述
我们假设经验并非对数据的被动接收,而是对*开放性*(可能的延续)与*约束性*(当前情境需求)之间协调性的主动调节。与自由能原理(FEP)——基于生成模型中的惊奇最小化推导行为——不同,我们视协调调节为本原,而表征结构是可能或不可能涌现的次级不变性。
本框架遵循三大原则:
1. 协调性首要原则:首要解释目标是延展与产出之间的协调性调节。表征结构是次级的。
2. 功能分化原则:开放性与约束性必须功能分化;未分化的动态无法表达本框架特有的张力。
3. 相互约束原则:延展必须受产出约束,产出必须影响延展,且记忆必须影响二者的演化轨迹。
### 2.1数学设定
令$\mathcal{E}$表示经验场,这是一个配备σ代数$\mathcal{F}$和参考测度$\mu$的可测空间。在$\mathcal{E}$上定义三个时间依赖的密度:
###### 定义1(功能角色)
- 延展 $\pi_t \in \mathcal{P}(\mathcal{E})$:关于可行延续的分布(开放性、行动倾向)。
- 产出 $y_t \in \mathcal{P}(\mathcal{E})$:反映当前环境与内部约束的分布。
- 记忆 $m_t \in \mathcal{P}(\mathcal{E})$:过往协调成就的沉淀痕迹。
两个泛函用于度量系统的协调状态:
###### 定义2(不协调度)
$I(t) = D_{\mathrm{KL}}(\pi_t \| y_t)$
###### 定义3(全局重叠度)
$G(t) = \int_{\mathcal{E}} \sqrt{\pi_t(e) \cdot y_t(e)} \, d\mu(e)$
全局重叠度 $G(t)$ 是延展与产出间的巴塔查里亚系数;当 $\pi_t = y_t$ 时等于1,当两个分布支撑集不相交时趋近0。在后续的离散化实现中,积分替换为场单元上的有限求和。
动力学由耦合更新规则支配:
$\pi_{t+1} \propto \pi_t \cdot \exp\bigl(-\eta_\pi \, y_t\bigr) + \sigma_\pi \xi_t$
$y_{t+1} = (1-\eta_y) y_t + \eta_y \, \Phi_y(r_t, u_t)$
$m_{t+1} = (1-\lambda) m_t + \lambda \, \pi_t$
其中 $\eta_\pi, \eta_y, \lambda$ 为学习率,$\Phi_y$ 将储层状态与输入映射至产出,$\sigma_\pi$ 为噪声尺度,$\xi_t$ 为独立同分布噪声。
###### 猜想1(好奇心窗口)
存在一个中等不协调度区域 $I^{*} \in (I_{\min}, I_{\max})$,使得合适的好奇心度量 $C(t)$ 达到最大值。低于 $I^{*}$ 时,系统陷入协调但缺乏探索性的盆地;高于 $I^{*}$ 时,系统解体并丧失协调结构。
好奇心窗口的证明(附录A)依赖于一个好奇心泛函 $\hat{C}_2$,其特定形式——协调盆地占用率乘全局重叠度乘转移率——通过计算引入。关键洞见在于:不协调度 $I(t) = D_{\mathrm{KL}}(\pi_t \| y_t)$ 度量延展-产出张力,全局重叠度 $G(t) = \int_{\mathcal{E}} \sqrt{\pi_t \, y_t} \, d\mu$ 度量系统级对齐(定义2和3),二者共同捕捉了*好奇心*的本质要素:由未解决的内部张力驱动的、新可行可能性的内源性开启。这要求:
1. 系统*访问不同的协调构型*(而非仅随机波动);
2. 在此过程中*保持全局整合*(而非碎片化);
3. 探索是*结构化的*——在可识别的盆地间转移,而非通过未分化的状态空间扩散。
### 2.2表示定理
###### 定理1(好奇心泛函的表示)
设 $\mathcal{C}: \mathbb{R}_{\geq 0}^{3} \to \mathbb{R}_{\geq 0}$ 为形如 $\mathcal{C} = F(G, \mathcal{B}, \mathcal{T})$ 的好奇心泛函,其中 $F$ 连续且对每个变量单调递增(对 $G$、$\mathcal{B}$、$\mathcal{T}$ 递增)。则:
1. $F$ 在边界消失:对所有剩余变量低于其阈值的情况,有 $F(G, \mathcal{B}, 0) = F(G, 0, \mathcal{T}) = F(0, \mathcal{B}, \mathcal{T}) = 0$。
2. $F$ 在单调变换下由乘积形式唯一确定:存在严格递增的 $\varphi: \mathbb{R}_{\geq 0} \to \mathbb{R}_{\geq 0}$ 满足 $\varphi(0) = 0$,使得 $\mathcal{C} = \varphi\bigl(G \cdot \mathcal{B} \cdot \mathcal{T}\bigr)$。
证明见附录B。
### 2.3沉淀即学习
我们将学习视为*沉淀*而非对损失函数的参数更新:通过重复的协调事件逐步塑造记忆场 $m_t$。反复实现低不协调度的状态在基线延展 $\pi_0$ 中获得更高的概率质量,使未来在该区域实现协调变得更容易。形式化为:
$\pi_0^{(T+1)} \propto \pi_0^{(T)} \cdot \exp\Bigl(-\alpha \sum_{\tau=1}^{T} \omega_{\tau} \, I_{\tau}\Bigr)$
其中 $\alpha$ 为沉淀率,$\omega_{\tau}$ 为时效权重。
## 3计算架构与实现
我们的计算实现采用两层架构:(i) 提供高维时间表征的动力学基底;(ii) 实现场动态的协调调节控制层。
基底实例化为液态状态机(LSM),协调层定义延展($\pi$)、产出($y$)和记忆($m$)场的演化,以及探索的内源性调制。这种分离至关重要:LSM 提供经验的丰富、渐忘记忆嵌入,而协调层提供组织与探索的支配原则。
### 3.1液态状态机基底
我们将经验场 $\mathcal{E}$ 建模为循环储层诱导的状态空间。储层状态 $x(t) \in \mathbb{R}^{N}$ 演化遵循:
$x(t+1) = \tanh\big(W x(t) + W_{\text{in}} o(t) + \xi(t)\big)$
其中 $W \in \mathbb{R}^{N \times N}$ 是谱半径 $\rho < 1$ 的稀疏循环权重矩阵,$W_{\text{in}}$ 将感官输入 $o(t)$ 映射至储层,$\xi(t) \sim \mathcal{N}(0, \sigma_I^2)$ 表示内在扰动。
LSM 提供:
- 输入的高维非线性扩展;
- 过去状态的渐忘记忆;
- 适合时间积分的连续时间动态。
关键点在于,储层本身并非智能体:它是定义和更新协调变量的动力学介质。
### 3.2状态增强与时间厚度
为明确捕捉时间延展性,我们用慢速迹增强瞬时储层状态:
$h_t = (1 - \beta) h_{t-1} + \beta x(t)$
并定义有效基底表征为:
$z_t = [x(t), \; h_t] \in \mathbb{R}^{2N}$
此构造同时提供快动态($x$)和沉淀的时间结构($h$),使实现与延展协调性的要求相一致。
### 3.3场表征与提取
场被定义为储层状态空间离散化版本上的概率分布。给定 $z_t$,我们构建:
$\pi_t = \text{softmax}\bigl(f_\pi(z_t)\bigr)$
$y_t = \text{softmax}\bigl(W_r z_t + W_\pi \pi_t + W_m m_t\bigr)$
$m_t \in \mathcal{P}(\mathcal{E})$
其中 $f_\pi$ 通常为恒等映射或线性投影,$W_r, W_\pi, W_m$ 为学习或固定的映射。
三个场扮演不同角色:
- $\pi_t$:延展(行动倾向/探索分布);
- $y_t$:产出(由环境与内部状态诱导的约束);
- $m_t$:记忆(过往协调状态的沉淀痕迹)。
### 3.4场动态
场的耦合动力学遵循:
$\pi_{t+1} \propto \pi_t \cdot \exp\bigl(-\eta_\pi y_t\bigr) + \sigma_\pi(t) \, \xi_t$
$y_{t+1} = (1-\eta_y) y_t + \eta_y \Phi_y(z_t, \pi_t, m_t)$
$m_{t+1} = (1-\lambda) m_t + \lambda \pi_t$
这些方程实现:
- 相互约束:延展受产出塑造,产出依赖延展;
- 时间积分:记忆累积过去的延展状态;
- 非平衡动态:系统持续重组而非收敛至静态最优点。
变量 $m$ 不应被解释为经典 RL 意义上的记忆(如回放缓冲区或过去状态转移的显式存储)。相反,$m$ 代表*沉淀的内部痕迹*:智能体与环境近期及周期性交互的、持续更新的潜在摘要。它作为延展分布 $\pi_t$ 的慢速移动平均演化,捕捉随时间推移对智能体而言已变得统计稳定的内容。$y_t$ 与 $m_t$ 之间的偏差信号新颖性或漂移,而对齐则指示协调与稳定性。在此意义上,$m$ 充当“何为常态”的动态基线,实现无需情节式回忆的探索调节。
### 3.5内源性探索机制
该架构的核心特征是用内源性调制替代外源性噪声:
$\sigma_\pi(t) = \psi\bigl(I(t)\bigr) \cdot G(t)$
(后续内容被截断)相似文章
大规模好奇心驱动学习研究
OpenAI 展示了一项大规模实证研究,研究了在 54 个基准环境中不依赖外在奖励的好奇心驱动强化学习,展现了强大的性能,并探讨了特征空间在基于预测的奖励信号中的作用。
基于内在动机的探索驱动个性化联邦强化学习
本文介绍了EDPFRL-IM,一个将好奇心驱动的内在动机融入个性化联邦强化学习的框架,以在稀疏奖励、非平稳环境中改进探索,同时保护客户隐私。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
超越舒适区的助推:面向RLVR的高效策略引导探索
NudgeRL是一个框架,通过引入结构化探索和策略助推来增强带有可验证奖励的强化学习(RLVR),相比暴力扩展方法,它能更高效地提升大语言模型的推理性能。
三思而后行:LLM 智能体的自主探索
本文指出自主探索是大语言模型智能体的关键能力,并提出了先探索后行动范式,该范式将信息收集与任务执行解耦,以提升适应性和实际性能。同时引入了探索检查点覆盖率作为可验证的指标,用于评估探索的广度。