并非所有不确定性都一样:波动性、随机性与探索
摘要
本文证明,波动性和随机性作为不确定性的两种来源,推动最优探索向相反方向变化:波动性增加探索,而随机性抑制探索。作者将Gittins指数框架扩展到高斯状态空间赌博机,并引入了CAUSE——一种闭式探索奖励,其性能优于标准策略。
arXiv:2605.19215v1 Announce Type: new
Abstract: 生物与人工智能中的自适应决策需要在利用已知结果与探索不确定性选项之间取得平衡。尽管先前研究表明不确定性通常促进探索,但以往研究往往将不同的环境不确定性来源视为等同。本研究考虑具有潜在奖励状态随时间漂移(波动性)且通过含噪观测(随机性)的环境。两者都增加后验不确定性,然而我们证明它们推动最优探索向相反方向变化:波动性增强探索,而随机性抑制探索。我们通过将Gittins指数框架扩展到具有潜在动态的高斯状态空间赌博机,正式建立了这一不对称性。我们进一步推导出因果感知不确定性敏感探索(CAUSE)——一种通过控制即推理得到的闭式探索奖励,该奖励继承了相同的单调性。CAUSE在具有异质噪声结构的环境中优于标准探索策略,并且改进了Gittins-per-arm策略——该策略的静止赌博机最优性无法迁移到动态设置。学习与探索受相同的噪声推断不对称性支配,该框架预测病理性噪声推断产生的是\emph{反向}而非仅仅是受损的探索,这对精神疾病的计算解释具有启示意义。
查看缓存全文
缓存时间: 2026/05/20 08:28
# 并非所有不确定性都一样:波动性、随机性与探索
来源:https://arxiv.org/html/2605.19215
###### 摘要
生物与人工智能中的自适应决策需要在利用已知结果与探索不确定替代方案之间取得平衡。尽管先前研究表明不确定性通常促进探索,但这些研究通常将不同来源的环境不确定性视为等同。我们考虑这样一种环境:潜在奖励状态随时间漂移(波动性),并通过带噪声的结果(随机性)被观测。两者都增加了后验不确定性,然而我们证明它们驱动最优探索的方向相反:波动性增强探索,而随机性抑制探索。我们通过将Gittins指数框架扩展到具有潜在动力学的高斯状态空间老虎机,正式确立了这一不对称性。我们进一步推导了**因果感知不确定性敏感探索**(CAUSE),这是一种通过“控制作为推理”获得的闭式探索奖励,并继承了相同的单调性。CAUSE在具有异质噪声结构的环境中优于标准探索策略,并改进了基于单臂Gittins的策略(后者的静态老虎机最优性无法推广到动态场景)。学习与探索受相同的噪声推断不对称性支配,该框架预测病态的噪声推断会产生*反向*而非仅仅是受损的探索,这对精神障碍的计算模型具有启示意义。
## 1 引言
在探索的计算解释中,一个反复出现的原则是不确定性驱动行为:不确定性越大,探索越多。这一逻辑支撑着一系列广泛的探索策略:上置信界(UCB)方法通过在不确定性下乐观行动来探索[2 (https://arxiv.org/html/2605.19215#bib.bib53),18 (https://arxiv.org/html/2605.19215#bib.bib52)];Thompson采样通过从奖励的后验分布中采样来探索[34 (https://arxiv.org/html/2605.19215#bib.bib51)];信息导向采样平衡了期望遗憾与期望信息增益[31 (https://arxiv.org/html/2605.19215#bib.bib50)];神经科学工作则将探索与不确定性的神经和行为特征联系起来[38 (https://arxiv.org/html/2605.19215#bib.bib49),12 (https://arxiv.org/html/2605.19215#bib.bib48),8 (https://arxiv.org/html/2605.19215#bib.bib47),10 (https://arxiv.org/html/2605.19215#bib.bib46)]。在每种情况下,更多不确定性都意味着更多探索。
我们证明这个处方是不完整的。并非所有不确定性都一样,某些形式的不确定性应该*减少*探索。具体来说,我们考虑这样的环境:潜在奖励状态随时间变化(波动性),并通过带噪声的结果(随机性)被观测。波动性和随机性都会增加关于奖励的后验不确定性,而像UCB和Thompson采样这样的标准方法将它们等同对待,在两种情况下都规定更多探索。我们证明它们驱动最优探索的方向相反:波动性增强探索,而随机性抑制探索。其直觉是:不确定性只有在反映潜在信息增益时才与探索相关。波动性创造信息增益:潜在状态在变化,因此新观测揭示新内容。随机性破坏信息增益:观测带有噪声,因此每次样本的信息量更少。一个仅仅因为更不确定就更多探索的智能体混淆了这两种情况,恰恰在观测最无用的时候大力探索。
我们通过将Gittins指数框架从独立同分布(iid)高斯老虎机扩展到高斯状态空间老虎机(其中每个臂的潜在奖励状态具有波动性,并以随机性被观测)来正式确立这一结果。在这个更丰富的环境中,我们证明最优探索奖励(定义为证明拉一个臂超出其期望奖励的信息价值)随波动性单调递增,随随机性单调递减。这一结果源于Gittins退休问题的结构,无需近似。
Gittins指数仅对静态老虎机具有最优性保证。在动态环境中(未选择的臂也会演化),Gittins失去了其最优性保证,真正的最优策略通常难以求解。为了获得实用的探索策略,我们转向“控制作为推理”框架[19 (https://arxiv.org/html/2605.19215#bib.bib43),35 (https://arxiv.org/html/2605.19215#bib.bib42)],该框架将动作选择视为概率图模型中的后验推断。在该框架内,我们推导出**因果感知不确定性敏感探索**(CAUSE),一种针对高斯状态空间老虎机的闭式指数策略。CAUSE清晰地分解为利用和探索两部分,其探索部分继承了Gittins分析所确立的关于波动性和随机性的相同定性依赖。据我们所知,这是首次应用“控制作为推理”来推导动态老虎机的探索指数。
这些相反的效果与学习文献中的一个已知结果平行。最优学习率随波动性增加而增加,随随机性增加而降低,因为相同的信息论逻辑在起作用:波动性使新观测更有相关性,随机性则使其更不可靠[26 (https://arxiv.org/html/2605.19215#bib.bib45)]。这种平行并非巧合:两者都是同一生成模型的规范性属性。
这一统一观点产生了关于病态行为的可验证预测。波动性和随机性必须从观测中联合推断,因为两者都会增加经验噪声,且只能通过解释消除来区分。对某一种源的先验不敏感性会导致对另一种源的系统性误判[26 (https://arxiv.org/html/2605.19215#bib.bib45)]:具有低敏感性随机性先验的智能体认为世界比实际更波动,反之亦然。在学习场景中,这种校准错误会产生*反向*的学习率调制模式,这一模式在人类行为中已被观察到[27 (https://arxiv.org/html/2605.19215#bib.bib44)]。我们证明,探索中类似的失败会产生反向的探索行为:对随机性不敏感的智能体恰恰在观测最不信息时过度探索,而对波动性不敏感的智能体则在环境变化最快时探索不足。校准错误的噪声推断已被提出作为多种精神障碍的候选机制,这使得这些反转成为临床研究的具体行为目标。
我们的贡献是:(i) 将Gittins框架从iid高斯老虎机扩展到具有潜在动力学的高斯状态空间老虎机,证明最优探索奖励随波动性单调递增,随随机性单调递减;(ii) 在“控制作为推理”框架内,推导出CAUSE,一种针对高斯状态空间老虎机的闭式指数策略,据我们所知,这是针对具有连续状态高斯动力学的动态老虎机的首个闭式指数,也是首次应用“控制作为推理”来推导此类指数;(iii) 证明波动性和随机性对探索的相反作用与对学习的作用平行,两者都源于同一生成模型的规范性属性;(iv) 经验上,CAUSE在波动性和随机性各谱系中均优于Thompson采样、UCB、预测采样以及数值的单臂Gittins基线,并在静态极限中匹配最优Gittins参考;(v) 损伤推断产生反向而非仅仅受损的探索模式,且反转方向指明了哪部分潜在推断失败。代码将在发表后发布。
## 2 相关工作
#### 探索与不确定性在神经科学中。
行为与神经研究已将探索行为与不确定性信号联系起来,包括相对和总不确定性[38 (https://arxiv.org/html/2605.19215#bib.bib49)]、预期和非预期不确定性[7 (https://arxiv.org/html/2605.19215#bib.bib14)]以及信息价值[8 (https://arxiv.org/html/2605.19215#bib.bib47),11 (https://arxiv.org/html/2605.19215#bib.bib37)]。这些解释通常预测探索随不确定性增加而增加,而没有区分不确定性的来源。我们的框架预测波动性和随机性应对探索行为产生相反的作用,并且对这些量的选择性推断失败应产生特征性的反转而非统一缺陷。据我们所知,这些定性预测尚未经实验检验。
#### 波动性、随机性与自适应学习。
不确定性下的自适应学习已通过追踪波动性[4 (https://arxiv.org/html/2605.19215#bib.bib36),22 (https://arxiv.org/html/2605.19215#bib.bib35)]或检测变化点[24 (https://arxiv.org/html/2605.19215#bib.bib34),23 (https://arxiv.org/html/2605.19215#bib.bib4)]的层次贝叶斯框架建模。这些方法通常估计一种不确定性源,同时将另一种视为已知,忽略了它们同时估计的计算挑战。Piray和Daw[26 (https://arxiv.org/html/2605.19215#bib.bib45)]引入了一个联合估计波动性和随机性的框架,表明虽然两者都增加结果方差,但它们可以通过时间结构区分,并对学习率产生相反的影响。同一工作表明,选择性无法表征一种源会产生反向而非仅仅受损的学习率调制,为精神与神经疾病的病态学习提供了候选解释。该框架后被推广到二元结果,并在大规模行为实验中验证[27 (https://arxiv.org/html/2605.19215#bib.bib44)]。我们的工作在此基础上构建,表明相同的分离作为规范性结果驱动探索,并对探索行为产生类似的损伤模型预测。
#### 老虎机中的探索。
探索/利用困境已在多臂老虎机文献中得到广泛研究。UCB方法[2 (https://arxiv.org/html/2605.19215#bib.bib53),18 (https://arxiv.org/html/2605.19215#bib.bib52)]和Thompson采样[34 (https://arxiv.org/html/2605.19215#bib.bib51),30 (https://arxiv.org/html/2605.19215#bib.bib9)]都随着不确定性增加探索——前者通过乐观奖励估计,后者通过后验采样;贝叶斯变体的UCB[17 (https://arxiv.org/html/2605.19215#bib.bib6)]用后验可信区间替换频率置信界,我们在实验中使用此版本作为基线。Gittins指数[13 (https://arxiv.org/html/2605.19215#bib.bib41)]为折扣静态老虎机提供了最优分解,并且在高斯iid奖励(均值未知,通过噪声观测估计)中得到了充分刻画[39 (https://arxiv.org/html/2605.19215#bib.bib39)]。Whittle指数[37 (https://arxiv.org/html/2605.19215#bib.bib40)]将基于指数的策略扩展到潜在状态随时间演化的动态环境,但通常只能通过近似计算,而动态老虎机精确最优策略是PSPACE-难的[25 (https://arxiv.org/html/2605.19215#bib.bib3)]。信息导向采样[31 (https://arxiv.org/html/2605.19215#bib.bib50)]明确针对不确定性减少,分配探索以最大化每单位遗憾的信息增益;但与基于指数的方法不同,它需要在每一步求解一个辅助优化问题,且无法产生闭式比较静力学。
Russo和Van Roy[32 (https://arxiv.org/html/2605.19215#bib.bib24)]提出了针对时间敏感老虎机学习的满意Thompson采样,它针对一个松弛的近最优目标而非精确最优进行采样;Liu等人[20 (https://arxiv.org/html/2605.19215#bib.bib23)]将Thompson采样扩展到具有均值回归非平稳奖励的老虎机,通过预测采样,降低因漂移而失去价值的信息的权重。两者都扩展了后验采样框架,而非产生闭式指数。预测采样在方法论上更接近我们的工作,但它在不同的设置中运作(均值回归AR(1)奖励),并且没有产生我们针对随机游走动力学所建立的波动性与随机性之间的闭式不对称性。我们将Gittins分析扩展到具有潜在随机游走动力学的高斯状态空间老虎机,并证明不确定性与最优探索之间的关系不是单调的:波动性促进探索,而随机性抑制探索。我们进一步推导了CAUSE,一个可处理的闭式指数策略,它继承了这一结构。
#### 控制作为推理。
最优控制与概率推断之间的联系已有悠久历史[35 (https://arxiv.org/html/2605.19215#bib.bib42),16 (https://arxiv.org/html/2605.19215#bib.bib31),19 (https://arxiv.org/html/2605.19215#bib.bib43)]。在该框架中,最优动作通过在概率图模型中条件于高奖励获得,从而产生受先验策略散度正则化的策略。这一公式已应用于强化学习[1 (https://arxiv.org/html/2605.19215#bib.bib29),14 (https://arxiv.org/html/2605.19215#bib.bib28)]、机器人规划[36 (https://arxiv.org/html/2605.19215#bib.bib1)]和人类规划[5 (https://arxiv.org/html/2605.19215#bib.bib27)]。我们利用这一框架推导了一个可处理的闭式指数,用于具有波动性和随机性的动态老虎机——这是一个Gittins指数刻画了最优行为但不产生可计算策略的设置。
#### 计算精神病学中的病态推断。
针对波动性的校准错误学习率调整已被提出作为多种精神障碍的候选机制。在焦虑中,对波动性或环境不稳定性的高估已被与不适当的高学习率和对噪声的过度反应相联系[6 (https://arxiv.org/html/2605.19215#bib.bib21),15 (https://arxiv.org/html/2605.19215#bib.bib22)],尽管最近的一项研究产生了不一致的结果[33 (https://arxiv.org/html/2605.19215#bib.bib16)]。在精神病中,校准错误的精度加权已被与妄想推断相联系[28 (https://arxiv.org/html/2605.19215#bib.bib19)]。在抑郁中,对环境变化的不敏感已被与关于奖励信念更新的受损相联系[29 (https://arxiv.org/html/2605.19215#bib.bib17)]。我们的框架通过提供探索端的类似物,为这一项目做出了贡献,其反转模式在第6.4节中刻画。
## 3 问题设定
我们考虑一个动态多臂老虎机,其中每个臂的奖励由一个独立的潜在状态 \(x_t\) 驱动,该状态以创新方差 \(v > 0\)(波动性)呈高斯随机游走随时间漂移。当在时刻 \(t\) 被拉动时,该臂产生一个带噪声的奖励 \(r_t = x_t + \epsilon_t\),其中 \(\epsilon_t \sim \mathcal{N}(0, s)\),观测噪声方差 \(s > 0\)(随机性)。创新噪声和观测噪声相互独立。相似文章
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
通过绝对扰动实现线性赌博机中的随机探索
本文提出绝对汤普森采样(ATS),这是对汤普森采样的一种改进,通过使用绝对探索噪声确保期望上的乐观性,在保持计算效率的同时实现了更简单的UCB风格遗憾分析。它达到了与现有TS界相匹配的遗憾,并引入了一种集成变体,该变体收敛于UCB行为。
不确定性下的多目标优化期望超体积最大化
本文提出了一种用于不确定性下多目标优化的贝叶斯决策框架,强调利用高斯过程和主动学习策略进行期望超体积最大化。
交易信心:算法交易中的全面不确定性估计
提出了一种面向算法交易的不确定性感知强化学习框架,通过SHAP加权重构、MC Dropout和LSTM共识机制,整合了分布性、认知性和偶然性不确定性。在五大美国股票指数上,其表现优于传统模型。
基于内在好奇心的强化学习中的内生探索
本文提出了一种使用内在好奇心进行内生探索的强化学习框架,适用于非平稳环境,在如LunarLander-v2和BipedalWalker-v3等基准测试上,与PPO和ICM等算法相比,达到了具有竞争力的性能。