预期自由能作为rho-POMDPs的信念依赖效用
摘要
研究表明,最小化预期自由能(EFE)等价于求解一个以预期信息增益为效用且探索权重固定为1的ρ-POMDP。证明了在“先观测后决策”POMDP中的等价性,并将其扩展到因子化观测POMDP,实验表明未调优的权重与仅依赖奖励的规划相比效果相当或更优。
arXiv:2607.16981v1 公告类型:新
摘要:在部分可观测环境下行动的智能体必须决定何时收集信息以及哪些观测值得其成本。标准POMDP仅通过信息对奖励的最终影响来评估其价值。而$\rho$-POMDP框架则通过信念依赖的效用$\rho$直接奖励不确定性降低,但在实践中,$\rho$的选择及其权重均需针对每个任务手动调整。我们表明,主动推理完全消除了这一调整过程。最小化预期自由能(EFE)恰好等价于求解一个以预期信息增益为效用且探索权重固定为$w=1$的$\rho$-POMDP,这是因为变分边界以相同单位(nats)表达了实用价值和认知价值。我们证明了这一等价性在“先观测后决策”POMDP中成立,并将其扩展到因子化观测POMDP——这是一类更广泛的模型,涵盖了诸如无损检测和移动感知等交替观测与行动的问题,其中信息收集不会改变隐藏状态。实验支持这一理论。在从经典的Tiger问题到RockSample以及包含超过65,000个状态的新型Structural Inspection基准等各类环境中,未调优的权重在相同规划范围内与仅依赖奖励的规划效果相当或更优,避免了针对每个任务调优的奖励机制导致的过度探索,并处于成功-奖励帕累托前沿中接近奖励最大化的拐点。实际收益在于,探索目标可以开箱即用。在故障检测和医疗筛查等应用中,每次测试都有成本,每次遗漏故障都有代价,EFE提供了一种推导得出而非手动调整的信念依赖效用。
查看缓存全文
缓存时间: 2026/07/21 06:41
# 预期自由能作为ρ-POMDP中信念依赖的效用
来源:https://arxiv.org/html/2607.16981
11email: \{patrick\.cooper,alvaro\.velasquez\}@colorado\.edu
###### 摘要
在部分可观测条件下行动的智能体必须决定何时收集信息以及哪些观测值得付出成本。标准 POMDP 仅通过信息对回报的最终影响来评估其价值。而 ρ-POMDP 框架则通过信念依赖的效用 ρ 直接奖励不确定性降低,但在实践中,ρ 的选择及其权重都需要针对每个任务手动调整。
我们证明主动推理完全消除了这种调整。最小化预期自由能 (EFE) 恰好等价于求解一个效用为预期信息增益的 ρ-POMDP,且探索权重固定为 w=1,因为变分界以相同单位(奈特)表达了实用价值和认知价值。
我们针对“先观测后决策”的 POMDP 证明了这一等价性,并将其扩展到因子化观测 POMDP——这是一类更广泛的模型,涵盖交错观测-行动问题,如无损检测和移动传感,其中信息收集不会改变隐藏状态。
实验支持该理论。在从经典老虎问题到 RockSample 以及一个拥有超过 65,000 个状态的新型结构检测基准等一系列环境中,未调整的权重在相同规划视界下与仅回报规划的性能相当或更优,避免了针对每个任务调整的奖励的过度探索,并位于成功-回报帕累托前沿的接近回报最大的拐点处。
实际回报是:一个开箱即用的探索目标。在故障检测和医学筛查等应用中,每项测试都有成本,每个遗漏的故障都有代价,EFE 提供了一种衍生而来的信念依赖效用,无需手动调整。
## 1 引言
在部分可观测条件下的决策要求智能体平衡利用当前知识与收集信息以减少隐藏状态的不确定性。在标准 POMDP 中,信息收集本身没有内在价值。它仅当能带来更高期望回报时才是有用的。这造成了一个众所周知的困难:探索-利用权衡必须通过规划视界或启发式探索奖励来解决。
ρ-POMDP 框架[1 (https://arxiv.org/html/2607.16981#bib.bib1)]通过引入一个信念依赖的效用 ρ(b) 来扩展 POMDP,从而允许智能体直接从其信念状态的属性中获取价值。这使得除了任务回报之外,还能显式优化不确定性减少、信息增益或其他信念状态属性。然而,ρ 的选择在很大程度上仍然是启发式的且依赖环境。
另一方面,主动推理 (AIF) 框架[12 (https://arxiv.org/html/2607.16981#bib.bib12),30 (https://arxiv.org/html/2607.16981#bib.bib30)]将感知和行动视为近似贝叶斯推断,选择最小化预期自由能 (EFE) 的策略。EFE 自然地分解为实用项(目标导向)和认知项(信息寻求)。由于两项均来自同一个变分目标,因此它们的相对尺度并非自由选择。在我们使用的离散状态公式中,当两项都以奈特(自然对数信息单位)度量时,预期信息增益的系数固定为 w=1(命题1 (https://arxiv.org/html/2607.16981#Thmproposition1))。该权重是推导的结果,而非超参数。
我们建议将 EFE 作为 ρ-POMDP 中的 ρ,从而得到一个智能体,其认知觅食行为是其目标的结果,而非工程化的奖励。111代码和实验数据可在 https://github.com/PatrickAllenCooper/rho_aif 获取。
我们的贡献包括:
1. 理论。在 ρ-POMDP 与主动推理之间建立一座正式桥梁。我们证明了对于先观测后决策的 POMDP 的等价性(命题1 (https://arxiv.org/html/2607.16981#Thmproposition1)),表征了规范权重何时接近最优(命题2 (https://arxiv.org/html/2607.16981#Thmproposition2)),并将等价性扩展到因子化观测 POMDP 以及信息收集不改变隐藏状态的交错设置(命题3 (https://arxiv.org/html/2607.16981#Thmproposition3))。
2. 证据。在六个先观测后决策环境和四个标准 RockSample 基准[41 (https://arxiv.org/html/2607.16981#bib.bib41)]实例上,与相同视界规划、调整后的信息增益和 POMCP[39 (https://arxiv.org/html/2607.16981#bib.bib39)]进行了受控比较。帕累托分析显示,w=1 在无需针对每个环境搜索的情况下帕累托优于相同视界规划。
3. 实践指导。刻画了 EFE 作为 ρ 何时能带来助益。当智能体必须在多个观测行动中做出选择时,优势就会出现,并且随着状态空间大小(Tileworld 8×8 上成功率 66.5% vs 2.5%)和观测行动数量(RockSample[7,8] 上奖励 +7.82)的增加而扩大。
## 2 相关工作
##### POMDP 与求解器。POMDP 形式化了状态不确定性下的序贯决策[40 (https://arxiv.org/html/2607.16981#bib.bib40),22 (https://arxiv.org/html/2607.16981#bib.bib22)]。精确解是 PSPACE 完全的。基于点的离线方法(PBVI[33 (https://arxiv.org/html/2607.16981#bib.bib33)]、HSVI[41 (https://arxiv.org/html/2607.16981#bib.bib41)]、SARSOP[23 (https://arxiv.org/html/2607.16981#bib.bib23)])在可达信念上近似值函数[38 (https://arxiv.org/html/2607.16981#bib.bib38)]。在线求解器从当前信念开始规划:POMCP[39 (https://arxiv.org/html/2607.16981#bib.bib39)] 使用带有 UCB1 和 rollout 评估的 MCTS,DESPOT[45 (https://arxiv.org/html/2607.16981#bib.bib45)] 搜索一个正则化的稀疏信念树,POMCPOW[42 (https://arxiv.org/html/2607.16981#bib.bib42)] 通过渐进式扩展示了 MCTS 以处理连续空间。所有这些方法都通过随机模拟隐式地探索,而非显式地评估信息增益。第6节 (https://arxiv.org/html/2607.16981#S6) 和附录0.T (https://arxiv.org/html/2607.16981#Pt0.A20) 展示了闭式信息价值评估的益处。
##### ρ-POMDP。Araya-López 等人 [1 (https://arxiv.org/html/2607.16981#bib.bib1)] 引入了 ρ-POMDP,在奖励中增加一个信念依赖的效用 ρ: Δ(S) → ℝ,因此目标变为 max_π E_π[∑_t γ^t (R(s_t, a_t) + ρ(b_t))]。当 ρ 是凸函数时,值函数保持分段线性凸 (PWLC),保留了与标准求解器的兼容性。
Fehr 等人 [10 (https://arxiv.org/html/2607.16981#bib.bib10)] 将其扩展到利普希兹连续的非凸 ρ,而 Benchetrit 等人 [3 (https://arxiv.org/html/2607.16981#bib.bib3)] 开发了用于连续空间 ρ-POMDP 的 ρ-POMCPOW。常见的 ρ 选择(熵减少、与目标信念的 KL 散度、信息增益)各自编码了不同形式的认知价值,但该选择仍然是启发式的且依赖环境。我们的贡献是从主动推理的变分界中推导出一个有原则的 ρ,从而无需针对每个环境搜索即可固定探索权重。
##### 信息价值和实验设计。信息具有可量化的决策理论价值这一概念早于 POMDP 和主动推理。Howard [20 (https://arxiv.org/html/2607.16981#bib.bib20)] 在决策分析中形式化了信息价值,而 Lindley [25 (https://arxiv.org/html/2607.16981#bib.bib25)] 将预期信息增益引入作为最优贝叶斯实验设计的一个准则。在赌博机设置中,信息导向采样 (IDS)[35 (https://arxiv.org/html/2607.16981#bib.bib35)] 通过最小化信息比率 Γ_t = δ_t² / g_t 来显式地权衡即时遗憾与信息增益,其中 δ_t 是期望遗憾,g_t 是信息增益。与 EFE 的关键结构区别在于,IDS 在每一步最小化该比率(一个适应当前信念的相对加权),而 EFE 将权重固定为 w=1(一个从变分界导出的绝对加权)。一个针对先观测后决策结构调整的 IDS 基线会很有信息量,但超出了本工作的范围。我们的先观测后决策结构与序贯贝叶斯实验设计类似,其中智能体在选择最终决策行动之前,通过选择实验(观测)来最大化关于未知状态的信息。将 ρ-POMDP 框架与 ρ = I(b) 相结合实现了这一联系。我们的贡献是展示 EFE 从第一原理出发为信息增益项导出了一个规范权重,而非将其视为一个可调参数。
##### 主动推理与 EFE。主动推理 (AIF) 框架[12 (https://arxiv.org/html/2607.16981#bib.bib12)] 将感知和行动视为变分自由能原理下的变分推断。Parr 等人 [31 (https://arxiv.org/html/2607.16981#bib.bib31)] 提供了一本全面的教材。Friston 等人 [13 (https://arxiv.org/html/2607.16981#bib.bib13)] 形式化了策略价值的外在(目标寻求)和认知(信息寻求)成分的分解,表明好奇心驱动的探索会自动从预期自由能最小化中产生。Da Costa 等人 [6 (https://arxiv.org/html/2607.16981#bib.bib6)] 从第一原理综合了离散状态 AIF,表明策略上的后验具有形式 Q(π) ∝ exp(-G(π)),其中 G 是预期自由能。Parr 和 Friston [30 (https://arxiv.org/html/2607.16981#bib.bib30)] 显示 EFE 分解为实用价值(与偏好观测的散度)和认知价值(预期信息增益),两者均来自同一个变分界,无需可调探索权重。尽管构造不同,EFE 和广义自由能产生相同的策略后验。EFE 的数学基础已被严格审视:Millidge 等人 [28 (https://arxiv.org/html/2607.16981#bib.bib28)] 表明,天真地将变分自由能扩展到未来不会产生探索行为,并提出了预期未来自由能 (FEEF) 作为具有更清晰数学基础的替代方案。Champion 等人 [5 (https://arxiv.org/html/2607.16981#bib.bib5)] 通过形式化在关于先验偏好的不同假设下,多个 EFE 公式如何与同一个根定义相关联,解决了“统一问题”。de Vries 等人 [8 (https://arxiv.org/html/2607.16981#bib.bib8)] 将基于 EFE 的规划重新构建为熵校正的变分推断与消息传递方案,提供了将 EFE 与变分消息传递联系起来的另一种推导。
##### 复杂推理。标准 AIF 短视地评估策略。Friston 等人 [14 (https://arxiv.org/html/2607.16981#bib.bib14)] 引入了复杂推理,这是一种递归扩展,实现了对信念轨迹(而非状态)的深度树搜索。复杂性(保持对未来信念的信念)使得能够对行动的后续认知后果进行反事实推理。Da Costa 等人 [7 (https://arxiv.org/html/2607.16981#bib.bib7)] 证明,该递归方案对于任何有限视界都能恢复贝尔曼最优策略,而标准 AIF 仅对单步规划实现最优性。我们的递归 EFE 智能体(公式3 (https://arxiv.org/html/2607.16981#S3.E3))源自该框架,并针对 ρ-POMDP 的决策行动结构进行了调整。对未来信念的反事实递归推理得以保留。变化在于,我们的先观测后决策设置不涉及时间步之间的状态转移,从而简化了信念轨迹的计算。
##### 扩展主动推理。具有完整策略枚举的离散状态 AIF 局限于小的状态-行动空间。已有几条工作线涉及扩展。Fountas 等人 [11 (https://arxiv.org/html/2607.16981#bib.bib11)] 将深度生成模型与蒙特卡洛树搜索相结合,用于连续状态空间中的 EFE 最优规划。Tschantz 等人 [44 (https://arxiv.org/html/2607.16981#bib.bib44)] 开发了一个与 RL 兼容的目标(预期未来自由能),它继承了 AIF 的探索-利用平衡,同时扩展到标准 RL 基准。Maisto 等人 [26 (https://arxiv.org/html/2607.16981#bib.bib26)] 将主动推理与大型 POMDP 的蒙特卡洛树搜索相结合,在 RockSample[41 (https://arxiv.org/html/2607.16981#bib.bib41)] 上取得了最先进的结果。我们的 MCTS-EFE 变体(第6节)遵循这一方向,在 MCTS 内使用 EFE 作为叶节点启发式,以将规划视界扩展到精确树搜索之外。
##### 探索、控制作为推断与内在动机。“控制作为推断”视角[43 (https://arxiv.org/html/2607.16981#bib.bib43),24 (https://arxiv.org/html/2607.16981#bib.bib24)] 将回报最大化视为变分推断。最大熵 RL[17 (https://arxiv.org/html/2607.16981#bib.bib17)] 和随机最优控制[34 (https://arxiv.org/html/2607.16981#bib.bib34)] 是算法实例。Millidge 等人 [27 (https://arxiv.org/html/2607.16981#bib.bib27)] 证明了 AIF 与“控制作为推断”之间的形式等价性。Sajid 等人 [36 (https://arxiv.org/html/2607.16981#bib.bib36)] 表明,内在动机行为在 EFE 下会自然出现。内在动机方法,包括好奇心[37 (https://arxiv.org/html/2607.16981#bib.bib37),32 (https://arxiv.org/html/2607.16981#bib.bib32)]、内在信号类型学[29 (https://arxiv.org/html/2607.16981#bib.bib29)]、贝叶斯惊奇[21 (https://arxiv.org/html/2607.16981#bib.bib21)]、基于计数的探索[2 (https://arxiv.org/html/2607.16981#bib.bib2)]、VIME[19 (https://arxiv.org/html/2607.16981#bib.bib19)] 和随机网络蒸馏[4 (https://arxiv.org/html/2607.16981#bib.bib4)],都需要可调的奖励权重。贝叶斯自适应 MDP[9 (https://arxiv.org/html/2607.16981#bib.bib9),16 (https://arxiv.org/html/2607.16981#bib.bib16)] 以及更广泛的贝叶斯 RL[15 (https://arxiv.org/html/2607.16981#bib.bib15)] 解决模型不确定性(未知动力学),这与我们在已知模型下关注状态不确定性不同。我们的 ρ-POMDP 形式主义精确了 EFE 与这些工作线之间的联系,继承了形式化属性(凸性、利普希兹连续性),同时从第一原理固定了探索权重。
## 3 方法
### 3.1 ρ-POMDP 框架
我们关注“先观测后决策”的 ρ-POMDP,其中行动集 A 划分为观测行动 A_obs(以已知成本更新信念,但不改变隐藏状态)和最终决策行动 A_com(结束情节并获得与状态相关的回报)。一个情节由一系列可变长度的观测行动后跟一个决策行动组成。隐藏状态在整个过程中保持不变。相似文章
基于互信息的多目标探索与偏好优化
提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。
主动推断是哪种类型的推断?
本文通过证明增广生成模型的变分自由能(VFE)可以分解为预测模型的VFE加上显式熵修正项,对基于期望自由能(EFE)的规划给出了完整的变分刻画。作者推导了一种用于EFE规划的消息传递方案,并在网格世界环境中进行了验证。
组熵控制策略优化
本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。
分布过程奖励模型:通过条件最优传输校准未来奖励的预测
本文引入了分布过程奖励模型,利用条件最优传输对 PRM 进行校准,以提高推理时缩放(inference-time scaling)中成功概率估计的准确性。该研究在 MATH-500 和 AIME 等数学推理基准测试中展示了改进的校准效果和下游性能。
PEBS: 每个评分者的经验贝叶斯收缩用于RLHF奖励模型校准
介绍PEBS,一种用于RLHF中奖励模型校准的每个评分者经验贝叶斯收缩估计器,在PRISM上将用户内RMSE降低了超过8.5%,在PluriHarms上降低了超过9.6%。