视角潜变量作为主动推理智能体中因果涌现的一个架构条件
摘要
本文研究了主动推理智能体中因果涌现的架构位置,发现一个慢速全局潜变量(g)是整合信息(Φr)的主要场所,并且标量Φr不应被解释为学习整合的直接度量。
arXiv:2607.20708v1 公告类型:新
摘要:近期的一系列工作通过整合信息分解来衡量强化学习智能体中的因果涌现,报告称$\Phi_r$随着训练增长并追踪奖励提升。对于主动推理,这就提出了一个问题:无奖励的预测组织如何与这些信息论特征相关联。我在一个主动推理智能体中对此进行测试,其架构将一个快速感知潜变量$z$与一个慢速全局潜变量$g$分开,其中$g$由预测误差驱动,并且在结构上与策略梯度解耦。在一个无奖励的环境模态切换协议中,$\Phi_r$集中在$g$中;其总体幅度主要是架构性的,并随训练而减小。学习的实质效应只有在原子组成层面才变得清晰:解耦使符号从负变为正,并在环境变化下变得模态不变,而下向因果则携带模态相关的调整。这些结果将$g$确定为主动推理智能体中与$\Phi_r$相关的时间组织的架构位点,并反对将标量$\Phi_r$解读为学习整合的直接指标。
查看缓存全文
缓存时间: 2026/07/24 05:14
# 主动推断智能体中作为因果涌现架构条件的视角潜变量
来源:https://arxiv.org/html/2607.20708
11institutetext:主动推断研究所,美国加州新月城
11email:hjpae@activeinference\.institute
###### 摘要
近期一系列工作通过集成信息分解测量强化学习智能体中的因果涌现,报告称 \(\Phi_r\) 随训练增长并与奖励改善同步。对于主动推断,这引发了关于无奖励预测组织如何与这类信息论特征相关的问题。我在一个主动推断智能体内对此进行测试,该智能体的架构将快速感知潜变量 \(z\) 与慢速全局潜变量 \(g\) 分离,其中 \(g\) 由预测误差驱动,并在结构上与策略梯度解耦。在一个无奖励的环境状态切换协议中,\(\Phi_r\) 集中于 \(g\);其聚合幅度主要由架构决定,并随训练而降低。学习的具体效应仅能在原子-组成层面被解读:解耦从负值翻转为正值,并在环境变化下呈现状态不变性,而下向因果则承载着状态依赖的调整。这些结果将 \(g\) 识别为主动推断智能体中与 \(\Phi_r\) 相关的时间组织的架构位点,并反对将标量 \(\Phi_r\) 直接视为习得整合的直接指标。
## 1 引言
近期工作利用集成信息分解(\(\Phi\)ID)[7, 8]——这是从集成信息传统[17, 1]扩展到因果涌现框架[4, 16]的方法——来分析训练后强化学习智能体的潜动态,报告称由 \(\Phi_r\) 测量的慢速整合组织随训练增长,并与奖励改善全局对齐[15]。这使 \(\Phi_r\) 成为智能体整合的一个候选经验签名:即智能体内部状态作为一个连贯整体而非独立部分的集合来预测自身未来的程度。然而,这类分析检测到了慢速整合模式,却未指明其架构位点。因此我提出疑问:在单个智能体内,是什么架构位点产生了 \(\Phi_r\) 所检测到的慢速整合模式?
一个自然的候选者来自关于主动推断智能体中“视角潜变量”的独立工作路线。对主观性的现象学描述长期以来强调,任何主观体验都从一个视角立场出发[5, 9, 19]。这可以被解释为一个缓慢演化的、对历史敏感的“条件”,在此条件下世界才呈现为有意义的、威胁性的或平凡的。近期主动推断工作将类似结构形式化为慢速潜变量,锚定智能体随时间对世界的解释立场。我在此采用的架构引入了一个慢速潜变量 \(g\),由环境预测误差最小化驱动,且与策略梯度解耦,并证明了 \(g\) 在状态变化下表现出滞后性,并基于累积历史重组感知编码[11, 12, 10]。本文旨在探究 \(g\) 是否是 \(\Phi_r\) 所检测到的位点。
本文不重新评估该智能体的行为表型,而是将继承的架构视为固定测试案例,并询问与 \(\Phi_r\) 相关的时间组织出现在其内部的何处。这一测试在一个无奖励的状态切换协议中进行,在30个随机种子上计算快速感知潜变量 \(z\) 和慢速视角潜变量 \(g\) 上的 \(\Phi_r\)。三个对照锚定分析:(1) 序列内时间混合(分离时间结构),(2) 未训练架构基线(分离学习),(3) 状态切换前后比较(测试原子层面的适应性)。为进一步描述整合位点的特征,\(\Phi_r\) 还被分解为三个理论基础的原子组,遵循[16]:(i) 解耦,(ii) 下向因果,(iii) 部分驱动贡献。
基于视角框架,得出三个预测。首先,由于 \(g\) 是架构中一个对历史敏感的GRU门控潜变量,\(\Phi_r\) 应集中于 \(g\) 而非 \(z\)。其次,由于已在奖励驱动学习下报告 \(\Phi_r\) 随训练增长[15],或许在本文使用的无奖励预测误差目标下也能观察到类似增长,训练后的 \(\Phi_r(g)\) 应超过未训练基线。第三,环境状态切换应在 \(\Phi_r(g)\) 的原子组成中留下可测量的痕迹,这与先前报告的对 \(g\) 的历史敏感性[11]一致。
第一个和第三个预测得到了下文分析的支持。第二个预测则产生了更具信息性的反转:\(\Phi_r(g)\) 并非简单随训练增长,而学习的实质性效应仅在 \(\Phi_r\) 分解为其组成原子组时才变得可见。解缠这些原子组揭示了一个标量 \(\Phi_r\) 单独无法捕捉的结构性转变。
#### 关键贡献。
(1) **经验位点**。视角架构中的 \(\Phi_r\) 集中于慢速潜变量 \(g\) 而非快速潜变量 \(z\)。
(2) **架构 vs. 学习**。聚合 \(\Phi_r(g)\) 主要由循环架构本身提供;学习降低了这一幅度。
(3) **原子层面分离**。学习将解耦从负值转变为正值,并使其近似状态不变,而下向因果则保持状态适应性。
## 2 实验方法
### 2.1 智能体架构与模拟环境
智能体实现及其模拟环境直接继承自[11],除分析侧的控制旋钮外未做任何添加。在该智能体中,视角层和动作策略层在结构上是分离的:视角层回答“我相信自己仍处于什么样的世界?”,而策略层回答“我现在应该做什么?”[11]。
图1:智能体架构概览(继承自[11])。快速感知潜变量 \(z_t\) 和慢速全局“视角”潜变量 \(g_t\) 输入动作策略 \(\pi\),而 \(g_t\) 在结构上与策略梯度解耦。本研究分析了这些潜轨迹的 \(\Phi_r\) 结构。
遵循主动推断原则,智能体学习最小化其环境预测误差。智能体在一个无奖励的 \(15 \times 9\) 二维网格世界中行动,该世界有三个不同的环境生态位样区域,由区域特定的观测噪声区分:\((\sigma_0, \sigma_1, \sigma_2) = (0.6, 0.3, 0.05)\)。因此,最左侧区域的环境预测更困难,最右侧区域更容易,使得智能体倾向于向右而非向左移动。重要的是,未提供奖励信号;主要表征信号是感知重建上的一步预测误差。这符合主动推断在感知和世界建模层面的原则,而策略选择通过习得的actor损失而非预期自由能最小化进行训练;但请注意,本文的主张涉及架构的感知和世界建模一侧,而非动作选择动态。
观测编码器将智能体的局部环境(二维网格世界中的8个相邻格子)与先前动作的嵌入编码 \(p_t \in \mathbb{R}^8\)(覆盖5个动作:上/下/左/右/停留)映射为快速潜变量 \(z_t\)。架构上的关键在于,\(z_t\)(扮演即时感知角色)与 \(g_t\)(扮演全局尺度的“视角”,在区域层面注册并预测环境)的分离。\(g_t\) 通过一个从 \((z_t, p_t)\) 更新的阻尼GRU模块积累历史;该路径的参数通过一步预测目标和 \(g_t\) 平滑正则化器进行训练。一个状态头将 \(z_t\)、\(p_t\) 和 \(g_t\) 组合为策略状态 \(s_t\),后者输入一个覆盖5个动作的离散动作策略 \(\pi(a_t \mid s_t)\)。在所有实验中,维度固定为:\(z_t \in \mathbb{R}^{16}\),\(p_t \in \mathbb{R}^{8}\),\(g_t \in \mathbb{R}^{12}\),\(s_t \in \mathbb{R}^{16}\)。架构概览如图1所示。
重要的是,\(g_t\) 通过停止梯度算子与策略梯度在结构上解耦,这些算子切断了策略或actor损失可能流回 \(g_t\) 的路径。因此,\(g_t\) 主要由全局预测连贯性而非actor侧梯度塑造。
### 2.2 训练协议
每个种子训练48,000个环境步骤,使用Adam优化器,学习率为 \(3 \times 10^{-4}\),每个episode 240步;这对应于每个种子200个episode,产生 \(z_t\) 和 \(g_t\) 的网络权重跨episode边界延续。总共运行了30个种子。
训练目标(损失函数)遵循[11],结合了四项:
\[
\mathcal{L} = \mathcal{L}_{\text{pred}} + w_{\text{smooth}} \mathcal{L}_{\text{smooth}} + w_{\text{actor}} \mathcal{L}_{\text{actor}} - w_{\text{entropy}} \mathcal{H}(\pi)
\]
其中 \(\mathcal{L}_{\text{pred}}\) 是感知重建上的一步预测误差(主信号),\(\mathcal{L}_{\text{smooth}}\) 是对 \(g_t\) 的时间平滑正则化项,\(\mathcal{L}_{\text{actor}}\) 是actor风格的一致性成本(通过指数移动基线实现,系数 \(\beta=0.98\)),\(\mathcal{H}(\pi)\) 是策略熵。损失权重完全继承自[11]:\(w_{\text{smooth}}=0.25\),\(w_{\text{actor}}=0.25\),\(w_{\text{entropy}}=0.001\)。actor项仅在12,000步预热后才启用,让预测主干和 \(g\) 动态在actor侧优化引入前稳定下来。通过停止梯度算子,actor侧梯度被阻止流入 \(g_t\),因此actor目标塑造 \(\pi\) 和 \(s_t\),但不塑造 \(g_t\) 本身。
### 2.3 分析协议
在分析中,使用训练后的权重在同一环境下记录回放 rollout。每个回放 episode 运行 \(T=500\) 步,前80步作为预热丢弃。训练和回放之间的架构本身相同;仅状态切换仪器化和episode长度(\(T=500\) vs. \(T=240\))不同。
#### 回放条件。
分析两个条件:**控制条件**,其中区域方差在整个过程中固定为训练时的值;以及**状态切换条件**,其中环境区域的观测噪声在 \(t=320\) 时从 \((\sigma_0, \sigma_1, \sigma_2) = (0.6, 0.3, 0.05)\) 翻转为 \((0.05, 0.3, 0.6)\),定义切换前窗口 \(80 < t \leq 320\) 和切换后窗口 \(t > 320\)。每个种子在每个条件下通过随机动作采样收集10个回放episode,在30个种子上总共得到 \(n=300\) 个episode per条件。对于状态切换分析,\(\Phi_r(g)\) 及其原子组分解分别在切换前窗口和切换后窗口上计算。
#### 对照分析。
两个额外的对照分离了对观测信号的贡献。**序列内时间混合**:在每个episode内随机置换 \(g_t\) 的时间索引(每个episode平均三次独立混合),保留其边际分布但破坏所有时间顺序。这分离了时间结构与边际分布的贡献。**未训练架构基线**:实例化相同的架构和超参数,但采用随机初始化(随机种子与训练检查点不同)且不进行训练,回放协议与训练情形相同。这分离了学习与架构本身的贡献。
#### 统计分析。
配对比较使用Student配对t检验(基于episode层面的估计或episode内切换前/后差异),非配对组比较使用Welch异方差t检验。效应量在有信息时报告为Cohen's d。所有p值均为双侧,显著性水平 \(\alpha=0.05\)。代码和数据可在 https://github.com/hjpae/perspective-causal-emergence 获取。
### 2.4 \(\Phi_r\) 计算
为测量潜轨迹的时间信息结构,我计算 \(\Phi_r\),这是一个基于 \(\Phi\)ID [7, 8] 的估计量,改编自[15]中使用的实现。该估计量是局部的、逐点的,即每个时间步计算原子值,允许取负值,并通过时间上的中位数进行汇总。因此,它不同于[16]用于将因果解耦定义为标量系统层面属性的非负协同通道构建。在下文中,我借用[16]的原子分类法,但不借用其非负约束。因此,本研究中的符号变化应解读为对应原子局部逐点贡献的变化,而非Rosas风格非负指数的变化。
本分析的目的是探究与 \(\Phi_r\) 相关的时间组织出现在架构中的何处,以及其组成如何随学习和状态切换变化。对于一个多元潜轨迹 \(X = [x_1, ..., x_T]\),其中 \(x_t \in \mathbb{R}^d\),轨迹首先排列为 \(d \times T\) 矩阵,并通过修正的z-score程序按维度标准化(该程序在标准化前向接近常量的单元注入小噪声)。然后计算跨潜维度的滞后1高斯互信息矩阵 \(M\),采用高斯copula方法进行互信息估计[6]。相似文章
可观测模式并非解释:隐式推理模型的因果几何分析
本文分析了隐式推理模型(LRM),并论证隐状态中的可观测模式并非推理的因果解释;它倡导在可解释性研究中采用匹配对照和因果测试。
信念还是电路?上下文图学习的因果证据
本文使用主成分分析(PCA)和激活补丁等机制可解释性方法,在一个图随机游走任务上探究了大型语言模型是通过潜在结构推断还是局部模式匹配来进行上下文学习。
代理时代的因果发现
本文认为,语言模型代理应通过提供上下文支持和解释来辅助因果发现工作流程,而非生成因果结论,并介绍了causal-learn+平台以演示这一原则。
为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势
本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。
基于身体的人工代理视角形成与意动调适
本文提出了一种用于人工代理的基于身体的视角形成的最小架构,通过引入内感受生存能力信号和意动对齐机制来扩展先前工作,从而从现象学角度将机器主体性操作化。