生成式递归推理

arXiv cs.AI 论文

摘要

本文介绍了生成式递归推理模型(GRAM),这是一个概率框架,通过支持随机潜在轨迹、多个假设以及通过深度和并行采样实现推理时缩放,扩展了递归推理模型。

arXiv:2605.19376v1 Announce Type: new 摘要:未来的神经推理系统应如何实现扩展计算?递归推理模型(RRM)通过使用共享转移函数执行迭代潜在状态细化,为自回归序列扩展提供了一种有前景的替代方案。然而,现有的RRM大多是确定性的,遵循单一的潜在轨迹并收敛到一个单一预测。我们引入了\emph{生成式递归推理模型(GRAM)},这是一个将递归潜在推理转化为概率性多轨迹计算的框架。GRAM将推理建模为随机潜在轨迹,支持多个假设、替代解决策略,以及通过递归深度和并行轨迹采样进行推理时缩放。这产生了一个潜变量生成模型,支持通过$p_\theta(y \mid x)$进行条件推理,以及在输入固定或缺失的情况下通过$p_\theta(x)$进行无条件生成。通过摊销变分推理训练,GRAM在结构化推理和多解约束满足任务上优于确定性循环和递归基线,同时展示了无条件生成能力。\href{https://ahn-ml.github.io/gram-website/}{https://ahn-ml.github.io/gram-website}
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:28

# 生成式递归推理模型

来源:https://arxiv.org/html/2605.19376

Junyeob Baek1† Mingyu Jo1†∗ Minsu Kim1,2 Mengye Ren3 Yoshua Bengio2,4 Sungjin Ahn1,3  
1KAIST 2Mila – Québec AI Institute 3New York University 4Université de Montréal  
* 同等贡献  
通讯作者:Junyeob Baek \(wnsdlqjtm@kaist\.ac\.kr\),Mingyu Jo \(mingyu\.jo@kaist\.ac\.kr\),Sungjin Ahn \(sungjin\.ahn@kaist\.ac\.kr\)

###### 摘要

未来的神经推理系统应如何实现扩展计算?递归推理模型(RRMs)通过使用共享的转换函数进行迭代的隐状态精化,为自回归序列扩展提供了一种有前景的替代方案。然而,现有的 RRMs 在很大程度上是确定性的,仅遵循一条隐轨迹并收敛到一个单一预测。我们提出**生成式递归推理模型(GRAM)**,这是一个将递归隐推理转化为概率性多轨迹计算的框架。GRAM 将推理建模为随机隐轨迹,支持多种假设、替代求解策略,并通过递归深度和并行轨迹采样实现推理时扩展。这构建了一个隐变量生成模型,支持通过 \(p_\theta(y \mid x)\) 进行条件推理,并在输入固定或缺失时,通过 \(p_\theta(x)\) 进行无条件生成。通过摊销变分推断训练,GRAM 在结构化推理和多解约束满足任务上优于确定性递归和基准递归模型,同时展示了无条件生成能力。

https://ahn-ml.github.io/gram-website/

## 1 引言

未来神经推理系统的一个核心问题是应如何实现扩展计算。大型自回归模型通常通过扩展序列生成过程来扩展推理,无论中间计算是显式地表示为思维链 token,还是隐式地表示在隐藏或隐表示中\[1 (https://arxiv.org/html/2605.19376#bib.bib1),2 (https://arxiv.org/html/2605.19376#bib.bib2),3 (https://arxiv.org/html/2605.19376#bib.bib3),4 (https://arxiv.org/html/2605.19376#bib.bib4),5 (https://arxiv.org/html/2605.19376#bib.bib5),6 (https://arxiv.org/html/2605.19376#bib.bib6)\]。递归推理模型(RRMs)探索了一个互补的方向,它们使用重复计算来精化一个持久的隐状态,而不是向输出或推理序列追加新元素\[7 (https://arxiv.org/html/2605.19376#bib.bib7),8 (https://arxiv.org/html/2605.19376#bib.bib8),9 (https://arxiv.org/html/2605.19376#bib.bib9)\]。这种方法颇具吸引力,因为它将推理深度与参数规模和输出长度解耦:一个紧凑的模型可以通过随时间重复应用共享的转换函数来执行多步内部计算。最近的递归推理模型如 HRM\[8 (https://arxiv.org/html/2605.19376#bib.bib8)\] 和 TRM\[9 (https://arxiv.org/html/2605.19376#bib.bib9)\] 为这种方法在结构化推理中的潜力提供了早期证据。它们并非通过单次前馈传递产生解,而是通过迭代隐状态精化、跨精化步骤的深度监督,以及诸如层次隐动态等面向推理的循环设计,来执行扩展计算。这些特性使其非常适合需要约束传播、状态追踪、迭代校正和多步推理的问题。更广泛地说,它们建立在通用 Transformer\[10 (https://arxiv.org/html/2605.19376#bib.bib10)\] 和循环 Transformer\[7 (https://arxiv.org/html/2605.19376#bib.bib7)\] 等循环 Transformer 架构所探索的原理之上:共享的 Transformer 块可以重复应用以增加计算深度,而无需增加参数数量。这些模型共同表明,推理能力不仅可以从扩展模型规模或生成更长的轨迹中涌现,还可以从计算本身的组织中涌现。

参见说明
图1:隐推理轨迹比较。左:N皇后示例,有两个有效解。右:给定隐推理的三个独立运行 (τ1, τ2, τ3): (a) 先前的 RRMs(如 HRM, TRM)是确定性的——所有运行都汇聚到相同的轨迹,收敛到单一解,未能探索替代解;而 (b) GRAM 探索多样化的轨迹,产生多样化轨迹,达到多个有效解 y1 和 y2,同时自然支持并行推理时扩展。

虽然循环隐状态精化为有效增加推理深度提供了一种有吸引力的机制,但对许多推理问题而言,仅靠深度是不够的。一个强大的推理系统还应能够保持不确定性、考虑替代假设并探索多种可能的求解策略\[11 (https://arxiv.org/html/2605.19376#bib.bib11),12 (https://arxiv.org/html/2605.19376#bib.bib12)\]。这在歧义或多个有效解是固有的场景中尤为重要,更普遍的是在单一精化路径可能陷入次优推理轨迹的问题中。从这个意义上说,未来的 RRMs 不仅应该是深的(在重复精化的意义上),还应该是宽的(在并行保持和探索多条隐轨迹的意义上)。然而,现有的 RRMs\[7 (https://arxiv.org/html/2605.19376#bib.bib7),8 (https://arxiv.org/html/2605.19376#bib.bib8),9 (https://arxiv.org/html/2605.19376#bib.bib9),10 (https://arxiv.org/html/2605.19376#bib.bib10)\] 从根本上说仍然是确定性的:给定相同的输入和初始化,它们遵循一条单一的隐轨迹并收敛到一个单一预测。这种确定性递归将合理的推理路径空间压缩成一个单一吸引子,在 RRM 范式内留下了概率性多假设隐推理的空白。这激发了我们工作的核心问题:递归隐计算能否支持概率性、生成式、多假设的推理,同时保持紧凑循环模型的效率?

在本文中,我们提出生成式递归推理模型(GRAM),一个将递归隐推理转化为概率性多轨迹计算的框架。GRAM 将推理过程本身视为随机隐轨迹:在每个递归步骤,模型以输入和当前推理状态为条件采样一个转换,而不是确定性地更新到单一下一个状态。重复此过程定义了可能推理轨迹上的一个分布,允许模型保持多个假设、探索替代求解策略,并不仅通过增加递归深度,而且通过并行采样轨迹来扩展推理。从概率角度看,GRAM 是一个隐变量生成模型:它通过对隐推理轨迹进行边际化来建模 \(p_\theta(y \mid x)\),同时当输入固定或缺失时,相同的递归过程也可以定义无条件生成模型 \(p_\theta(x)\)。

我们在受控推理和生成任务上评估 GRAM,这些任务作为对我们公式所针对架构特性的探测:递归精化、随机探索、多解覆盖和推理时扩展。鉴于此目标,我们的实验侧重于与最相关的确定性递归和隐推理基线进行比较,包括 Looped Transformers、HRM 和 TRM,而不是前沿规模的通用 LLM,因为后者的训练数据、推理预算和外部脚手架无法直接比较。Sudoku-Extreme\[8 (https://arxiv.org/html/2605.19376#bib.bib8)\] 和 ARC-AGI\[13 (https://arxiv.org/html/2605.19376#bib.bib13),14 (https://arxiv.org/html/2605.19376#bib.bib14)\] 测试在硬约束和抽象变换下的结构化推理;N皇后和图着色评估多解恢复;二值化 MNIST\[15 (https://arxiv.org/html/2605.19376#bib.bib15)\] 探测无条件生成解释。

我们的主要贡献是确立概率性多轨迹递归作为未来循环和递归推理架构的设计原则。具体而言,我们做出三个贡献。首先,我们将递归推理公式化为一个隐变量生成过程,其中解通过对随机推理轨迹进行边际化得到。其次,我们引入基于宽度的推理时扩展,使推理不仅可以随递归深度扩展,还可以随采样的隐轨迹数量扩展。第三,我们提供经验证据表明,该公式相对于确定性循环和递归基线产生了预期的架构优势,改进了结构化推理、多解约束满足和无条件生成。

## 2 生成式递归推理模型

在本节中,我们介绍生成式递归推理模型(GRAM),这是概率性递归推理的一个实例化。我们在第2.1节描述架构,在第2.2节描述训练过程,架构示意图见图2。

### 2.1 架构

参见说明
图2:GRAM 架构。在层次实例化中,一个单一的随机隐转换 \(z=(h,l)\)。经过 \(K\) 次低层精化 (通过 \(f_\mathrm{L}\)) 后,高层更新 \(f_\mathrm{H}\) 产生一个确定性提议 \(u_t\),并对其添加随机引导 \(\epsilon_t\):\(h_t = u_t + \epsilon_t\)。

**概述。** GRAM 通过对随机隐推理轨迹进行边际化来建模条件分布 \(p_\theta(y \mid x)\)。给定输入 \(x\),GRAM 首先计算一个嵌入
\[
e_x = f_{\mathrm{enc}}(x; \theta),
\]
(1)
该嵌入在整个递归计算中重复使用。从一个固定的初始隐状态 \(z_0\) 开始,模型通过学习到的随机转换来演化隐状态。递归计算组织为两个嵌套层级:内层循环和外层循环。在内层,一个**隐转换**以先前的隐状态和输入嵌入为条件采样一个新的隐状态,
\[
z_t \sim p_\theta(z_t \mid z_{t-1}, e_x), \quad t = 1, \dots, T.
\]
(2)
在 \(T\) 次转换结束时,解码器产生一个预测,\(\hat{y} = \operatorname*{arg\,max} f_{\mathrm{dec}}(z_T; \theta)\)。我们称从初始状态 \(z_0\) 到最终状态 \(z_T\) 的 \(T\) 次转换序列为一个**监督步骤**。一个监督步骤是调用解码器并应用训练目标的单位,梯度计算如第2.2节所述。在外层,递归应用 \(N_{\mathrm{sup}}\) 个监督步骤,一个监督步骤的最终状态作为下一个的初始状态,从而形成完整的递归计算:
\[
z_0^{(1)} \xrightarrow{\;T\text{ 次转换}\;} z_T^{(1)} = z_0^{(2)} \xrightarrow{\;T\text{ 次转换}\;} \cdots \xrightarrow{\;T\text{ 次转换}\;} z_T^{(N_{\mathrm{sup}})},
\]
(3)
其中 \(z_t^{(n)}\) 表示第 \(n\) 个监督步骤中第 \(t\) 次转换的隐状态,\(z_0^{(1)}\) 是固定的初始状态,一个监督步骤的终止状态作为下一个的初始状态 (\(z_0^{(n+1)} := z_T^{(n)}\))。这个抽象公式可以用各种循环 Transformer 主干进行实例化,包括平面设计如 Universal Transformers 和 Looped Transformers\[10 (https://arxiv.org/html/2605.19376#bib.bib10),7 (https://arxiv.org/html/2605.19376#bib.bib7)\],以及层次设计如 HRM 和 TRM\[8 (https://arxiv.org/html/2605.19376#bib.bib8),9 (https://arxiv.org/html/2605.19376#bib.bib9)\]。

**随机隐转换。** 与先前确定性更新隐状态并遵循单一固定轨迹的递归推理模型 (RRMs) 不同\[8 (https://arxiv.org/html/2605.19376#bib.bib8),9 (https://arxiv.org/html/2605.19376#bib.bib9)\],GRAM 将 \(p_\theta(z_t \mid z_{t-1}, e_x)\) 定义为一个随机转换,使得重复计算在隐推理轨迹上诱导出一个分布。具体地,GRAM 将此转换实现为确定性更新周围的一种学习到的随机残差扰动:在每个转换中,模型首先从 \(z_{t-1}\) 和 \(e_x\) 计算一个确定性更新 \(u_t\),然后从一个状态依赖的高斯分布中采样一个条件扰动,并将其加到 \(u_t\) 上:
\[
\epsilon_t \sim p_\theta(\epsilon_t \mid u_t) := \mathcal{N}\!\left(\mu_\theta(u_t), \,\sigma_\theta^2(u_t)I\right),
\]
(4)
\[
z_t = u_t + \epsilon_t.
\]
(5)
我们称 \(\epsilon_t\) 为**可学习的随机引导**。均值 \(\mu_\theta(u_t)\) 编码了一个状态依赖的方向,轨迹沿该方向被引导,而方差 \(\sigma_\theta^2(u_t)\) 控制探索量。这种设计使 GRAM 能够捕获不确定性、防止收敛到局部最小值,并支持对解空间的鲁棒探索,而不会丢弃由 \(u_t\) 执行的确定性精化。

**层次实例化。** 我们使用两个交互组件实例化隐状态,\(z=(h,l)\)。高层组件 \(h\) 在每个隐转换中更新一次,携带抽象推理状态,而低层组件 \(l\) 在单个转换内更新 \(K\) 次,携带细粒度中间计算。这种分解将两个角色跨时间尺度分离,\(h\) 跨转换缓慢累积,\(l\) 在每个转换内快速精化。使用这种层次多尺度结构,单个转换 \(z_{t-1} \to z_t\) 计算如下。低层组件首先进行 \(K\) 次精化更新,保持高层组件固定:
\[
l_{t,k} = f_{\mathrm{L}}(h_{t-1}, l_{t,k-1}, e_x; \theta), \quad k = 1, \dots, K,
\]
(6)
其中 \(l_{t,0} := l_{t-1}\),我们记 \(l_t := l_{t,K}\) 为精化后的低层组件。然后,以精化后的 \(l_t\) 为条件,高层组件被更新为随机转换:
\[
u_t = f_{\mathrm{H}}(h_{t-1}, l_t; \theta),
\]
(7)
\[
\epsilon_t \sim p_\theta(\epsilon_t \mid u_t) := \mathcal{N}\!\big(\mu_\theta(u_t), \,\sigma^2_\theta(u_t)\,I\big),
\]
(8)
\[
h_t = u_t + \epsilon_t,
\]
(9)
并设 \(z_t = (h_t, l_t)\)。注意随机性仅引入在高层。

相似文章

图原生强化学习通过概念重组实现可追溯的科学假设生成

arXiv cs.AI

本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。

自然语言推断的多粒度推理

arXiv cs.CL

提出了一种多粒度推理网络(MGRN),该网络显式利用层次语义特征进行自然语言推断,在多个基准测试中优于强基线模型。