150M参数循环模型以每任务0.0007美元的成本在ARC-AGI-1上取得29.5%的成绩

Reddit r/LocalLLaMA 论文

摘要

本文介绍了BDH-CQ,一个150M参数的循环模型,它结合了上下文学习和潜在推理,以每任务0.0007美元的成本在ARC-AGI-1上取得了29.5%的成绩,为成本效率树立了新标准。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/14 21:43

# BDH-CQ:基于循环潜在推理的上下文学习模型
来源:https://arxiv.org/html/2608.09888

###### 摘要

我们提出BDH-CQ,这是一种结合上下文学习与循环潜在推理的推理模型。推理时输入的信息持续更新模型的循环记忆;随后模型通过在高维潜在空间中的迭代计算求解查询,无需将其推理中间过程语言化。我们在公开的ARC-AGI-1评估集上评估该模型,并通过受控的类ARC干预实验,研究其从演示中学习的内容、推断变换的一致性应用程度,以及仍具挑战性的概念。一个1.5亿参数配置在每任务计算推理成本0.0007美元(不到十分之一美分)下,达到29.5%的pass@2通过率。该运行点突破了先前报告的ARC-AGI-1成本-精度帕累托前沿,确立了基准成本效率的新技术标杆。

## 1引言

上下文学习使模型能够从推理时呈现的示例中获取新技能(Brown等人,2020)。在自回归语言模型中,思维链提示通过提供计算工作空间来补充这一能力:演示指明要做什么,而生成的中间词元则为执行所需计算提供支持(Nye等人,2021;Wei等人,2022)。基于可验证问题的强化学习使这一组合日益强大,能引导出长推理轨迹、自我验证和自适应解决方案策略(DeepSeek-AI等人,2025)。但它也将推理与序列化叙述耦合在一起。随着推理轨迹的增长,词元消耗、延迟和推理计算量也随之增加。每个中间状态都必须通过离散词汇表进行投影,以自回归方式生成,并在继续计算前再次被消费。

潜在推理开启了不同的计算范式。模型不再语言化每个中间结果,而是反复变换其连续隐藏状态,仅解码最终答案。这移除了自然语言词元作为内部计算强制表示的要求,使状态能够保留部分假设或候选变换而无需将每个假设序列化。连续思维和循环深度模型表明,这种计算形式通过并行探索多条解题路径,能够实现高级推理(Hao等人,2024;Geiping等人,2025;Saunshi等人,2025)。这种分离也与人类概念推理和语言部分依赖不同系统的证据相符(Fedorenko和Varley,2016)。

然而,潜在推理和上下文学习在很大程度上是分别发展的。思维链推理语言模型能从上下文中灵活学习,但通常通过生成词元来分配额外计算。紧凑的递归求解器在潜在空间中迭代推理,但其ARC流程通过优化和特定任务标识来学习评估任务(Wang等人,2025;Jolicoeur-Martineau,2025;ARC Prize Foundation,2025)。它们无法仅从推理期间的演示中获取未见过的变换。

我们提出BDH-CQ,一个将这些能力结合的推理系统。对先前未见任务的演示更新循环记忆;随后通过在高维潜在工作空间中的迭代计算求解查询。中间推理状态不会被解码为语言。BDH-CQ使记忆、适应和推理成为统一计算结构的一部分。任务标识符和评估任务演示对均不参与训练,且推理时无参数更新。一个1.5亿参数配置在每任务计算成本0.0007美元下,在ARC-AGI-1上达到29.5%的pass@2通过率,突破了先前报告的成本-精度帕累托前沿。

我们使用抽象与推理语料库作为评估和实验基底(Chollet,2019)。ARC通过稀疏演示指定新的视觉变换,并要求精确输出,使学习和规则一致性可直接检验。我们使用术语*演示条件算子模式*来描述当演示为当前任务绑定可重用视觉操作时产生的行为。受控实验测试了此类模式能绑定何种内容、能外推到何种程度、哪些模式可相互组合,以及其执行在何处失败。

我们的贡献包括:

- 我们引入了BDH-CQ,它通过演化循环记忆实现上下文学习,并在结构化连续潜在空间中进行迭代推理。
- 我们在公开的ARC-AGI-1成本-精度前沿上建立了新的技术标杆:在每任务计算成本0.0007美元下达到29.5%的pass@2通过率,并描述了用于训练系统的类ARC数据混合方式。
- 我们绘制了按概念组织的变换族的能力和失败模式,区分了孤立正确输出与一致规则应用。
- 我们使用受控的类ARC任务测试了新推理系统能从演示中学习和表达的概念。

最后,我们概述了如何通过模型扩展、更长训练、语言和数学推理、约束满足以及更困难的ARC任务来扩展相同架构。

本文首先描述系统及其训练,然后呈现评估和行为分析。评估集的行为分析见附录。

## 2ARC作为BDH-CQ上下文泛化的受控可验证测试平台

ARC旨在研究*技能获取效率*:不仅系统是否具备某项技能,还包括获取该技能所需多少经验和先验结构(Chollet,2019)。每个任务仅通过少数演示指定新变换。系统必须推断哪些对象、关系和操作对推导变换规则至关重要,并将得到的规则应用于新输入。因此,ARC将上下文学习旨在提供的快速泛化操作化。

这种任务格式也使BDH-CQ的行为易于受控分析。演示构成任务规范,而小型彩色网格几乎不需要事实知识或语言流利度。但它们能表达对象关系、计数、对称性、拓扑、空间变换和组合。每个答案都可精确验证,每个失败都可视觉检查,且多个测试输入能揭示规则是被一致应用而非仅猜测一次(Chollet等人,2024)。

图1展示了此任务。输入包含两个由灰色列分隔的二进制面板。从演示中,系统必须推断输出标记了两个面板中都被占用的单元格,并将此关系转移到查询中。输入中没有提及交集、对齐或输出颜色的含义。

参见标题 图1:一个ARC-AGI-1训练任务(标识符0520fde7)。展示了三个演示中的两个和保留的查询;此处包含查询输出用于解释。任务紧凑、精确且易于检查,但其变换必须从示例中推断。ARC为我们提供了一种受控的视觉语言,可以一起研究上下文学习、潜在计算、精确执行和推理成本。

## 3介绍BDH-CQ:通过循环记忆和潜在推理实现上下文学习

### 3.1 BDH的起源

我们之前介绍了Dragon Hatchling(BDH),这是一种后Transformer序列模型架构,围绕高维正激活、低秩通信和循环关联状态构建(Kosowski等人,2025)。其面向GPU的公式使用BDH层,该层在大型神经元或特征空间中结合了ReLU低秩变换与线性注意力。该设计受大脑启发但非大脑模仿。它汲取了生物学正确的原则,即局部交互、稀疏活动、持久状态和持续调整,并将其应用于现代序列模型。那项工作确立了BDH的语言、序列建模和可解释性特性。

BDH层还支持用于约束满足的循环系统。我们的数独系统迭代地细化视觉状态,直到满足谜题约束(Pathway Research,2025)。BDH-CQ将这一脉络扩展到新的推理系统,它将结构化潜在工作空间和模型深度上的循环计算与从演示学习视觉变换的接口相结合。我们使用“BDH”指代架构家族,“BDH-CQ”指代此处介绍的系统。完整的评估系统包括输入变换、候选构建、排序和推理流程。

### 3.2 通过循环记忆实现上下文学习

设任务提供演示 \(D=\{(x_t, y_t)\}_{t=1}^K\) 和查询输入 \(x^\star\)。BDH-CQ不是将演示压缩为单个任务向量,而是顺序处理其元素。其循环记忆演化过程可概括为:

\(S_t = U_\theta(S_{t-1}, D_t)\), (1)

其中 \(D_t\) 表示第 \(t\) 个演示的内容,\(\theta\) 保持固定。因此,后续输入可用的信息取决于从先前输入和输出中积累的关联。这种循环上下文状态的作用类似于注意力构建的依赖上下文的关联,同时避免了显式增长的键值缓存。这种解释通常与注意力、快速权重记忆和线性注意力视角下的上下文关联相关(Vaswani等人,2017;Ba等人,2016;Katharopoulos等人,2020;Geva等人,2021),其中线性注意力是在 \(S\) 上应用线性校正规则的最简单独立实现,特指情况 \(S_t = S_{t-1} + U_\theta(D_t)\)。

### 3.3 循环潜在推理

在摄取演示和查询后,BDH-CQ在结构化潜在工作空间 \(H_r\) 中执行迭代计算。这发生在 \(K\) 个演示被摄取到记忆之后。我们通过以下方程总结此过程,这些方程捕获了输入 \(x^\star\) 的编码、潜在推理和输出 \(\hat{y}\) 的解码:

\(H_0 = E_\theta(x^\star, S_K)\), (2)

\(H_{r+1} = F_\theta(H_r, S_K), \quad r=0,\ldots,R-1\), (3)

\(\hat{y} = G_\theta(H_R)\). (4)

上下文记忆 \(S_t\) 和推理工作空间 \(H_r\) 具有不同的概念角色。\(S_t\) 随证据积累而变化,支持上下文学习。\(H_r\) 承载用于回答当前查询的持续计算。此组织定义了本文研究的系统级接口。维度、确切更新规则和实施细节仍属专有。

## 4训练数据与目标

### 4.1 ARC任务形式化

一个ARC任务 \(T_i\) 包含 \(K_i\) 个演示对和 \(Q_i\) 个测试对(\(Q_i \geq 1\)):

\(T_i = \left( \{(x_{i,j}, y_{i,j})\}_{j=1}^{K_i}, \{(x_{i,q}^\text{test}, y_{i,q}^\text{test})\}_{q=1}^{Q_i} \right).\) (5)

训练期间,模型在先前示例被纳入循环上下文后预测输出。其目标训练系统利用先前示例并生成精确的目标网格。我们报告任务接口和数据来源;完整的内部训练配方仍属专有。

### 4.2 训练混合

首先,我们在精心策划的类ARC数据集上训练一个1.5亿参数模型。该数据集结合了私有策划示例与公开可用数据,包括ARC-AGI-1训练集(Chollet,2019)、RE-ARC(Hodel,2024)、ConceptARC(Moskvichev等人,2023)、ARC-Heavy(Li等人,2025)和ARC-GEN100K(Moffitt,2025)。我们应用额外的增强以增加训练数据的多样性。

## 5公开ARC-AGI-1评估

我们在包含400个任务的公开ARC-AGI-1评估划分上进行评估(Chollet,2019;Chollet等人,2024)。默认系统配置遵循ARC-AGI排行榜的两次尝试约定(pass@2),产生最多两个排序候选,只要任一候选正确即得分。报告的美元值根据排行榜得分-成本平面上的实测硬件时间计算。其他绘制的系统使用排行榜报告的成本,这可能是硬件估计或API价格。在行为分析中,我们还报告pass@1和测试对准确率。

在默认点上,1.5亿参数系统在每任务约0.85个H200 GPU-秒内达到29.5%的pass@2通过率。以每小时H200成本3美元计算,得出每任务计算成本0.0007美元,不到十分之一美分。如图2所示,该点位于先前报告的帕累托前沿之外:没有绘制的系统能在相等或更低报告成本下达到至少此精度。这确立了ARC-AGI-1成本效率的新技术标杆。使用ARC Prize截至2026年7月报告的成本,BDH-CQ比GPT 5.6 Luna(Low)便宜约57倍,后者在0.040美元成本下得分为34.2%(ARC Prize Foundation,2026)。考虑到OpenAI于2026年7月30日对GPT 5.6 Luna(Low)的80%公开API价格削减(截至2026年8月6日未反映在ARC Prize数据中),BDH-CQ比GPT 5.6 Luna(Low)便宜约11倍。

参见标题 图2:ARC-AGI-1得分与每任务计算成本对比。数据点于2026年8月4日从官方ARC Prize排行榜收集。左侧边缘标记表示29.5%的pass@2通过率。该点突破了先前报告的成本-精度帕累托前沿,确立了ARC-AGI-1成本效率的新技术标杆。

#### 独立评估

由合著者进行的独立黑盒审计...

相似文章

BDH-CQ:结合循环潜在推理的上下文学习

Hugging Face Daily Papers

本文介绍了BDH-CQ,一个150M参数规模的推理模型,它将上下文学习与循环潜在推理相结合,在ARC-AGI-1上以极低的推理成本实现了29.5%的pass@2,确立了新的成本-精度前沿。