递归代理推理
摘要
本文将测试时推理方法重新诠释为递归算子——Grow、Prune 和 Branch——并对其进行评估,发现 Branch 通过从预算耗尽的输出中恢复,持续提高准确性,同时建议在比较研究中使用配对评分。
arXiv:2608.23956v1 公告类型:新
摘要:测试时推理方法,如迭代优化、分解和重复采样,往往被孤立评估,使得其收益难以在不同模型、基准和评估流程间进行比较。我们引入了统一视角,将这些方法视为代理推理轨迹上的递归算子:GROW 深化单一推理路径;PRUNE 分解并重组问题;BRANCH 采样替代推理路径并在其中选择。我们在共享的框架下,使用相同的提示、令牌预算和评分代码,评估所有三个算子与单遍思维链基线的对比。在五个基准和三个前沿模型上,共14个模型-基准设置、49,327个评分项目和151,876次模型调用,BRANCH 在所有14个设置中平均提高准确性5.98个百分点,并在12个中表现最佳。相比之下,GROW 平均提高2.18个百分点,但在两个设置中性能下降,而 PRUNE 平均提高准确性0.94个百分点。分析表明,BRANCH 的优势不仅源于探索多条推理路径,还源于从截断中恢复:其收益与基线的空、预算耗尽输出率强烈相关(r = 0.72)。这些结果削弱了不同问题需要在测试时推理算子间进行路由的假设;在这个抽象层次上,重复分支持续占主导地位。最后,我们证明,非配对评估和将评分流程失败视为模型误差可以实质性改变甚至反转比较结论,从而推动配对评分作为测试时计算评估的标准协议。
查看缓存全文
缓存时间: 2026/08/26 09:17
# 递归智能体推理 来源:https://arxiv.org/html/2608.23956 ###### 摘要 测试时推理方法通常被孤立研究:迭代优化、分解和重复采样各自拥有独立的基准测试、模型和评估工具,因此它们的收益难以比较。我们将它们重新定义为智能体推理轨迹上的*递归算子*——Grow(深化单条路径)、Prune(分解与重组)和Branch(采样备选方案并进行选择)——并在一个统一的框架下,使用相同的提示词、令牌预算和评分代码,将它们与单次通过的思维链基线进行评估。该研究涵盖五个基准测试和三个前沿模型,产生14个模型×基准测试单元格、49,327个评分项和151,876次模型调用。在配对协议下,每个算子仅针对所有算子都能解决的项目进行评分,Branch在所有14个单元格中均提升了准确率(平均+5.98分),并在其中12个单元格中是严格的最佳算子;Grow平均提升+2.18分,但在两个单元格中为负值,而Prune平均提升+0.94分。核心分析结果是,Branch的优势不仅源于对推理路径的边缘化处理,更得益于其恢复截断的能力。其增益与基线中因预算耗尽而产生空输出的比例高度相关(r=0.72),表明重复采样常常能恢复出单次通过永远无法产生的答案。这一发现削弱了驱动本研究的路由假设:在此算子粒度上,单一方法几乎在所有情况下占据主导地位。我们还证明,非配对评估以及将基础设施故障计为模型错误,其影响之大足以反转结论,因此我们推荐将配对评分作为比较性测试时计算研究的标准实践。 ## 1 引言 一个语言模型在面对一个难题时只获得一次尝试机会,会产生一个推理轨迹和一个答案。几乎每一个最近的测试时推理进展,都可以被理解为一种利用额外推理计算来避免受限于单个轨迹的方法。模型可以延长轨迹并修改自身的答案(Madaan等人,2023;Shinn等人,2023;Shi等人,2025);它可以将问题分割成子问题并按顺序解决(Zhou等人,2023;Khot等人,2023);或者它可以采样许多独立的轨迹并进行聚合(Wang等人,2023;Brown等人,2024;Chang等人,2025)。最近的工作通过学习搜索控制器(Li, 2025)、自适应计算分配(Wang等人,2025;Bilal等人,2026)以及显式递归的智能体(它能将任务委派给自身的副本)(Yang等人,2026;Gandhi等人,2026)进一步拓展了这个领域。这些是不同形状的计算方式,而现有的经验文献在很大程度上仍将它们视为不同的研究方向。 这种分离带来了实际的成本。每种方法通常是在适合其的基准测试和基础模型上引入的,并配有其自身的答案提取和评分代码。因此,一个决定如何分配固定推理预算的实践者无法回答一个基本问题:在计算量相同的情况下,我应该使用其中哪一个?答案是否取决于我的模型或我的任务?报告的收益不可比较,因为除了方法本身,没有任何其他因素被固定。随着最近的框架论文主张测试时缩放应作为完整的推理系统进行评估,需要协议匹配的计算核算和可复现性要求,而非单一的标量预算(Hariri等人,2026),这一担忧变得更加尖锐。 本文认为,这三个类别最好被理解为单个空间(即智能体推理轨迹上的递归)中的三个*算子*,而有趣的问题是经验性和比较性的。我们定义了Grow(沿一条路径的加法递归)、Prune(通过分解进行的归约递归)和Branch(通过对采样备选方案的搜索进行的递归),基于一个共享的原语实现了它们,并在五个基准测试和三个前沿模型上,将所有这三个算子与单次通过的思维链基线(Wei等人,2022)进行比较。与最近直接训练递归或策略引导的推理系统的工作(Li, 2025;Yang等人,2026;Gandhi等人,2026)不同,我们提出一个更窄但更可立即部署的问题:如果基础模型保持固定,哪个算子能带来最大的准确率提升,原因是什么?图1展示了四种计算图。 固定除算子外的所有因素,其重要性超出了我们的预期。两种方法论风险,在常规结果表中均不可见,各自都足以反转我们研究中的结论。第一种是非配对评估:当针对共享推理端点的长时间运行任务对不同算子在不同项目上失败时,比较每个算子在各自碰巧完成的项目上的准确率,相当于在静默中比较方法在不同问题集上的表现。在我们的数据中,这人为制造了一个虚假的3点下降。第二种是将基础设施故障视为模型错误,这恰恰惩罚了那些发出最多API调用的算子——也就是最昂贵且通常最好的算子。因此,我们在整个研究中采用配对协议:在每个模型×基准测试单元格内,每个算子仅针对所有算子都能解决的那组项目进行评分,且不可恢复的传输故障被排除在外,而非标记为错误。 我们的贡献包括: - • 一个统一的算子公式,用于描述基于推理轨迹的加法、归约和基于搜索的测试时递归,它构建于一个共享的求解原语之上,该原语包含针对预算耗尽的推理模型的显式终结步骤(第3节)。 - • 一个受控的14单元格比较——5个基准测试 × 3个模型 × 4种方法,49,327个评分项,151,876次模型调用——使用相同的提示词、预算和评分器,并采用配对评分协议(第4-5节)。Branch在所有14个单元格中均提升了准确率并赢得了12个;Grow和Prune则表现不一致。 - • 一个机制性解释,说明了Branch为何胜出,这与标准解释不同。其增益与基线中因预算耗尽而产生空输出的比例(r=0.72)高度相关,并且它大致将该比例减半;其收益主要源于恢复了一种退化的失败模式,而非对推理路径的边缘化处理(第5.2节)。 - • 两个否定性结果。自适应算子路由未得到数据支持,因为单一算子占据主导;我们还记录了非配对评分如何反转了我们自己的一个发现(第5节和第6节)。 论文其余部分组织如下:第3节形式化了三个算子和共享的求解原语。第4节描述了基准测试、模型和配对评估协议。第5节给出了主要比较结果,解释了Branch增益背后的机制,并分析了成本和跨模型效应。第6节将研究结果置于现有文献的背景下,并明确阐述了本文的否定性结果。 图1:本文比较的四种推理时计算图。空心节点代表问题,实心节点代表模型调用,底部节点是返回的答案。CoT发出一次调用。Grow延伸单条路径,并在提取的答案在轮次间停止变化时终止。Prune分解为有序的子问题,使用先前的答案作为上下文依次解决每个子问题,然后重组。Branch采样N=5个独立解决方案,并通过归一化答案的多数投票进行选择,该过程也会丢弃那些未返回任何内容的样本。调用次数是在所有运行中测量的平均值。 ## 2 相关工作 ##### 提示与分解。 思维链提示证明了引导出中间步骤可以提升推理能力(Wei等人,2022)。从少到多提示(Zhou等人,2023)和分解提示(Khot等人,2023)将问题分解成子问题并按顺序解决,每个子问题都基于先前的答案。我们的Prune算子是这一脉络的直接后代,其分解由解决子问题的同一个模型生成,并设有一个自适应门控,当模型仅提议一个子问题时,会退回到单个直接求解。 ##### 迭代优化。 Self-Refine(Madaan等人,2023)和Reflexion(Shinn等人,2023)通过将模型自身的批判反馈给模型来改进输出。更近期的工作将优化推向更细的粒度:Socratic Self-Refine将推理轨迹分解为可验证的子问题/子答案对,估计步骤级别的置信度,并有选择地修改最弱的步骤(Shi等人,2025)。我们的Grow算子是这类方法中刻意保持极简的一个:它使用先前的尝试作为上下文重新求解,并使用*答案稳定性*——即连续两轮提取出相同的归一化答案——作为其停止信号,这不需要单独的批判者或言语反馈通道。 ##### 采样与搜索。 Self-consistency采样多个链条并进行多数投票(Wang等人,2023)。思维树(Yao等人,2023)和思维图(Besta等人,2024)通过前瞻和回溯来扩展和剪枝部分推理状态。近期工作更审慎地分配分支计算:策略引导树搜索学习何时扩展、分支、回溯或终止(Li, 2025),而步骤级混合测试时缩放则在单个推理例程中交织使用验证器引导的自优化、Best-of-N和MCTS(Chang等人,2025)。我们的Branch算子位于这个谱系的简单一端:它是带无加权投票的扁平并行采样,需要坦率指出的是,作为一种算法,它就是Self-consistency。我们将其命名为Branch是为了在算子空间中保持对称性,而非声称新颖性;第6节讨论了我们的发现与那项先前工作的异同。 ##### 递归智能体系统。 最近的2026年工作将递归本身作为研究对象。《用于长程推理的递归模型》形式化了自递归智能体作为绕过有界上下文的一种途径,并分析了它们的计算能力(Yang等人,2026),而《递归智能体优化》则端到端地训练智能体以决定何时以及如何将任务委派给自身的递归副本(Gandhi等人,2026)。这些工作与我们的工作互补:它们直接研究学习的递归策略,而我们则比较轻量级的黑盒递归算子,这些算子可以叠加到现有的前沿模型上,无需额外训练。 ##### 测试时计算缩放。 Brown等人(2024)表明,在四个数量级上,覆盖率——即至少被一个样本解决的问题比例——与样本数量呈对数线性缩放,同时指出选择方法(如多数投票)在超过几百个样本后会趋于饱和。Snell等人(2024)表明,花费测试时计算的最佳方式取决于问题难度,并且自适应分配它优于固定的Best-of-N策略。近期工作同时在分配和评估上进行了深化:《每次展开都重要》研究了搜索期间的最优展开分配,并主张在推理方向而非解决方案级别分配预算(Wang等人,2025);Bilal等人(2026)提出了跨工具、探索参数和迭代预算的验证器引导自适应分配;Hariri等人(2026)则主张测试时缩放应作为完整的推理系统进行报告,需包含协议匹配的计算核算和可复现性工件。这条工作线索激发了我们着手检验的路由假设;我们的数据在算子粒度上不支持它,我们认为这是一个有信息量的否定性结果,而非矛盾,因为我们改变的是算子而非样本预算。验证器引导的选择(Cobbe等人,2021;Lightman等人,2024)也是许多近期进展所在,这是我们*未*探索的主要方向:我们所有的选择都是无加权投票,我们将在文末将其作为本研究最明确的局限性加以讨论。 ## 3 方法 ### 3.1 推理轨迹上的智能体递归 设 x 为一个问题,模型调用 M(p) 将提示映射为补全。单次通过的基线计算 y = extract(M(x))。我们将递归算子定义为一种将多次这样的调用组合成一个答案的策略,并通过其诱导的计算图(图1)和其停止规则来表征每个算子。我们称整个过程为*智能体的*,因为模型被允许基于其自身的中间产物发出多次调用,而非承诺于单一轨迹。 ### 3.2 共享的求解原语 所有算子都建立在一个函数 solve(x, c) 之上,该函数发出一次可选附带先前上下文 c 的调用,并返回一个提取的答案。它包含一个被证明是必不可少的部分,我们认为其本身就是一个贡献。当代推理模型在用户可见内容之前会发出一个隐藏的思忖流;如果令牌预算在思忖过程中耗尽,调用会成功返回,但内容*为空*,并带有一个长度停止原因。将此视为错误答案(大多数测试框架中的默认做法)会丢弃一个模型可能已正确推理了数千个令牌的项目。当 solve 检测到这种情况时,它会使用模型自身截断的推理内容重新提示模型,并要求其承诺给出一个最终答案。第5.2节表明,这种失败模式并非边缘情况:它占据了基线项目失败中的大部分。
相似文章
从智能体轨迹中诱导推理原语
介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。
生成式递归推理
本文介绍了生成式递归推理模型(GRAM),这是一个概率框架,通过支持随机潜在轨迹、多个假设以及通过深度和并行采样实现推理时缩放,扩展了递归推理模型。
@askalphaxiv: 由Yoshua Bengio指导的一篇精彩论文 "Generative Recursive Reasoning" 测试时计算不仅应…
论文《Generative Recursive Reasoning》提出了一种方法,通过并行采样多个潜在推理轨迹来扩展测试时计算,使模型能够探索多样化的假设并避免确定性坍缩。该方法在数独、ARC AGI、N皇后和图形着色等任务上提升了性能,还可以从头生成有效的数独棋盘和MNIST数字。
重新思考推理密集型检索:评估并提升智能体搜索系统中的检索器
本文引入了 BRIGHT-Pro,这是一个针对推理密集型检索的新基准,以及 RTriever-Synth,这是一个用于微调 RTriever-4B 以在智能体搜索系统中提升性能的合成语料库。
通过自我调节的模拟规划实现高效代理推理
介绍了 SR²AM,一种通过自我调节的模拟规划实现高效代理推理的框架,在推理 token 减少 26-95% 的同时,达到了与 20-30 倍参数规模模型相竞争的性能。