科学方程发现中的测试时缩放

arXiv cs.CL 论文

摘要

本文研究了科学方程发现中的测试时缩放,将其表述为一个迭代搜索过程,并发现搜索宽度是在计算预算下提高性能和效率的主导分配参数。

arXiv:2608.28660v1 Announce Type: new 摘要:测试时缩放(TTS)通过分配额外的测试时计算来改善语言模型的推理能力,但先前的工作主要研究数学和编码等封闭式任务。我们研究了用于自动方程发现的TTS,这是一个开放式环境,模型搜索候选方程并依赖观测数据点作为反馈。我们将LLM驱动的方程发现表述为一个迭代搜索过程,该过程在共同的计算分配视角下统一了最佳N选一、顺序细化、树搜索和进化式方法。为了将分配效应与提示工程和其他启发式方法隔离,我们在固定预算下比较最小并行控制器。在LLM-SRBench方程发现任务中,我们发现搜索宽度是主导的分配参数:我们扫描中的最佳宽度通常随着计算预算的增加而增加,而种群--分支分裂和控制器选择的影响较小。适当选择宽度还可以通过增加并行性来提高挂钟时间效率。这些结果表明,给定一个信息丰富的验证器,控制探索和利用是扩展基于LLM的方程发现的关键。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:00

# 面向科学方程发现的测试时缩放  
来源:https://arxiv.org/html/2608.28660  
Haowei Lin 致谢:̃ ̃同等贡献\. 代码与数据详见:  
https://ahong-lin.github.io/ScaleSR-tts/\.  
Hubert Lim¹¹脚注标记:1  
Letian Huang  
Di He  
所属机构:北京大学  
邮箱:\{linhaowei, di\_he\}@pku\.edu\.cn,HubertLinHong@stu\.pku\.edu\.cn  

###### 摘要  
测试时缩放(TTS)通过在推理阶段分配额外计算资源来提升语言模型的推理能力,但现有研究主要针对数学和编程等封闭式任务。本文研究TTS在自动化方程发现中的应用——这是一个开放式场景,模型需在候选方程中搜索并依赖观测数据点获得反馈。我们将LLM驱动的方程发现建模为迭代搜索过程,通过统一的计算分配视角整合最优选择(Best-of-NN)、顺序优化、树搜索及进化式方法。为隔离计算分配效应与提示工程等启发式策略的影响,我们在固定预算下比较了极简的并行控制器。在LLM-SRBench方程发现任务中,我们发现搜索宽度是主导分配参数:随着计算预算增加,最优宽度通常持续增长,而种群-分支比例与控制器选择的影响较小。适当的宽度选择还能通过提升并行度来改善实际运行效率。这些结果表明,在拥有有效验证器的前提下,控制探索与利用的平衡是扩展LLM方程发现能力的核心。  

## 1 引言  
测试时缩放(TTS)已成为提升语言模型推理性能的标准方法,其核心是在推理阶段分配额外计算资源,而非更新模型参数(37 (https://arxiv.org/html/2608.28660#bib.bib7);36 (https://arxiv.org/html/2608.28660#bib.bib9))。现有研究大多聚焦于数学和代码生成等封闭式推理任务,其目标是在明确规范的问题中恢复正确答案(12 (https://arxiv.org/html/2608.28660#bib.bib26);19 (https://arxiv.org/html/2608.28660#bib.bib15))。在这类场景中,TTS通常被定义为“应分配多少额外推理计算”的问题(36 (https://arxiv.org/html/2608.28660#bib.bib9)),或探讨更多计算如何帮助小模型逼近大模型的性能(48 (https://arxiv.org/html/2608.28660#bib.bib25))。  

本文研究TTS在自动化方程发现中的应用。虽然方程发现比整体科学发现范畴更狭窄,但它捕捉了一类重要的开放式建模问题:系统需提出候选方程或程序,从外部评估器获取反馈,并通过迭代搜索寻找更优候选方案。与封闭式推理基准测试不同,搜索过程中通常不存在唯一的目标字符串;进展通过任务特定验证器的改进度来衡量。这使得方程发现成为研究推理阶段计算资源应如何分配于探索与优化的理想试验场。  

视角转换至关重要,因为近期基于LLM的发现与程序搜索系统已暗示答案并非显而易见。越来越多研究使用语言模型生成候选方案,并通过外部验证器形成闭环(31 (https://arxiv.org/html/2608.28660#bib.bib17);27 (https://arxiv.org/html/2608.28660#bib.bib18);18 (https://arxiv.org/html/2608.28660#bib.bib19))。这些系统通常表现良好,但常作为复杂的智能体工作流被提出,包含众多耦合设计选择——如专用提示、变异规则、模型集成和手工调优的剪枝启发式方法。因此难以辨别哪些要素是本质性的。特别是测试时搜索的底层控制流程常与领域特定工程纠缠不清。  

我们认为,对于基于LLM的方程发现,计算分配是一阶设计选择。一旦获得有效的验证器,不同搜索流程主要体现为在固定测试时预算下分配探索与利用的不同方式。这一视角将经典TTS方法与最新进化式系统置于统一框架中:最优选择(Best-of-NN)对应单次宽幅探索,顺序优化对应窄幅多步利用,树搜索对应带重复剪枝的结构化分支,进化式系统对应持续的多候选/多岛搜索与重复选择扩展。在此视角下,核心研究对象并非特定智能体架构,而是控制候选扩展策略、生成续接数量及动态保留/淘汰候选激进程度的控制律。  

为研究此问题,我们将LLM驱动的方程发现形式化为包含四个通用操作的迭代搜索过程:采样、生成、评估和剪枝。该抽象将计算分配与领域特定启发式方法分离,使我们能在共享预算下比较不同控制流程。随后我们用两个高度并行的极简控制器实例化该框架:并行束搜索(PBeam)扩展当前前沿并保留最强候选;并行迭代扩展(PIE)则依据完整搜索历史指导后续扩展。这些控制器被刻意简化——其目的并非编码人工先验,而是为探究哪些分配决策关键提供纯净试验场。  

我们在LLM-SRBench自动方程发现实验中的结果呈现清晰一致的图景:主导控制变量是搜索宽度。贪婪利用或单次宽泛探索均非最优,最佳性能宽度位于区间内部,且随测试时预算增加而上移。该分配选择还能提升实际运行效率:适度宽度暴露更多并行度,因此更优搜索质量无需以运行时延长为代价。相比之下,在选定宽度后,种群规模与分支因子的精确比例以及PBeam与PIE的选择影响显著更小。  

因此,我们的目标并非为科学发现提出通用控制器,也非声称方程发现能完全代表所有科学发现问题。相反,我们以方程发现作为受控基准环境,证明对于开放式LLM搜索而言控制流程本身即是重要研究对象。在拥有有效评估器的前提下,固定计算资源分配方式存在显著的经验结构。明确该结构既能为比较现有方程发现系统提供统一语言,也为扩展此类测试时搜索问题提供实用方案。  

#### 贡献要点  
- • 将LLM驱动的方程发现形式化为统一的外部TTS过程,涵盖最优选择、顺序优化、树搜索及最新进化式系统等常见控制流程  
- • 在LLM-SRBench自动方程发现任务中证明搜索宽度是主导分配参数。在我们扫描范围内,较大预算倾向于更宽搜索,优化此权衡可同时提升最终性能与实际运行效率  
- • 分析基于大规模对照实证研究(约4000个H100 GPU小时),我们将公开代码、结果、提示及评估框架以支持未来方程发现的TTS研究  

### 1.1 背景:面向方程发现的TTS  

#### TTS概述  
TTS指通过在推理阶段分配额外计算(不更新模型参数)来提升LLM性能(47 (https://arxiv.org/html/2608.28660#bib.bib8);36 (https://arxiv.org/html/2608.28660#bib.bib9))。TTS已在推理密集型领域(尤其数学与代码生成)展现强大增益(45 (https://arxiv.org/html/2608.28660#bib.bib10);4 (https://arxiv.org/html/2608.28660#bib.bib12);19 (https://arxiv.org/html/2608.28660#bib.bib15);36 (https://arxiv.org/html/2608.28660#bib.bib9))。本文聚焦外部TTS,即通过多次模型调用实现额外计算。我们将允许单次响应消耗更多推理令牌的互补范式称为内部TTS。  

#### 外部TTS  
为清晰起见,我们按控制流程组织外部TTS:  
- **并行缩放**独立生成多个候选方案,随后通过自一致性、重复采样或验证器驱动的最优选择进行聚合(45 (https://arxiv.org/html/2608.28660#bib.bib10);4 (https://arxiv.org/html/2608.28660#bib.bib12);7 (https://arxiv.org/html/2608.28660#bib.bib13))  
- **顺序缩放**迭代优化中间输出,将后续生成步骤条件化于先前状态以实现自我修正(10 (https://arxiv.org/html/2608.28660#bib.bib3))  
- **混合缩放**结合分支与顺序优化,对候选状态进行显式搜索而非单向生成,从而实现迭代修正、前瞻或回溯(50 (https://arxiv.org/html/2608.28660#bib.bib14);19 (https://arxiv.org/html/2608.28660#bib.bib15))  

#### 验证机制  
TTS性能严重依赖验证机制。在基准推理任务中,验证通常通过学习型验证器或奖励模型实现:结果奖励模型对最终答案评分,过程奖励模型评估中间推理步骤(7 (https://arxiv.org/html/2608.28660#bib.bib13);20 (https://arxiv.org/html/2608.28660#bib.bib16))。这些信号可用于在线指导搜索或离线重排候选方案。  

#### 科学发现中的TTS  
近期工作使用LLM提出候选程序或构造,由外部评估器(如数学目标函数)分配适应度并形成搜索闭环(31 (https://arxiv.org/html/2608.28660#bib.bib17);27 (https://arxiv.org/html/2608.28660#bib.bib18))。该发现场景与标准数学或编程基准测试存在重要区别:目标通常是开放式的,往往没有预先知道的唯一真实答案;进展通过任务特定评估器的改进度来衡量。当评估器可靠时,主要瓶颈从恢复已知答案转向在大型候选方案搜索空间中有效分配测试时计算资源。在此视角下,近期自进化系统(18 (https://arxiv.org/html/2608.28660#bib.bib19);2 (https://arxiv.org/html/2608.28660#bib.bib11))可视为外部TTS的专用实例,主要差异在于控制流程。  

### 1.2 统一的TTS形式化  
我们将LLM驱动的方程发现形式化为对动态记忆状态 \(\mathcal{M}_t\) 的迭代搜索,该状态维护第 \(t\) 步可用的候选解决方案(如方程或可执行程序)。\(\mathcal{M}_0\) 可初始化为问题的初始解。通过抽象提示设计或变异规则等领域特定细节,我们得到由全局测试时计算预算 \(N\) 支配的通用计算框架。每次迭代由四个要素定义:\(\mathcal{M}_t\) 上的选择策略、分支规则、验证器和剪枝算子。  

#### 采样  
令 \(q_t(\cdot \mid \mathcal{M}_t)\) 表示当前记忆状态上的选择策略。选择子集 \(S_t=\{x_t^{(i)}\}_{i=1}^{n_t} \sim q_t(\cdot \mid \mathcal{M}_t)\),其中 \(S_t \subseteq \mathcal{M}_t\),\(|S_t|=n_t\),用于扩展。策略 \(q_t\) 可为贪心或基于评分,决定第 \(t\) 步重新访问哪些已发现的候选方案。  

#### 生成  
对每个候选 \(x_t^{(i)} \in S_t\),查询LLM生成包含 \(k_t^{(i)}\) 个新提案(如优化或新变体)的集合 \(G_t^{(i)}\)。完整生成集为 \(G_t=\bigcup_{i=1}^{n_t} G_t^{(i)}\),\(|G_t|=\sum_{i=1}^{n_t} k_t^{(i)}\)。当所有 \(i\) 满足 \(k_t^{(i)}=k_t\) 时,用 \(k_t\) 表示共同分支因子。  

#### 评估与剪枝  
使用任务特定验证器对 \(G_t\) 评分,将新提案与当前记忆合并,并应用剪枝算子 \(\Pi_t\)(如先进先出、Top-B选择或多样性过滤)保留存活候选:  
\[
\mathcal{M}_{t+1} = \Pi_t(\mathcal{M}_t \cup G_t)
\]  

#### 迭代  
重复此过程 \(T\) 步直至耗尽全局计算预算 \(N\)。假设每个生成提案成本均匀,总测试时计算约束为:  
\[
\sum_{t=0}^{T-1} \sum_{i=1}^{n_t} k_t^{(i)} \leq N
\]  

该框架能表达大多数外部TTS控制流程:并行缩放在单步最大化分支因子(\(T=1\)),顺序缩放以最小分支迭代优化候选,混合缩放在多轮中交替进行选择、分支与剪枝。在此视角下,不同发现算法主要体现为对 \((q_t, n_t, \{k_t^{(i)}\}_{i=1}^{n_t}, \Pi_t)\) 的参数化;在共同的常分支情况下简化为 \((q_t, n_t, k_t, \Pi_t)\)。  

关键在于,该抽象隔离了核心研究问题:假设拥有有效验证器,应如何将测试时计算分配于选择、分支与剪枝,以在固定预算下方程发现进展最大化?  

#### 符号简化。  
为简化后续讨论,我们聚焦时不变控制器(\(n_t \equiv n\),\(k_t^{(i)} \equiv k\),剪枝规则 \(\Pi_t \equiv \Pi\)),将控制器记为 \((q, n, k, \Pi)\)。进一步定义单次迭代搜索宽度为 \(w=nk\)。  

## 2 方法  

### 2.1 诊断:经典控制流程是否适合方程发现?  

#### 期望特性:性能与效率  
为评估现有控制流程对任务方程发现的适用性,我们建立两个主要期望特性:性能与效率。在固定计算预算

相似文章

面向科学发现的评测驱动扩展

Hugging Face Daily Papers

SimpleTES 框架将评测驱动的发现循环扩展到 21 个科学问题,在 LASSO 上实现 2× 加速,量子门数量减少 24.5%,并发现新的 Erdos 构造,同时支持轨迹级模型后训练。

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。

测试时计算是否触及天花板?

Reddit r/AI_Agents

本文探讨了AI模型在测试时计算扩展带来的收益是否正在减弱,这可能表明当前扩展范式正面临上限。

问题本身即问题:迈向可扩展的数学发现

arXiv cs.AI

该论文介绍了FAR,一种人机发现范式,它自动化了从文献中搜索数学问题的过程,并在组合数学的试点中展示了其在识别猜想和解决方案方面的有效性。