ThinkBooster: 用于LLM推理的无缝测试时计算扩展的统一框架
摘要
ThinkBooster是一个用于LLM推理的测试时计算扩展的统一框架,提供了模块化Python库、性能-效率基准、兼容OpenAI的代理服务以及可视化调试器。在数学和编程任务上的实证结果展示了实际收益以及质量-成本权衡。
arXiv:2606.06915v1 公告类型:新
摘要:测试时计算(TTC)扩展已成为一种强大的范式,通过推理期间分配额外计算来改进大语言模型(LLM)推理,例如通过多样本生成和基于验证器的重排序。现有的TTC扩展策略和推理评分器仍然分散,在不一致的协议下进行评估,并且很少从质量-成本权衡的角度进行分析。我们引入了ThinkBooster,一个用于LLM推理的无缝测试时计算扩展的统一框架,它包括:(i) 实现最先进TTC扩展策略和评分器家族的模块化Python库,(ii) 联合评估性能和计算效率的基准,以及 (iii) 可部署的兼容OpenAI的代理服务,实现自适应推理到实际应用的即插即用集成。我们还提供了一个演示可视化调试器,用于检查推理轨迹、中间选择决策和替代推理路径。数学和编程任务上的实证结果揭示了TTC扩展策略和评分方法的性能-计算权衡,并展示了ThinkBooster在实际任务中的实际收益。代码在线提供,采用MIT许可证。
查看缓存全文
缓存时间: 2026/06/08 09:21
# 无缝扩展LLM推理测试时计算的统一框架
来源:https://arxiv.org/html/2606.06915
Vladislav Smirnov¹ Chieu Nguyen¹ Sergey Senichev⁷ Minh Ngoc Ta¹ Ekaterina Fadeeva² Artem Vazhentsev¹ Daria Galimzianova¹ Nikolai Rozanov¹,³ Viktor Mazanov⁶ Jingwei Ni² Tianyi Wu⁴ Igor Kiselev⁵ Mrinmaya Sachan² Iryna Gurevych¹ Preslav Nakov¹ Timothy Baldwin¹ Artem Shelmanov¹
¹MBZUAI ²ETH Zürich ³Imperial College London ⁴NUS ⁵Accenture ⁶Innopolis University ⁷独立研究员
{vladislav\.smirnov, (https://arxiv.org/html/2606.06915v1/mailto:[email protected])timothy\.baldwin, (https://arxiv.org/html/2606.06915v1/mailto:[email protected])artem\.shelmanov (https://arxiv.org/html/2606.06915v1/mailto:[email protected])}@mbzuai\.ac\.ae
###### 摘要
测试时计算扩展已成为一种强大的范式,通过在推理过程中分配额外的计算资源(例如,通过多样本生成和基于验证器的重排序)来提升大语言模型的推理能力。现有的TTC扩展策略和推理评分器仍然零散,在不同的不一致协议下进行评估,并且很少从质量-成本权衡的角度进行分析。我们引入了**ThinkBooster**,这是一个用于无缝扩展LLM推理测试时计算的统一框架,包含:(i) 一个模块化的Python库,实现了最先进的TTC扩展策略和评分器系列;(ii) 一个同时评估性能和计算效率的基准;(iii) 一个可部署的、兼容OpenAI的代理服务,能够将自适应推理即插即用集成到实际应用中。我们还提供了一个演示用的可视化调试器,用于检查推理轨迹、中间选择决策和替代推理路径。¹¹¹http://demo-thinkbooster.nlpresearch.group/,²²²http://video-thinkbooster.nlpresearch.group/ 在数学和编程任务上的实证结果揭示了TTC扩展策略和评分方法的性能-计算权衡,并证明了ThinkBooster在实际任务中带来了实际收益。代码已根据MIT许可在线开源。³³³http://thinkbooster.nlpresearch.group/
**ThinkBooster: 一个用于无缝扩展LLM推理测试时计算的统一框架**
Vladislav Smirnov¹ Chieu Nguyen¹ Sergey Senichev⁷ Minh Ngoc Ta¹ Ekaterina Fadeeva² Artem Vazhentsev¹ Daria Galimzianova¹ Nikolai Rozanov¹,³ Viktor Mazanov⁶ Jingwei Ni² Tianyi Wu⁴ Igor Kiselev⁵ Mrinmaya Sachan² Iryna Gurevych¹ Preslav Nakov¹ Timothy Baldwin¹ Artem Shelmanov¹
¹MBZUAI ²ETH Zürich ³Imperial College London ⁴NUS ⁵Accenture ⁶Innopolis University ⁷独立研究员
{vladislav\.smirnov, (https://arxiv.org/html/2606.06915v1/mailto:[email protected])timothy\.baldwin, (https://arxiv.org/html/2606.06915v1/mailto:[email protected])artem\.shelmanov (https://arxiv.org/html/2606.06915v1/mailto:[email protected])}@mbzuai\.ac\.ae
## 1 引言
参见图1图1:常见推理测试时计算扩展策略的图示——束搜索(广度优先搜索的思维树)。
参见图2图2:ThinkBooster测试时计算扩展端点网关的图示。
思维链提示方法(Wei et al., 2022 (https://arxiv.org/html/2606.06915#bib.bib6); Kojima et al., 2022 (https://arxiv.org/html/2606.06915#bib.bib30))以及更近期,对大语言模型进行微调使其能够在给出最终答案之前原生地产生中间推理(Lightman et al., 2024 (https://arxiv.org/html/2606.06915#bib.bib33); Guo et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib7)),已经为LLM解锁了解决数学、编程甚至科学研究中复杂任务的强大能力(Wei et al., 2022 (https://arxiv.org/html/2606.06915#bib.bib6); Chen et al., 2021 (https://arxiv.org/html/2606.06915#bib.bib4); Lu et al., 2026 (https://arxiv.org/html/2606.06915#bib.bib8))。研究还表明,在测试时增加计算量,例如通过生成更长的推理链或采样多个解决方案并选择最佳方案,可以显著提高在具有挑战性问题上的性能。这种方法被称为**测试时计算扩展**(Snell et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib9); Muennighoff et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib29))。当最先进的LLM无法一次性解决具有挑战性的问题且无法进一步微调时,这种方法尤其有效。此外,最近的研究表明,与单纯增加模型规模相比,TTC扩展可以提供更好的性能与效率权衡(Snell et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib9))。常见的TTC扩展策略包括最佳N选一(Best-of-N, BoN: Cobbe et al., 2021 (https://arxiv.org/html/2606.06915#bib.bib10); Snell et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib9))、思维树(Tree-of-Thought, ToT: Yao et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib11),见图¹̃1 (https://arxiv.org/html/2606.06915#S1.F1))和自一致性(也称为多数投票:Wang et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib12))。最近,出现了许多动态TTC扩展策略,这些策略根据在单个推理步骤层面估计的置信度或不确定性来调整计算量(Zhang et al., 2025a (https://arxiv.org/html/2606.06915#bib.bib19); Fu et al., 2026 (https://arxiv.org/html/2606.06915#bib.bib20); Yan et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib15))。另一条研究路线开发了步骤级和轨迹级评分器,用于从多个候选推理路径中选择最有前途的一条。常见的方法包括通过过程奖励模型进行验证(Uesato et al., 2022 (https://arxiv.org/html/2606.06915#bib.bib23); Lightman et al., 2024 (https://arxiv.org/html/2606.06915#bib.bib33); Li et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib24); Luo et al., 2024 (https://arxiv.org/html/2606.06915#bib.bib22); Zhang et al., 2025b (https://arxiv.org/html/2606.06915#bib.bib21)),以及通过同一个LLM进行自验证(Xie et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib25); Weng et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib13))。最近的研究还提出了无监督和有监督的不确定性或置信度分数,用于评估推理步骤的可靠性(Kadavath et al., 2022 (https://arxiv.org/html/2606.06915#bib.bib14); Zhu et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib2); Ni et al., 2026 (https://arxiv.org/html/2606.06915#bib.bib17))。
尽管TTC扩展取得了快速进展,但有关该主题的文献仍然高度碎片化。这些方法通常在不同的实验协议、模型配置(例如,结构化CoT vs. 原生非结构化思考)和计算预算下进行评估,这使得直接比较变得困难。此外,许多研究主要关注准确性提升,而忽略了相关的计算成本、延迟和效率权衡。因此,很难确定哪些方法真正提供了最佳的性能-计算权衡。此外,大多数已发表的研究通常只提供所提出的一种方法以及有限的基线的实现。最后,发布的代码通常仅作为概念验证使用,存在效率限制,并且缺乏对实际部署的支持。缺乏标准化、可靠且高效的实现,给在实际应用中部署TTC扩展的从业者带来了额外的挑战。
在这项工作中,我们通过呈现**ThinkBooster**来弥合这些差距,这是一个用于无缝扩展LLM推理测试时计算的统一框架。ThinkBooster的目标是研究推理和测试时计算扩展的NLP研究人员,以及部署基于LLM应用的从业者。我们的目标有两个:(i) 提供一个用于对TTC扩展和一般推理进行原则性基准测试和研究的统一框架;(ii) 提供一个实用的、面向开发者的集成层,通过统一的API和清晰的抽象,支持在实际应用中轻松部署TTC扩展。该框架结合了一个模块化的Python库、一个基准测试和一个可部署的TTC扩展端点网关(参见图²̃2 (https://arxiv.org/html/2606.06915#S1.F2)),该网关将TTC扩展作为一种服务提供,并可作为兼容OpenAI的LLM端点的即插即用替代品。作为一个透明的代理,ThinkBooster端点网关在底层LLM生成的基础上无缝应用测试时计算扩展,从而在不需修改现有应用逻辑的情况下提高推理轨迹和最终答案的质量。它有效地为底层LLM配备了“专业”推理模式。通过提高最终LLM答案的质量,ThinkBooster直接提升了构建于LLM之上的下游应用(包括AI代理)的可靠性和有效性。最后,我们提供了一个用于推理轨迹的演示可视化调试器,可用于检查中间步骤、选择决策和替代路径。
表1:ThinkBooster中实现的测试时计算扩展策略。
表2:ThinkBooster中实现的推理步骤和轨迹评分器。
ThinkBooster降低了研究人员和从业者采用TTC扩展的门槛。本工作的贡献如下:
- •一个Python库,在统一且一致的编程API背后实现了最先进的TTC扩展策略和评分器。
- •一个实用的TTC扩展端点,带有兼容OpenAI的远程API,可作为原始LLM端点的即插即用替代品,用于包括AI代理和助手在内的各种应用。我们展示了ThinkBooster可以通过CUDA内核优化为例,提高实际任务中的下游性能。
- •一个基准测试,用于进行推理和测试时计算扩展的研究,同时包含性能和计算指标。我们还对已实现的策略和评分器进行了一项初步研究,并提供了对其性能-效率权衡的见解。
- •最后,我们为TTC扩展期间的LLM推理轨迹创建了一个演示可视化调试器,支持对中间推理步骤进行交互式检查,并促进对LLM错误的系统分析。
## 2 核心库
ThinkBooster的核心是一个轻量级、模块化且可扩展的Python库,实现了TTC扩展的关键组件。这些组件包括扩展策略、评分器、推理生成器和推理步骤边界检测器。**扩展策略**定义了测试时计算扩展的高级扩展算法,但通常不规定底层细节,例如推理步骤或轨迹具体如何评分。我们的库包含九种最先进算法的实现(参见表¹̃1 (https://arxiv.org/html/2606.06915#S1.T1)),涵盖了超过二十篇关于TTC扩展和推理的最新出版物。一些策略**离线**操作,意味着它们可以在获得最终解决方案后对轨迹进行评分,而其他策略则在推理过程中**在线**执行评分。它们在访问LLM输出和内部状态的级别上也各不相同。**白盒**策略需要访问对数几率或内部状态,这限制了它们在特定LLM部署环境中的适用性。**黑盒**策略除了生成的令牌之外不需要任何东西。最后,一些策略要求在提供商的API中启用**Prefill**选项——它允许用先前生成的推理步骤填充文本前缀,这样LLM就不必从头开始推理。
**评分器**规定了评估单个推理步骤或整个轨迹的方式。我们实现了四种主要方法(参见表²̃2 (https://arxiv.org/html/2606.06915#S1.T2)):(1) PRMs (Lightman et al., 2024 (https://arxiv.org/html/2606.06915#bib.bib33)),(2) 基于LM-Polygraph库的不确定性分数和置信度分数 (Fadeeva et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib18); Vashurin et al., 2025 (https://arxiv.org/html/2606.06915#bib.bib16)),(3) LLM-as-a-judge评估(包括自我评估:Yao et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib11)),以及(4) ReProbes (Ni et al., 2026 (https://arxiv.org/html/2606.06915#bib.bib17))。评分器在访问底层LLM内部状态或输出的级别上可能不同:白盒与黑盒。
**推理生成器**是围绕LLM部署的封装器。该库支持通过Hugging Face Transformer库和vLLM (Kwon et al., 2023 (https://arxiv.org/html/2606.06915#bib.bib39))本地部署的LLM。LLM也可以作为服务通过vLLM、OpenRouter、ChatGPT或任何其他提供兼容OpenAI API的提供商部署。通常,最灵活的白盒访问可以通过Transformers和vLLM API获得。大多数提供商仅暴露生成的令牌,但有些提供令牌的对数概率访问(例如,OpenAI的gpt-4o、OpenRouter中的一些LLM以及DeepSeek API)。Prefill选项也可用于vLLM部署和一些提供商,如DeepSeek和Anthropic。
**推理步骤提取器**能够将推理轨迹分解为原子片段,并允许在生成过程中进行受控暂停以处理单个步骤。对于非思考型LLM,可以指定系统提示以促进在特定格式下进行CoT,便于解析。对于具有原生思考模式的大型推理语言模型,如DeepSeek R1或Qwen 3,无法控制`\.\.\.`标签内思考的格式,这使得可靠的步骤提取变得复杂。我们支持从系统提示促进的结构化生成以及LRLM中的非结构化思考中提取推理步骤。
该库支持灵活组合扩展策略、评分机制、LLM后端和推理步骤提取器,以满足特定需求。实际采用TTC扩展的一个关键要求是其实现的高效性和可靠性。我们通过设计能够充分利用提供商API的优化组件来解决这个问题。例如,我们围绕vLLM实现了自定义封装器,在推理过程中暴露隐藏状态,从而无需修改底层模型即可高效集成基于内部状态的评分。
```
from openai import OpenAI
client = OpenAI(
base_url="/v1/beam_search/prm",
api_key="",
)
response = client.chat.completions.create(
model="Qwen/Qwen3-30B-A3B",
messages=[{"role": "user", "content": "求满足 x + 2y = 2xy 的正整数有序对 (x, y) 的数量。"}],
extra_body={
# 可选参数
"model_base_url": "https://openrouter.ai/api/v1",
"max_tokens": 8192,
"tts_beam_size": 4,
},
)
print(response.choices[0].message.content)
# 包含答案的推理路径
```
图3:通过OpenAI Python SDK访问ThinkBooster端点网关。参数`base_url`指定了ThinkBooster端点URL,该URL编码了扩展策略和评分器。
参见图(a)自定义提供商、模型、策略和评分器。
参见图(b)推理时间线和步骤检查器,带逐候选得分明细。
图4:推理的可视化调试器。
参见图(a)轨迹树:橙色路径 = 选中的运行,同级节点 = 被剪枝的候选。
## 3 面向TTC扩展的端点网关
对于开发者和最终用户相似文章
用 LLM 优化 LLM:面向测试时扩展的智能体发现方法
本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。
UniScale: 通过模型路由与测试时扩展的在线联合优化实现自适应统一推理扩展
提出UniScale,一种在线框架,通过上下文多臂老虎机优化统一模型路由和测试时扩展,以在LLM推理中实现更好的质量-成本权衡。
自信扩展:针对自适应测试时间缩放的LLM置信度校准
本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。
TEMPO:为大推理模型扩展测试时训练
TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。
通过简单统一的缩放实现金牌级奥赛推理
本文提出了一种简单统一的配方,结合监督微调、两阶段强化学习和测试时缩放,训练出一个推理模型(SU-01),在国际数学和物理奥林匹克竞赛中达到金牌级表现。