思维级束搜索用于推理

Hugging Face Daily Papers 论文

摘要

Gambit 通过使用思维级束搜索,在固定的硬件预算下动态分配计算资源给有前景的推理轨迹,从而显著提高准确性和吞吐量。

测试时计算缩放是大型推理模型(LRMs)性能的主要驱动因素,但极端低效限制了当前方法,将关键问题从花费多少计算转移到分配到哪里。我们将测试时推理形式化为一个受约束的计算分配问题,涉及部分轨迹。在固定的硬件预算下,现有范式未能主动将计算分配给最有前景的部分进展:传统并行采样独立处理轨迹并导致严重的内存瓶颈,而减法剪枝使硬件资源不足,且无法主动且充分地改变输出分布。为克服这种二分法,我们引入了Gambit,一种执行思维级束搜索的推理算法。通过周期性地修剪不前景的轨迹并立即从高质量前缀分支,Gambit通过轻量级评分器探测隐藏状态,动态地将计算集中到最有前景的推理轨迹上,同时保持持续的高硬件利用率。在多个模型和基准上的广泛评估表明,Gambit严格主导现有基线。在相同的硬件约束下,我们的方法在HMMT-24上获得了高达+6.7\%的绝对准确性提升,在AIME-25上获得了+3.3\%,在轨迹完成时提供了>2times更高的吞吐量,并将总令牌消耗相对于标准并行采样减少了高达68.5\%。
查看原文
查看缓存全文

缓存时间: 2026/08/14 23:30

论文页面 - 思维层级束搜索用于推理

来源:https://huggingface.co/papers/2608.08020

摘要

Gambit 通过在固定硬件预算下使用思维层级束搜索,将计算资源动态分配给有前景的推理路径,从而提升了推理模型的效率。

测试时计算扩展 (https://huggingface.co/papers?q=Test-time%20compute%20scaling) 是大型推理模型 (https://huggingface.co/papers?q=large%20reasoning%20models)(LRM)性能提升的主要驱动力,但极端的低效性制约了现有方法,使关键问题从投入多少计算资源转变为如何分配这些资源。我们将测试时推理形式化为在部分轨迹 (https://huggingface.co/papers?q=partial%20trajectories) 上进行的受约束计算分配 (https://huggingface.co/papers?q=constrained%20compute%20allocation) 问题。在固定硬件预算下,现有范式未能主动将计算资源分配给最有前景的部分进展:传统的并行采样 (https://huggingface.co/papers?q=parallel%20sampling) 将各路径独立处理,导致严重的内存瓶颈;而剪枝 (https://huggingface.co/papers?q=subtractive%20pruning) 方法则使硬件资源利用不足,且未能主动且充分地调整输出分布。为克服这种二分局面,我们引入了 Gambit (https://huggingface.co/papers?q=Gambit),一种执行思维层级束搜索 (https://huggingface.co/papers?q=thought-level%20beam%20search) 的推理算法。通过定期修剪无前景的轨迹并立即从高质量前缀分支,Gambit (https://huggingface.co/papers?q=Gambit) 利用轻量级的评分器探测隐藏状态 (https://huggingface.co/papers?q=hidden%20states),动态地将计算资源集中到最有前景的推理路径上,同时保持持续的高硬件利用率 (https://huggingface.co/papers?q=hardware%20utilization)。在多个模型和基准测试上的广泛评估表明,Gambit (https://huggingface.co/papers?q=Gambit) 严格优于现有基线。在相同的硬件约束下,我们的方法在 HMMT-24 上实现了高达 +6.7% 的绝对准确率提升,在 AIME-25 上提升了 +3.3%,在轨迹完成速度上提供了超过 2 倍的吞吐量提升,并且与标准并行采样 (https://huggingface.co/papers?q=parallel%20sampling) 相比,总 token 消耗减少了高达 68.5%。

查看 arXiv 页面 (https://arxiv.org/abs/2608.08020) 查看 PDF (https://arxiv.org/pdf/2608.08020) 项目页面 (https://github.com/Dao-AILab/gambit-parallel-reasoning) GitHub (https://github.com/Dao-AILab/gambit-parallel-reasoning) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.08020)

在您的代理中获取此论文:

hf papers read 2608\.08020

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.08020 以从本页面链接。

引用本文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.08020 以从本页面链接。

引用本文的 Spaces 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.08020 以从本页面链接。

包含本文的收藏夹 0

无收藏夹包含此论文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

Stratagem:通过轨迹调制博弈自博弈学习可迁移推理

Hugging Face Daily Papers

# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。

平衡思考的高效推理

Papers with Code Trending

本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。

作为弱推理模型助推器的智能体系统

arXiv cs.AI

本文研究了以验证器为后盾的委员会搜索作为推理语言模型的推理时增强方法,表明在像 SWE-bench Verified 这样的代码修复任务上,弱推理模型委员会可以匹配强得多的模型的性能。