思维级束搜索用于推理
摘要
Gambit 通过使用思维级束搜索,在固定的硬件预算下动态分配计算资源给有前景的推理轨迹,从而显著提高准确性和吞吐量。
查看缓存全文
缓存时间: 2026/08/14 23:30
论文页面 - 思维层级束搜索用于推理
来源:https://huggingface.co/papers/2608.08020
摘要
Gambit 通过在固定硬件预算下使用思维层级束搜索,将计算资源动态分配给有前景的推理路径,从而提升了推理模型的效率。
测试时计算扩展 (https://huggingface.co/papers?q=Test-time%20compute%20scaling) 是大型推理模型 (https://huggingface.co/papers?q=large%20reasoning%20models)(LRM)性能提升的主要驱动力,但极端的低效性制约了现有方法,使关键问题从投入多少计算资源转变为如何分配这些资源。我们将测试时推理形式化为在部分轨迹 (https://huggingface.co/papers?q=partial%20trajectories) 上进行的受约束计算分配 (https://huggingface.co/papers?q=constrained%20compute%20allocation) 问题。在固定硬件预算下,现有范式未能主动将计算资源分配给最有前景的部分进展:传统的并行采样 (https://huggingface.co/papers?q=parallel%20sampling) 将各路径独立处理,导致严重的内存瓶颈;而剪枝 (https://huggingface.co/papers?q=subtractive%20pruning) 方法则使硬件资源利用不足,且未能主动且充分地调整输出分布。为克服这种二分局面,我们引入了 Gambit (https://huggingface.co/papers?q=Gambit),一种执行思维层级束搜索 (https://huggingface.co/papers?q=thought-level%20beam%20search) 的推理算法。通过定期修剪无前景的轨迹并立即从高质量前缀分支,Gambit (https://huggingface.co/papers?q=Gambit) 利用轻量级的评分器探测隐藏状态 (https://huggingface.co/papers?q=hidden%20states),动态地将计算资源集中到最有前景的推理路径上,同时保持持续的高硬件利用率 (https://huggingface.co/papers?q=hardware%20utilization)。在多个模型和基准测试上的广泛评估表明,Gambit (https://huggingface.co/papers?q=Gambit) 严格优于现有基线。在相同的硬件约束下,我们的方法在 HMMT-24 上实现了高达 +6.7% 的绝对准确率提升,在 AIME-25 上提升了 +3.3%,在轨迹完成速度上提供了超过 2 倍的吞吐量提升,并且与标准并行采样 (https://huggingface.co/papers?q=parallel%20sampling) 相比,总 token 消耗减少了高达 68.5%。
查看 arXiv 页面 (https://arxiv.org/abs/2608.08020) 查看 PDF (https://arxiv.org/pdf/2608.08020) 项目页面 (https://github.com/Dao-AILab/gambit-parallel-reasoning) GitHub (https://github.com/Dao-AILab/gambit-parallel-reasoning) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.08020)
在您的代理中获取此论文:
hf papers read 2608\.08020
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.08020 以从本页面链接。
引用本文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.08020 以从本页面链接。
引用本文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.08020 以从本页面链接。
包含本文的收藏夹 0
无收藏夹包含此论文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
@LijieyYang: 非常高兴地分享,我们的论文 “Thought-Level Beam Search for Reasoning” 已被 COLM 2026 接收!不同 …
论文 'Thought-Level Beam Search for Reasoning' 介绍了 Gambit,这是一种在生成过程中主动重新分配测试时计算资源的方法,通过剪枝低分推理路径并从强前缀分支,并且已被 COLM 2026 接收。
Stratagem:通过轨迹调制博弈自博弈学习可迁移推理
# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。
平衡思考的高效推理
本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。
@cerebras: https://x.com/cerebras/status/2067357992929153268
关于AI推理模型的经济性和性能影响的分析,表明启用推理可以将准确率提高10-20%,但消耗的token数量增加5-10倍,并讨论了不同的推理类型及其应用。
作为弱推理模型助推器的智能体系统
本文研究了以验证器为后盾的委员会搜索作为推理语言模型的推理时增强方法,表明在像 SWE-bench Verified 这样的代码修复任务上,弱推理模型委员会可以匹配强得多的模型的性能。