@LijieyYang: 非常高兴地分享,我们的论文 “Thought-Level Beam Search for Reasoning” 已被 COLM 2026 接收!不同 …

X AI KOLs Following 论文

摘要

论文 'Thought-Level Beam Search for Reasoning' 介绍了 Gambit,这是一种在生成过程中主动重新分配测试时计算资源的方法,通过剪枝低分推理路径并从强前缀分支,并且已被 COLM 2026 接收。

非常高兴地分享,我们的论文 “Thought-Level Beam Search for Reasoning” 已被 COLM 2026 接收! 不同于 Self-Consistency 和仅剪枝方法,Gambit 在生成进行时主动重新分配测试时计算资源——通过剪枝低分推理路径并从最强前缀分支。参见线程
查看原文
查看缓存全文

缓存时间: 2026/08/15 01:48

很高兴分享我们的论文《思维级束搜索用于推理》已被COLM 2026接收!

与自洽性方法和纯剪枝方法不同,Gambit在生成过程中主动重新分配测试时计算资源——剪枝低分推理轨迹,并从最强前缀进行分支。详见讨论串

[1/6] 测试时扩展驱动了大型推理模型的大部分性能:采样大量长轨迹,然后投票。然而这效率极低——大多数轨迹最终得出错误答案,内存压力导致延迟增加,单一竞赛问题可能占用单个GPU数小时。

[2/6] 这将核心问题从“消耗多少计算资源”转向“如何分配资源”。两种范式存在不足:并行采样将轨迹视为独立尝试并耗尽内存,基于分数的剪枝移除弱轨迹但使释放的容量闲置。

[3/6] Gambit将测试时推理构建为对部分轨迹的受约束计算分配。轻量级评分器在推理步骤边界探测隐藏状态;周期性锦标赛剪除最低分轨迹,并从最高分前缀进行分支。

[4/6] 子节点通过前缀缓存继承父节点的KV缓存,因此替代延续仅消耗其新增token。 在相同B300硬件预算下:

在HMMT-24上比剪枝方法提升+6.7%,在AIME-25上提升+3.3% 比并行采样最多减少68.5%的token消耗

[5/6] 论文:https://arxiv.org/abs/2608.08020 代码:https://github.com/Dao-AILab/gambit-parallel-reasoning…

[6/6] 感谢@PrincetonPLI和Dao AI Lab的计算支持。很高兴能与@lhyTHU (MIT CSAIL)、@jiawzhao (Meta)合作,并对@tri_dao和Ravi Netravali的悉心指导表示感谢! #COLM2026 #LLM #推理

我们发现重新分配计算资源是关键。在论文中我们使用了两种评分器:一种改编自先前工作,另一种采用我们自有的方法训练。为保持公平比较,我们在基于剪枝的基线方法和我们的方法中均使用第一种评分器(如表1所示)。

第一种是展示不同方法分数轨迹的GIF动画。欢迎点击查看——应该可以正常显示 :)

非常感谢Liane :)

哈哈谢谢兄弟

我们进一步评估了排序准确率以反映评分器校准度(如图9所示),以及下游准确率(如表2所示)。Gambit无论是使用我们训练的历史感知评分器还是先前工作的现成评分器,都能提升准确率。

感谢关注!我们的研究发现重新分配计算资源是关键杠杆,而评分函数同样重要。在论文中我们使用了两种评分器:一种改编自先前工作,另一种采用我们自有的方法训练。为保持公平比较,我们在基于剪枝的基线方法和我们的方法中均使用第一种评分器(如表1所示)。

我们进一步评估了排序准确率以反映评分器校准度(如图9所示),以及下游准确率(如表2所示)。Gambit无论是使用我们训练的历史感知评分器还是先前工作的现成评分器,都能提升准确率。

翻译说明:1)将“Thought-Level“译为“思维级“既保留技术概念又符合中文认知语言学表述;2)“Gambit“保留英文原名体现项目品牌;3)“KV cache“等术语采用中文技术圈通用译法;4)社交媒体特有的@提及和话题标签保持原格式;5)技术指标和数据呈现方式完全对应原文结构。

相似文章

思维级束搜索用于推理

Hugging Face Daily Papers

Gambit 通过使用思维级束搜索,在固定的硬件预算下动态分配计算资源给有前景的推理轨迹,从而显著提高准确性和吞吐量。