ParaTempo: 基于时间置信度的高效并行推理

Hugging Face Daily Papers 论文

摘要

ParaTempo 是一个无需训练的异步并行推理框架,它使用时间置信度来动态管理推理分支,在数学和科学推理基准测试中降低延迟和token使用量,同时保持准确性。

并行推理通过探索多条解题路径来提高大型推理模型的准确性和鲁棒性,但其计算成本随推理深度和分支数量增加而增长。现有的管理这些并行路径的方法通常依赖于最终答案共识、局部token置信度或孤立的中间探测。然而,这些信号通常存在延迟,与实际推理进展联系较弱,或噪声太大,不适合动态的分支级控制。为了解决这些限制,我们引入了ParaTempo,一个无需训练的异步并行推理框架。ParaTempo 由时间置信度驱动,这是一种分支局部的答案空间收敛度量。每个分支被周期性地探测以获取试探性答案概率分布,时间置信度量化了近期中间探测对主导答案的集中程度。一旦积累了足够的证据,ParaTempo 就从这个单一信号驱动其整个控制过程:低置信度分支被剪枝,持续承诺于其主导答案的分支被提前退役,释放的计算通过分叉新分支重新分配,并且一旦置信度加权投票集中,全局生成停止。无需在推理轨迹之间进行同步,ParaTempo 根据分支级收敛自适应分配计算。在具有挑战性的数学和科学推理基准测试上的实验表明,ParaTempo 将平均延迟降低了21.8-32.2%,总token使用量降低了18.1-30.3%,同时保持了有竞争力的准确性。此外,与token级和瞬时信号相比,时间置信度表现出更强的时序稳定性和对未来分支收敛的预测能力。
查看原文
查看缓存全文

缓存时间: 2026/08/24 12:28

论文页面 - ParaTempo:基于时间置信度的高效并行推理

来源:https://huggingface.co/papers/2608.16425

摘要

ParaTempo 通过利用时间置信度,动态地修剪、终止并重新分配推理分支(无需同步),从而提升并行推理效率。

并行推理 (链接) 通过探索多条解题路径来提高大型推理模型的准确性和鲁棒性,但其计算成本会随着推理深度和分支数量的增加而增长。管理这些并行路径的现有方法通常依赖于最终答案共识、局部 token 置信度或孤立的中间探测。然而,这些信号往往存在延迟、与实际推理过程关联较弱,或因过于嘈杂而难以用于动态的、分支级 (链接) 控制。为解决这些局限性,我们引入了 ParaTempo,这是一个无需训练的异步并行推理 (链接) 框架。ParaTempo 由时间置信度 (链接) 驱动,这是一种衡量答案空间收敛度 (链接) 的分支局部指标。每个分支会周期性地探测以获得暂定答案概率分布,而时间置信度 (链接) 量化了近期中间探测结果集中于主导答案的程度。一旦积累了足够的证据,ParaTempo 就会基于这个单一信号驱动其整个控制过程:低置信度分支被修剪,持续坚定选择其主导答案的分支被提前终止,释放出的计算资源通过创建新分支进行重新分配,并且当置信度加权投票 (链接) 集中时全局停止生成。无需在不同推理轨迹间进行同步,ParaTempo 就能根据分支级别的收敛情况自适应地分配计算资源。在具有挑战性的数学和科学推理基准测试上的实验表明,ParaTempo 在保持有竞争力的准确率的同时,将平均延迟降低了 21.8%-32.2%,并将总 token 使用量减少了 18.1%-30.3%。此外,时间置信度 (链接) 相较于 token 级和瞬时信号,对于未来分支收敛表现出更强的时间稳定性和预测能力。

查看 arXiv 页面 (链接) 查看 PDF (链接) 添加到收藏 (链接)

在您的代理中获取此论文:

hf papers read 2608\.16425

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.16425 以从本页链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.16425 以从本页链接它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.16425 以从本页链接它。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集 (链接) 以从本页链接它。

相似文章

TEMPO:为大推理模型扩展测试时训练

Hugging Face Daily Papers

TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。

NoisyCoconut:通过潜在空间推理实现反事实共识

arXiv cs.LG

本文介绍了 NoisyCoconut,这是一种在推理阶段通过向潜在轨迹注入噪声以生成多样化推理路径从而提高大语言模型可靠性的方法。该方法使模型能够在不确定时选择拒答,从而在无需重新训练的情况下显著降低数学推理任务的错误率。