及时止损!学习早期剪枝路径以实现高效并行推理
摘要
本文介绍了STOP(用于剪枝的超令牌),一种轻量级方法,通过在并行解码中附加可学习令牌并读取KV缓存状态,学会早期剪枝不优的推理路径,在AIME和GPQA基准测试中实现70%的令牌减少,同时提高性能。
查看缓存全文
缓存时间: 2026/04/20 08:27
Paper page - Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
来源:https://huggingface.co/papers/2604.16029 STOP!你可能已经走错了推理路径。
在并行推理中,许多采样轨迹从早期前缀开始就已注定失败,却仍然消耗完整的解码预算。
我们提出了 STOP(用于剪枝的超级令牌),这是一种轻量级方法,它附加一个短的可学习 [STOP] 令牌序列,并直接读取 KV 缓存状态来决定是否应继续一条轨迹。这无需重新编码或外部模型,即可对无前途的路径进行早期剪枝。
STOP 在 AIME 和 GPQA 上显著提升了推理性能,同时在许多设置中将令牌使用量降低了 70% 以上。
相似文章
早期剪枝学习!高效并行推理的路径剪枝方法
本文提出了 STOP(SuperTOken for Pruning),一个系统框架,用于在大型推理模型的并行推理中早期剪枝低效推理路径。该方法在 1.5B 到 20B 参数的模型中实现了优异的效率和效果,在固定计算预算下将 GPT-OSS-20B 在 AIME25 上的准确率从 84% 提升到 90%。
@HuggingPapers:并行推理及时止损——STOP 通过读取 KV-cache 状态提前剪枝注定失败的轨迹,…
STOP 方法利用 KV-cache 状态提前剪枝注定失败的推理轨迹,token 用量降 70%,在 1.5B–20B 模型上提升 AIME 与 GPQA 准确率。
当推理收敛时停止:保留语义的推理模型提前退出
本文介绍 PUMA,一个即插即用框架,通过检测思维链推理中的语义冗余实现提前退出,在多个模型和基准测试中平均减少 26.2% 的 Token,同时保持准确性和推理质量。
学习何时停止有用?推理模型早期退出的成本感知研究
本文介绍了LearnStop,一种用于推理模型的轻量级检查点停止器,它从在线特征中预测前缀正确性,并发现学习式停止仅在多个问题早期正确且没有单一可靠的标量信号时,才比标量规则更有价值。
SWE-Pruner Pro:编程大语言模型早已知道该修剪什么
SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。