重新思考还是思考更久?面向预算感知推理的选择性验证
摘要
介绍了SEVRA,一种用于预算感知推理的选择性验证控制器,它决定何时接受模型的初始答案,何时在验证上花费额外计算资源,在MATH500和GSM8K等基准上提高了准确率并减少了不必要的token。
查看缓存全文
缓存时间: 2026/06/20 14:30
论文页面 - 再思考还是更久思考?面向预算感知推理的选择性验证
来源:https://huggingface.co/papers/2606.19808
测试时推理通常被视为一个简单的旋钮:给模型更多token、要求它验证、或让它重试。但额外的推理并不总是有帮助。它可能修复失败的尝试,但在原本正确的答案上浪费计算资源,甚至可能把一个正确答案翻转成错误答案。
我们将此作为一个部署分配问题来研究:推理系统应该在何时接受其第一个答案,又应该在何时投入额外计算进行验证?
我们提出SEVRA——面向推理分配的选择性验证(Selective Verification for Reasoning Allocation)——一个服务层控制器,用于决定是保留冻结求解器的初始答案,还是调用主动验证。我们使用冻结的Qwen3-4B求解器,记录生成后干预的结果,并从服务层可见的信号(如完成状态、token使用、终结器使用和尝试状态)中训练可恢复性感知的门控。
在多个基准测试中,SEVRA表明选择性验证可以提高可靠性并减少不必要的验证。在MATH500上,它达到76.3%的准确率,而始终验证则为75.5%,同时减少了26.8%的生成后token,并将有害翻转从2.2%降至1.0%。在GSM8K上,它仅验证3.0%的样本,准确率从93.4%提升至94.5%,与始终验证相比减少了**91.2%**的验证token。
然而,故事并非简单的“验证更多“。在数学基准测试上,更长的初始求解与选择性验证表现相当,且实际使用的token更少;而在CommonsenseQA上,始终开启的验证反而有害。这表明验证作为一种恢复和可审计性机制很有用,但并非总是最佳的计算分配方式。
实际得出的结论是:
首先调整初始推理预算。然后在需要显式检查、有限重试、可审计性或回归风险控制时,再使用选择性验证。
相似文章
REVES: REVES:修订与验证增强的测试时扩展训练
提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。
重采样不如精炼:LLM推理中的测试时自校正
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。
平衡思考的高效推理
本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。
停止向量:内化因果干预以实现高效推理
本文提出了一种停止向量方法,用于在推理模型(如DeepSeek-R1-Distill-Qwen-7B)中内部控制思考长度,在保持准确性的同时减少不必要的推理。
VeriGate:用于GRPO的验证器门控步级监督
VeriGate通过验证器门控步级监督扩展了GRPO,在验证器奖励退化时提供细粒度的信用分配。在1.5B和7B模型的推理基准测试上实现了显著的准确率提升。