标签
本文介绍了GradCuit,一种测试时潜在推理方法,在选定的Transformer层插入可优化的潜在状态。它在五个骨干模型和三个推理基准上实现了64.5%的平均准确率,优于思维链提示,并展现出更好的稳健性和可解释性。
介绍了SEVRA,一种用于预算感知推理的选择性验证控制器,它决定何时接受模型的初始答案,何时在验证上花费额外计算资源,在MATH500和GSM8K等基准上提高了准确率并减少了不必要的token。