基于验证器与无验证器的测试时扩展结果比人们认为的更早,并且它不断得到确认 [D]
摘要
这篇文章讨论了已确认的研究发现:基于验证器的测试时计算扩展主导无验证器方法,并以Apodex等实际例子展示了分离验证过程带来的收益。它认为构建独立验证器是未来AI能力提升的关键路径。
Setlur等人的研究结果——即在没有验证或强化学习的情况下扩展测试时计算被证明是次优的——不断出现在我的阅读中,我认为它应该得到比“又一篇扩展论文”的待遇更多的重视。核心主张是,在固定计算预算下,基于验证器的方法(由验证器引导的强化学习或搜索)主导了无验证器方法(如提炼成功轨迹),并且随着测试时预算的增加,差距会扩大。
我觉得被低估的是,这与已部署系统目前正在趋同的方向多么清晰地吻合。单智能体ReAct循环是无验证器的极端情况:你采样一个轨迹并保留它,可能还带有一些自我反思,但这仍然是同一个模型在自我评分。那些真正推动指标提升的多智能体设置则将验证器分离成一个独立的过程。
Apodex是我见过的最明确的例子:他们训练了团队行为,并运行一个验证团队——冲突审查员、事实核查员、草稿审查员——这些不共享推理轨迹,并且报告的性能提升来自验证器,而非增加的参数。同一个训练好的模型,在重载模式下,在BrowseComp和FrontierScience-Research上增加了两位数的提升。这恰恰是理论预测的状态:收益存在于验证器。
我认为这之所以重要,不仅仅在于关注基准测试,还因为它重新定义了下一波能力从何而来。如果你相信VB优于VF的结果,那么路径不仅仅是更大的模型或更长的轨迹,而是构建在结构上独立于生成器的更好验证器。伪正确性框架也适用于此。验证器需要捕捉的失败模式不是明显的幻觉,而是那些通过了所有自我检查但仍然错误的答案,而这种失败模式对任何与生成器共享上下文的验证器来说都是不可见的。
我想听听其他人对于开放性问题的看法。我的清单如下:
- 验证器的增益有多少可以转移到没有清晰奖励信号的领域?因为数学证明案例是容易的。
- 独立性是否必须是架构上的(分离的智能体),还是说在一个模型上进行足够严格的提示分离就能大部分达到目的?
- 以及VB的优势是持续扩大,还是会在验证器本身成为瓶颈时饱和?
对于任何正在构建系统的人,实际版本是:如果你的智能体循环让同一个模型审查自己的工作,那么你就处于VF模式,理论表明你正在浪费能力。最便宜的结构性变化是让验证器成为一个具有隔离上下文的独立过程,即使它使用相同的权重。
相似文章
FineVerify:通过细粒度自我验证扩展智能搜索的测试时计算
FineVerify是一个针对智能搜索的自我验证框架,它将问题分解为子问题,验证采样候选,并选择最佳候选,在多个基准测试上取得了相对于基线的显著准确率提升,包括使GPT-5-mini在BrowseComp-Plus上超越GPT-5。
@hwchase17:验证器对于扩展评估/强化学习很重要,但成本会累积!那么,我们能让它们更便宜吗?@Vtrived... 等人的一些精彩工作
推文重点介绍了来自Harvey的研究人员关于让验证器更便宜以扩展评估和强化学习的工作。
测试时计算是否触及天花板?
本文探讨了AI模型在测试时计算扩展带来的收益是否正在减弱,这可能表明当前扩展范式正面临上限。
关于AI可靠性的两种对立策略:更智能的模型 vs 独立验证
本文探讨了两种关于AI可靠性的对立方法:投资更智能的模型与使用独立的验证系统,并指出在不同任务复杂程度下,两种方法可能各有适用场景。
@jchudnov: Pass@k 和自洽性在数学和代码上效果很好;多采样并验证。于是我们问:同样的技巧能否扩展……
一篇新论文显示,通过自洽性等方法扩展推理计算提高了LLM在数学和代码上的准确性,但在没有外部验证器的领域未能提高真实性,因为模型错误过于相关。