REVES: REVES:修订与验证增强的测试时扩展训练

Hugging Face Daily Papers 论文

摘要

提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。

测试时扩展通过顺序修订已成为增强大语言模型(LLM)推理能力的强大范式。然而,标准的后训练方法主要优化单次目标,与多步推理动态存在根本性的错配。尽管最近的工作将这一过程视为多轮强化学习(RL),但传统方法直接优化多步轨迹,未能进一步利用模型从中学习修正的高质量中间步骤错误。我们提出一种两阶段迭代框架,在在线数据/提示增强与策略优化之间交替进行。通过将成功恢复轨迹中的中间步骤(“近乎正确”的答案)转化为分离的修订与验证提示,我们的方法聚焦于有效的答案转换与错误识别。与标准多轮RL相比,这一方法实现了高效的离线策略数据生成,并减少了长程采样的计算开销。在LiveCodeBench上,利用公开的测试用例作为反馈,我们观察到相比RL基线提升+6.5个百分点,相比标准多轮训练提升+4.0个百分点。除了编程,我们的方法在圆堆积问题上匹配了此前报告的最优结果(SOTA),同时使用最小的基础模型(4B),且rollout次数远少于更大的进化搜索系统。在真实值验证下的数学结果进一步确认了修正能力的提升。该方法还能泛化到分布外的约束满足谜题,如n_queens和mini_sudoku,其中正确性完全由问题约束定义。代码可在https://github.com/yxliu02/REVES.git获取。
查看原文
查看缓存全文

缓存时间: 2026/06/18 23:59

论文页面 - REVES: 基于修正与验证增强的训练实现测试时扩展

来源:https://huggingface.co/papers/2606.18910

摘要

一个两阶段的迭代框架在数据增强与策略优化之间交替进行,通过利用中间修正步骤来提升大语言模型的推理能力,在编程基准测试和约束满足问题上取得了更优的性能。

通过顺序修正进行测试时扩展(https://huggingface.co/papers?q=Test-time%20scaling)已成为增强大语言模型(https://huggingface.co/papers?q=Large%20Language%20Model)(LLM)推理能力的有效范式。然而,标准的后训练方法主要针对单次输出目标进行优化,这与多步推理动态(https://huggingface.co/papers?q=multi-step%20inference%20dynamics)存在根本性的不匹配。虽然近期工作将其视为多轮强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL),但传统方法直接优化多步轨迹,未能进一步挖掘中间步骤(https://huggingface.co/papers?q=intermediate%20steps)中模型可通过修正学习到的高质量错误。我们提出一个两阶段迭代框架,在在线数据/提示增强(https://huggingface.co/papers?q=prompt%20augmentation)与策略优化(https://huggingface.co/papers?q=policy%20optimization)之间交替进行。通过将成功恢复轨迹中的中间步骤(“接近正确”的答案)转化为解耦的修正和验证提示,我们的训练聚焦于有效的答案转换(https://huggingface.co/papers?q=answer%20transformation)和错误识别(https://huggingface.co/papers?q=error%20identification)。这种方法实现了高效的离策略数据生成(https://huggingface.co/papers?q=off-policy%20data%20generation),并相比标准多轮RL减少了长程采样的计算开销。在LiveCodeBench上,使用公开可用的测试用例作为反馈,我们观察到相比RL基线提高了+6.5点,相比标准多轮训练提高了+4.0点。除编程外,我们的方法在圆填充问题上达到了此前报告的最佳结果,同时使用了最小的基础模型(4B)和远少于更大的进化搜索系统的 rollout 次数。基于真实验证的数学结果进一步证实了修正能力的提升。该方法还泛化到分布外的约束满足谜题(如 n_queens 和 mini_sudoku),这些问题的正确性完全由问题约束定义。代码见 https://github.com/yxliu02/REVES.git。

查看 arXiv 页面(https://arxiv.org/abs/2606.18910)查看 PDF(https://arxiv.org/pdf/2606.18910)GitHub(https://github.com/yxliu02/REVES)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18910)

在你的 agent 中获取这篇论文:

hf papers read 2606.18910

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2606.18910 即可从此页面关联。

引用该论文的数据集0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.18910 即可从此页面关联。

引用该论文的 Spaces0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2606.18910 即可从此页面关联。

包含该论文的收藏集0

暂无收藏集包含此论文

将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中即可从此页面关联。

相似文章

重采样不如精炼:LLM推理中的测试时自校正

arXiv cs.AI

一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。

TEMPO:为大推理模型扩展测试时训练

Hugging Face Daily Papers

TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。

VeriEvol: 通过可验证的Evol-Instruct扩展多模态数学推理

Hugging Face Daily Papers

VeriEvol是一个新颖的框架,用于在视觉数学推理中扩展强化学习,通过一个双轴方法来确保可靠的奖励标签,该双轴方法将提示难度与答案可靠性分离,使用进化算子和假设检验验证。它在五个基准的视觉数学测试集上取得了显著的准确率提升。