REVES: REVES:修订与验证增强的测试时扩展训练
摘要
提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。
查看缓存全文
缓存时间: 2026/06/18 23:59
论文页面 - REVES: 基于修正与验证增强的训练实现测试时扩展
来源:https://huggingface.co/papers/2606.18910
摘要
一个两阶段的迭代框架在数据增强与策略优化之间交替进行,通过利用中间修正步骤来提升大语言模型的推理能力,在编程基准测试和约束满足问题上取得了更优的性能。
通过顺序修正进行测试时扩展(https://huggingface.co/papers?q=Test-time%20scaling)已成为增强大语言模型(https://huggingface.co/papers?q=Large%20Language%20Model)(LLM)推理能力的有效范式。然而,标准的后训练方法主要针对单次输出目标进行优化,这与多步推理动态(https://huggingface.co/papers?q=multi-step%20inference%20dynamics)存在根本性的不匹配。虽然近期工作将其视为多轮强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL),但传统方法直接优化多步轨迹,未能进一步挖掘中间步骤(https://huggingface.co/papers?q=intermediate%20steps)中模型可通过修正学习到的高质量错误。我们提出一个两阶段迭代框架,在在线数据/提示增强(https://huggingface.co/papers?q=prompt%20augmentation)与策略优化(https://huggingface.co/papers?q=policy%20optimization)之间交替进行。通过将成功恢复轨迹中的中间步骤(“接近正确”的答案)转化为解耦的修正和验证提示,我们的训练聚焦于有效的答案转换(https://huggingface.co/papers?q=answer%20transformation)和错误识别(https://huggingface.co/papers?q=error%20identification)。这种方法实现了高效的离策略数据生成(https://huggingface.co/papers?q=off-policy%20data%20generation),并相比标准多轮RL减少了长程采样的计算开销。在LiveCodeBench上,使用公开可用的测试用例作为反馈,我们观察到相比RL基线提高了+6.5点,相比标准多轮训练提高了+4.0点。除编程外,我们的方法在圆填充问题上达到了此前报告的最佳结果,同时使用了最小的基础模型(4B)和远少于更大的进化搜索系统的 rollout 次数。基于真实验证的数学结果进一步证实了修正能力的提升。该方法还泛化到分布外的约束满足谜题(如 n_queens 和 mini_sudoku),这些问题的正确性完全由问题约束定义。代码见 https://github.com/yxliu02/REVES.git。
查看 arXiv 页面(https://arxiv.org/abs/2606.18910)查看 PDF(https://arxiv.org/pdf/2606.18910)GitHub(https://github.com/yxliu02/REVES)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18910)
在你的 agent 中获取这篇论文:
hf papers read 2606.18910
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.18910 即可从此页面关联。
引用该论文的数据集0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.18910 即可从此页面关联。
引用该论文的 Spaces0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.18910 即可从此页面关联。
包含该论文的收藏集0
暂无收藏集包含此论文
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中即可从此页面关联。
相似文章
重采样不如精炼:LLM推理中的测试时自校正
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。
SAGE:用于 LLM 知识评估的可扩展自动化鲁棒性增强
本文介绍了 SAGE,这是一个用于 LLM 知识评估基准测试的可扩展自动化鲁棒性增强框架。该框架使用经过强化学习微调的小模型,以低于现有方法的成本生成和验证问题变体。
TEMPO:为大推理模型扩展测试时训练
TEMPO 提出一种测试时训练框架,在策略微调与评判器再校准之间交替,防止多样性崩塌并持续放大推理模型的性能,将 Qwen3-14B 在 AIME 2024 上的得分从 42.3% 提升至 65.8%。
EvoTrainer:面向自主智能体强化学习的LLM策略与训练框架协同进化
EvoTrainer提出了一种自主训练框架,通过经验反馈协同进化LLM策略与训练框架,在数学推理、代码生成以及长期软件工程任务上超越了人工设计的强化学习基线。
VeriEvol: 通过可验证的Evol-Instruct扩展多模态数学推理
VeriEvol是一个新颖的框架,用于在视觉数学推理中扩展强化学习,通过一个双轴方法来确保可靠的奖励标签,该双轴方法将提示难度与答案可靠性分离,使用进化算子和假设检验验证。它在五个基准的视觉数学测试集上取得了显著的准确率提升。