@rosinality: https://arxiv.org/abs/2607.12395 RL without SFT. 一个有趣的点是,他们能够使推理过程变得…

X AI KOLs Timeline 论文

摘要

论文《Ring-Zero》提出了一种稳定的训练流程,将零强化学习(无需监督微调)扩展到1万亿参数,实现了涌现推理能力,如自我验证和结构化格式化,并在数学基准测试中表现出色。

https://t.co/hQKc70Yh9t RL without SFT. 一个有趣的点是,他们仅通过RL就能使推理过程变得易于理解且高效。 https://t.co/HQpZBZOHAB
查看原文
查看缓存全文

缓存时间: 2026/07/16 20:23

https://t.co/hQKc70Yh9t 无需SFT的强化学习。有趣的一点是,仅通过强化学习就能使推理轨迹既易于理解又高效。https://t.co/HQpZBZOHAB — # Ring-Zero: 将零强化学习扩展到万亿参数以实现涌现推理 来源:https://arxiv.org/html/2607.12395 \contribution [*]同等贡献。\contribution[‡]通讯作者。 曹刚强 刘雨柔 詹玉良 蓝晓冲 李逸凡 严宇辰 韩鹏 董梓灿 张振铎 王天舒 孔欣宇 温祖杰 赵鑫 张智强 周军 ###### 摘要 基于可验证奖励的强化学习(RLVR)无需人工标注数据,通常被称为“零强化学习”,已成为激发链式思维(CoT)推理的强大范式。然而,受计算资源限制,现有研究大多局限于小模型,其在大规模下的训练动态和涌现能力尚未得到充分探索。为了有意义地探索这一前沿领域,我们的目标是激发模型产生高质量的推理行为。然而,我们发现简单的扩展往往导致可读性差、令牌冗余以及缺乏自适应推理深度。为了解决这些挑战,我们提出了一条稳定高效的训练流程,整合了算法和系统优化,例如裁剪重要性采样、训练-推理比率校正和混合精度控制。我们的实验提供了三个关键发现,验证了扩展的“苦涩教训”:(1)扩展到1万亿参数显著提升了样本效率和性能上限;(2)训练过程依次经历了初始的“发现”阶段和后续的“锐化”阶段;(3)模型自发地发展出高级认知行为,包括拟人化、结构化格式、自我验证、并行推理和上下文焦虑,使得手工设计的启发式方法变得多余。在七个具有挑战性的数学基准上评估,Ring-2.5-1T-Zero 取得了具有竞争力的性能。此外,为了评估超越最终答案正确性的CoT质量,我们提出了一个结构化的评估框架,涵盖三个维度:可理解性、可再现性和效率,在该框架下,我们的模型在生成结构化和简洁的推理轨迹方面展现出明显优势。通过分享我们的实验细节和观察到的涌现现象,我们希望为社区提供关于扩展行为(尤其是在1万亿参数规模)的更深层次见解。 \addsecondlogo [3.8cm]assets/gsai.png ## 1 引言 随着模型参数的扩展,链式思维(CoT)推理(Wei 等,2022 (https://arxiv.org/html/2607.12395#bib.bib31); Kojima 等,2022 (https://arxiv.org/html/2607.12395#bib.bib16); Lightman 等,2024 (https://arxiv.org/html/2607.12395#bib.bib17))已成为测试时计算的一个关键扩展维度,并成为大型语言模型(LLMs)(Zhao 等,2026 (https://arxiv.org/html/2607.12395#bib.bib38); Brown 等,2020 (https://arxiv.org/html/2607.12395#bib.bib1); Kaplan 等,2020 (https://arxiv.org/html/2607.12395#bib.bib14))解决复杂任务的基础能力。近期工作(Shao 等,2024 (https://arxiv.org/html/2607.12395#bib.bib25))表明,基于可验证奖励的强化学习(RLVR)可以有效增强推理能力。特别是,“零强化学习”(Guo 等,2025 (https://arxiv.org/html/2607.12395#bib.bib9))范式与传统模仿学习不同,它直接从预训练的基座模型开始进行强化学习,完全绕过监督式CoT数据的需求,并已被证明能够激励涌现的问题解决策略。这一突破表明,强大的推理能力可以纯粹通过试错强化学习来培养,从而避免了对昂贵且精心策划的推理示范的依赖。 在过去的一年中,研究社区对直接从基座模型中引出推理行为表现出了相当大的兴趣。大量的工作集中在高质量的数据策划上,生成多样化的链式思维数据集以引导推理能力(Dobler 等,2026 (https://arxiv.org/html/2607.12395#bib.bib6); Huang 等,2026 (https://arxiv.org/html/2607.12395#bib.bib12); Zeng 等,2025a (https://arxiv.org/html/2607.12395#bib.bib36))。在这些基础之上,提出了各种策略优化算法来稳定(Zheng 等,2025a (https://arxiv.org/html/2607.12395#bib.bib39); Yao 等,2025 (https://arxiv.org/html/2607.12395#bib.bib32); Tang 等,2025 (https://arxiv.org/html/2607.12395#bib.bib28))并提升优化效能(Yu 等,2025 (https://arxiv.org/html/2607.12395#bib.bib33); MiniMax,2025 (https://arxiv.org/html/2607.12395#bib.bib21); Chen 等,2025b (https://arxiv.org/html/2607.12395#bib.bib3))。为了适应这些密集的算法工作负载,可扩展的训练基础设施也经历了并行演进(Hu 等,2024 (https://arxiv.org/html/2607.12395#bib.bib10); Sheng 等,2025 (https://arxiv.org/html/2607.12395#bib.bib26); Zhu 等,2025 (https://arxiv.org/html/2607.12395#bib.bib41); Fu 等,2025 (https://arxiv.org/html/2607.12395#bib.bib7))。然而,受计算需求的限制,绝大多数现有研究依赖于相对较小的模型。虽然这些研究提供了宝贵的见解,但一个根本问题仍然悬而未决:当应用于万亿参数模型时,零强化学习的训练动态和涌现能力将如何演变? 更大的模型拥有更丰富的预训练知识和潜在的、易于优化的能力(Guo 等,2025 (https://arxiv.org/html/2607.12395#bib.bib9))。因此,在这一大规模上进行零强化学习的探索,对于绘制自我进化推理的真正边界至关重要。 为了有意义地探索这一前沿领域,我们的主要目标是激发模型产生高质量的推理行为,这自然要求我们首先定义什么构成了高质量的推理过程。虽然得出正确的最终答案至关重要,但推理路径本身的质量同样重要。我们认为,理想的CoT轨迹不仅应准确无误,还应具有人类可读性以便于验证,并且在计算上简洁以节省推理资源。然而,我们发现简单应用零强化学习严重偏离了这些理想状态,暴露出几个关键限制。首先,现有的推理轨迹通常存在 可读性差 的问题。它们通常缺乏逻辑格式和清晰的结构,使得人类难以跟踪和理解思维过程。其次,诸如GRPO之类的标准算法通常通过将不成比例的信度分配给较长的序列而引入隐式的长度偏差。虽然令牌级别的损失在早期训练中鼓励探索,但最终会导致不受控制的长度增长和令牌冗余,使推理过程变得高度 低效。此外,不同问题本身需要 不同的推理深度,然而标准的训练流程通常会产生一个受固定响应预算约束的单模式模型。 在这项工作中,我们提出了一条万亿参数自迭代流程,从头开始训练模型以进行涌现推理。从我们的探索中得到的一个关键见解是,在1T规模下稳定训练只需要一些简单但关键的修改。在此原则指导下,我们的流程避免了繁重的工程。它只是将裁剪的重要性比率策略梯度与训练-推理比率校正结合以激励推理,将自蒸馏用于压缩和稳定,将样本级损失归一化用于稳定训练,以及将基于层级的自适应训练用于灵活的推理深度。我们还实施了基础设施优化,包括混合精度控制和上下文并行性,以实现稳定高效的训练。 直接回答我们的核心问题,我们的万亿参数实验有力地验证了人工智能中的“苦涩教训”:大规模计算和规模最终会超越人类设计的启发式方法。我们将见解总结为三个关键发现:首先,规模决定了能力上限。1T模型展现出远超其104B对应模型的样本效率,并达到了显著更高的性能界限。其次,我们的分析阐明了“发现与锐化”的争论,表明这两种现象是作为连续阶段共存的。一个初始的“发现”阶段解锁了潜在的路径,以扩展推理边界,随后是一个长期的“锐化”阶段,在该阶段中,模型在这个新建立的边界内完善其策略。第三,也是最引人注目的是,我们观察到了高级认知策略的自发涌现。虽然研究人员历史上设计了复杂的流程来激励改进的思维机制,但Ring-2.5-1T-Zero使得这些人工设计的启发式方法变得多余。纯粹由这种自迭代训练过程驱动,无需任何人工标注数据,模型自主地将几种关键涌现行为收敛为最优的数学解决方案:拟人化结构化格式自我验证并行推理上下文焦虑。 最后,我们在七个具有挑战性的数学基准上评估了Ring-2.5-1T-Zero,发现我们的模型取得了与前沿模型相当的竞争力。此外,为了评估超越最终答案准确性的CoT质量,我们提出了一个结构化的评估框架,涵盖三个维度:可理解性可再现性效率。在这些指标下,我们的模型在生成结构化、人类可读且简洁的推理轨迹方面展现出明显优势。 我们的主要贡献总结如下: ∙\bullet我们证明了只需微小的算法和系统改进(例如,裁剪重要性采样、训练-推理比率校正和混合精度控制),我们的自迭代训练过程就能保持稳定和高效,成功训练出Ring-2.5-1T-Zero,取得具有竞争力的性能。 ∙\bullet我们引入了一个CoT质量评估框架,从三个维度评估推理轨迹:可理解性、可再现性和效率。该框架超越了最终答案的准确性,为了解推理过程本身的质量提供了诊断信号。 ∙\bullet我们对大规模下的苦涩教训进行了实证验证,证明扩展到万亿参数模型能够释放更高的样本效率和性能上限,同时实现高级认知策略的自主涌现,包括拟人化、结构化格式、自我验证、并行推理和上下文焦虑,使得手工设计变得多余。 ## 2 链式思维质量的评估指标 评估链式思维(CoT)推理的质量仍然是一个开放的挑战。目前,大多数评估(GLM,2026 (https://arxiv.org/html/2607.12395#bib.bib8); Kimi,2026 (https://arxiv.org/html/2607.12395#bib.bib15))仅依赖最终答案的准确性作为唯一指标。然而,准确性只衡量最终结果,将底层的推理过程视为黑盒。随着LLMs越来越多地部署在复杂任务和代理工作流中,CoT轨迹具有双重目的:它们提供人类可读的解释,并作为下游代理系统的关键中间步骤。因此,全面的评估必须超越单纯的正确性。 在我们的实验之前,我们预先定义了一个理想CoT轨迹应具备的几个基本特征。在这些期望的指导下,我们构建了一个结构化的评估框架,从三个互补维度评估CoT质量:可理解性可再现性效率。可理解性确保逻辑透明且易于人类阅读;可再现性衡量推理策略能否被较弱的模型有效且高效地学习;效率评估生成的简洁性和计算成本效益。这三个维度独立于最终答案的正确性,又与之高度互补。 ### 2.1 可理解性 可理解性衡量人类读者在不需外部上下文或高认知负荷的情况下,能够跟随推理步骤的程度。透明的CoT轨迹应具有连贯的逻辑流程、步骤之间明确的因果依赖关系,并且没有幻觉式断言。当这些属性中的任何一个被违反时,轨迹就失去了其主要的解释目的,从而削弱用户信任。 为了定量评估可理解性,我们采用基于 LLM作为裁判 的框架进行成对比较。给定相同的问题,裁判LLM评估来自不同模型的CoT轨迹,并选择逻辑一致性更强、表述更清晰、推理缺陷更少的那一个。完整的评估提示详见附录B (https://arxiv.org/html/2607.12395#A2)。 ### 2.2 可再现性 可再现性评估一个缺乏先验领域知识的智能体(例如,新手人类或较弱的模型)能否有效且高效地学习底层推理过程并获得可比的任务解决能力。理想的轨迹编码了可泛化的问题解决策略,而非直觉上的跳跃,使较弱的模型能够学习底层逻辑。 我们通过 知识蒸馏 来测量可再现性。通过在一个较弱的模型上对生成的CoT轨迹进行微调,我们使用学生模型的下游性能提升作为代理。提升越大,表明教师的轨迹承载了丰富且可迁移的推理技能。 ### 2.3 效率 效率评估模型简洁地解决问题的能力,避免不必要的冗长、冗余推导或循环逻辑。此外,随着CoT轨迹被大量集成到代理工作流中,生成效率直接转化为更快的推理速度和更低的令牌成本。高效的CoT在保持清晰度和正确性的同时,隔离解决路径的精华部分。 在实践中,我们通过计算 正确CoT轨迹的平均令牌数 来衡量效率。在有效的解决方案中,令牌越少表示效率越高,表明模型找到了直接且最优的答案路径,而不是在无关的探索中迂回。 ## 3 方法论 参考图说明 图1:Ring-2.5-1T-Zero 概览。(a) 多阶段训练流程。第一阶段RL从基座模型激励推理。自蒸馏压缩CoT轨迹并重置训练-推理引擎差距。第二阶段RL转向样本级损失以实现持续改进。第三阶段RL引入基于层级的训练以实现自适应推理深度。(b) 基础设施优化,用于大规模稳定高效的训练。(c) 无需显式监督而自发出现的涌现行为。 在本节中,我们提出一个训练框架,该框架直接从基座模型中引出并扩展推理能力,而不依赖于人工标注数据。我们框架的核心设计原则是极简主义。基于我们发现过于复杂的算法设计往往不必要的认识,我们仅在严格需要时才引入优化元素。

相似文章

Self-Distillation Zero:自我修订将二元奖励转化为密集监督

Hugging Face Daily Papers

Self-Distillation Zero (SD-Zero) 是一种新颖的训练方法,通过双角色训练将稀疏的二元奖励转化为密集的token级监督,其中模型同时充当生成器和修订者,在数学和代码推理基准上实现了超过10%的性能提升,且样本效率高于强化学习方法。

MindZero:零标注下的在线心智推理学习

arXiv cs.AI

MindZero 提出了一种自监督强化学习框架,用于训练多模态大语言模型,使其能够高效且鲁棒地进行在线心智推理,而无需心智状态标注,在准确性和效率上均优于基于模型的方法。

学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集

arXiv cs.CL

本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。