Ring-Zero: 将零强化学习扩展到万亿参数以实现涌现推理

arXiv cs.CL 论文

摘要

Ring-Zero将带可验证奖励的强化学习扩展到万亿参数模型,展示了无需人工标注数据的涌现推理行为,如自我验证和结构化格式。

arXiv:2607.12395v1 Announce Type: new 摘要:带可验证奖励且无需人工标注数据的强化学习(通常称为零强化学习,Zero RL)已成为激发链式思维推理的强大范式。然而,由于计算限制,现有研究大多局限于小模型,使得大规模训练动态和涌现能力尚未得到探索。为了有意义地探索这一前沿,我们旨在激发模型的高质量推理行为。然而,我们发现朴素扩展往往存在可读性差、词元冗余以及缺乏自适应推理深度的问题。为解决这些挑战,我们提出了一种稳定高效的训练流程,融合了裁剪重要性采样、训练-推理比例校正和混合精度控制等算法与系统优化。我们的实验提供了三个关键发现,验证了扩展的“苦涩教训”:(1)扩展到1万亿参数显著提升了样本效率和性能上限;(2)训练过程按顺序经历初始发现阶段和随后的锐化阶段;(3)模型自发发展出高级认知行为,包括拟人化、结构化格式、自我验证、并行推理和上下文焦虑,使得手工启发式规则变得多余。在七个数学基准上的评估显示,Ring-2.5-1T-Zero取得了有竞争力的表现。此外,为了超越最终答案正确性评估链式思维推理(CoT)质量,我们提出了一个涵盖可理解性、可复现性和效率三个维度的结构化评估框架,我们的模型在生成结构化和简洁的推理轨迹方面展现出明显优势。通过分享我们观察到的涌现现象,我们希望为社区提供关于扩展行为的更深入见解,特别是在1万亿规模上。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# Ring-Zero: 将零强化学习扩展到万亿参数以实现涌现推理  
来源:https://arxiv.org/html/2607.12395  
\\contribution \[\*\]同等贡献。\\contribution\[‡\]通讯作者。  
Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang, Tianshu Wang, Xinyu Kong, Zujie Wen, Wayne Xin Zhao, Zhiqiang Zhang, Jun Zhou  

###### 摘要  

无需人工标注数据的可验证奖励强化学习(RLVR),通常被称为“零强化学习”,已成为激发思维链(CoT)推理能力的一种强大范式。然而,由于计算资源的限制,现有研究大多局限于小模型,尚未探索大规模下的训练动态和涌现能力。为了有意义上地探索这一前沿,我们旨在从模型中激发高质量的推理行为。但我们发现,简单的规模扩展往往会导致可读性差、令牌冗余以及缺乏自适应推理深度等问题。为解决这些挑战,我们提出了一套稳定高效的训练流程,集成了算法和系统优化,例如裁剪重要性采样、训练-推理比率校正以及混合精度控制。我们的实验提供了三个关键发现,验证了规模化的“苦涩教训”:(1) 将模型扩展到1万亿参数显著提升了样本效率和性能上限;(2) 训练过程依次经历初始的“发现”阶段和随后的“精炼”阶段;(3) 模型自发发展出高级认知行为,包括拟人化、结构化格式、自我验证、并行推理和上下文焦虑,使手工设计的启发式方法变得多余。在七个具有挑战性的数学基准测试上,Ring-2.5-1T-Zero 取得了具有竞争力的性能。此外,为了评估思维链质量(而不仅仅是最终答案的正确性),我们提出了一个结构化评估框架,涵盖三个维度:可理解性、可复现性和效率。在此框架下,我们的模型在生成结构化且简洁的推理轨迹方面展现出明显优势。通过分享我们的实验细节和观察到的涌现现象,我们希望为社区提供关于规模化行为更深入的见解,特别是在万亿参数规模上。  

\\addsecondlogo \[3.8cm\]assets/gsai.png  

## 1 引言  

随着模型参数的规模化,思维链(CoT)推理(Wei et al., 2022 (https://arxiv.org/html/2607.12395#bib.bib31); Kojima et al., 2022 (https://arxiv.org/html/2607.12395#bib.bib16); Lightman et al., 2024 (https://arxiv.org/html/2607.12395#bib.bib17))已成为测试时计算的一个关键规模化维度,并成为大型语言模型(LLMs)(Zhao et al., 2026 (https://arxiv.org/html/2607.12395#bib.bib38); Brown et al., 2020 (https://arxiv.org/html/2607.12395#bib.bib1); Kaplan et al., 2020 (https://arxiv.org/html/2607.12395#bib.bib14))解决复杂任务的基础能力。最近的工作(Shao et al., 2024 (https://arxiv.org/html/2607.12395#bib.bib25))表明,可验证奖励强化学习(RLVR)能够有效增强推理能力。特别是,“零强化学习”范式(Guo et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib9))与传统模仿学习不同,它直接从预训练基础模型开始强化学习,完全绕过了对有监督 CoT 数据的需求,并已被证明能够激励涌现式问题解决策略。这一突破表明,强大的推理能力可以通过纯试错强化学习来培养,从而避免了对昂贵且精心设计的推理演示的依赖。  

在过去一年中,研究社区对直接从基础模型中激发推理行为表现出了相当大的兴趣。大量工作集中在高质量数据整理上,生成多样化的思维链数据集以启动推理能力(Dobler et al., 2026 (https://arxiv.org/html/2607.12395#bib.bib6); Huang et al., 2026 (https://arxiv.org/html/2607.12395#bib.bib12); Zeng et al., 2025a (https://arxiv.org/html/2607.12395#bib.bib36))。在这些基础之上,各种策略优化算法被提出以稳定(Zheng et al., 2025a (https://arxiv.org/html/2607.12395#bib.bib39); Yao et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib32); Tang et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib28))并提升优化效率(Yu et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib33); MiniMax, 2025 (https://arxiv.org/html/2607.12395#bib.bib21); Chen et al., 2025b (https://arxiv.org/html/2607.12395#bib.bib3))。为适应这些密集的算法工作负载,可扩展的训练基础设施也经历了并行演进(Hu et al., 2024 (https://arxiv.org/html/2607.12395#bib.bib10); Sheng et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib26); Zhu et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib41); Fu et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib7))。然而,受计算需求限制,绝大多数现有研究依赖于相对较小的模型。尽管这些研究提供了宝贵的见解,但一个基本问题仍未得到解答:**当应用于万亿参数模型时,零强化学习的训练动态和涌现能力将如何演变?** 更大的模型拥有更丰富的预训练知识和潜在能力,更易于优化(Guo et al., 2025 (https://arxiv.org/html/2607.12395#bib.bib9))。因此,在这一大规模上探索零强化学习,对于描绘自我进化推理的真正边界至关重要。  

为了有意义上地探索这一前沿,我们的主要目标是激发模型产生高质量的推理行为,这自然需要我们首先定义什么构成了高质量的推理过程。虽然得出正确的最终答案至关重要,但推理路径本身的质量同样重要。我们相信,理想的 CoT 轨迹不仅应正确,还应便于人类阅读验证,并且在计算上简洁以节省推理资源。然而,我们发现零强化学习的简单应用严重偏离了这些理想,暴露出几个关键局限性。首先,现有的推理轨迹常常存在**可读性差**的问题。它们通常缺乏逻辑格式和清晰的结构,使人类难以跟随和理解思维过程。其次,像 GRPO 这样的标准算法通常会通过给更长的序列分配不成比例的信度而引入隐式的长度偏好。虽然令牌级损失在早期训练中鼓励探索,但最终会导致不受控制的长度增长和令牌冗余,使推理过程变得**极低效**。此外,不同问题本质上需要**不同深度的推理**,然而标准的训练流程通常会产生一个由固定响应预算约束的单模态模型。  

在这项工作中,我们提出了一套万亿参数自迭代流程,用于从头训练具备涌现推理能力的模型。我们探索中的一个关键洞见是:在 1T 规模上稳定训练仅需要少数**简单但关键**的修改。在此原则指导下,我们的流程避免了繁重的工程实现。它简单地结合了裁剪重要性比率策略梯度与训练-推理比率校正以激励推理、自蒸馏用于压缩和稳定、样本级损失归一化用于稳定训练,以及基于层级的分级自适应训练用于灵活的推理深度。我们还实现了基础设施优化,包括混合精度控制和上下文并行,以实现稳定高效的训练。直接回答我们的核心问题,我们的万亿参数实验极大地验证了人工智能中的“苦涩教训”:大规模计算和规模最终会超越人工设计的启发式方法。我们将我们的见解总结为三个关键发现:  

第一,**规模决定能力上限**。与 104B 模型相比,1T 模型展现出显著优越的样本效率,并达到了更高的性能边界。第二,我们的分析揭示了“发现与精炼”的争论,表明**这两个现象作为相继阶段共存**。一个初始的“发现”阶段解锁沉睡的路径以扩展推理边界,随后是一个漫长的“精炼”阶段,模型在此阶段内精炼其策略。第三,最引人注目的是,我们观察到**高级认知策略的自发涌现**。当研究人员历史上构建复杂的流程来激励更好的思维机制时,Ring-2.5-1T-Zero 使这些手工设计的启发式方法变得多余。完全由这种自迭代训练过程驱动,没有任何人工标注数据,模型自主收敛于几种关键的涌现行为作为最优数学解决方案:**拟人化**、**结构化格式**、**自我验证**、**并行推理**和**上下文焦虑**。  

最后,我们在七个具有挑战性的数学基准测试上评估了 Ring-2.5-1T-Zero,发现我们的模型取得了可与前沿模型相媲美的竞争性性能。此外,为了评估 CoT 质量而不仅仅是最终答案的准确性,我们提出了一个涵盖三个维度的结构化评估框架:**可理解性**、**可复现性**和**效率**。在这些指标下,我们的模型在生成结构化、人类可读且简洁的推理轨迹方面展现出明显优势。  

我们的主要贡献总结如下:  

∙\\bullet 我们证明,仅通过次要的算法和系统改进(*例如*,裁剪重要性采样、训练-推理比率校正和混合精度控制),我们的自迭代训练过程保持稳定高效,成功训练出 Ring-2.5-1T-Zero 并获得具有竞争力的性能。  
∙\\bullet 我们引入了一个 CoT 质量评估框架,从三个维度评估推理轨迹:可理解性、可复现性和效率。该框架超越了最终答案的准确性,并为理解推理过程本身的质量提供了诊断信号。  
∙\\bullet 我们提供了苦涩教训在大规模下的实证验证,证明将模型扩展到万亿参数解锁了更高的样本效率和性能上限,同时使高级认知策略(包括拟人化、结构化格式、自我验证、并行推理和上下文焦虑)自主涌现,使手工设计变得多余。  

## 2 思维链质量评估指标  

评估思维链(CoT)推理的质量仍然是一个未解决的挑战。目前,大多数评估(GLM, 2026 (https://arxiv.org/html/2607.12395#bib.bib8); Kimi, 2026 (https://arxiv.org/html/2607.12395#bib.bib15))依赖于最终答案的准确性作为唯一指标。然而,准确率只衡量最终结果,将底层推理过程视为黑箱。随着大语言模型越来越多地部署于复杂任务和代理工作流,CoT 轨迹具有双重目的:它们既提供人类可读的解释,又充当下游代理系统的关键中间步骤。因此,一个全面的评估必须超越单纯的正确性。  

在我们的实验之前,我们预先定义了一个理想 CoT 轨迹应具备的几个基本特性。在这些期望的指导下,我们构建了一个结构化评估框架,从三个互补维度评估 CoT 质量:**可理解性**、**可复现性**和**效率**。可理解性确保逻辑透明且易于人类阅读;可复现性衡量推理策略能否被较弱模型有效且高效地学习;效率评估生成是否简洁且计算成本效益高。这三个维度独立于最终答案的正确性,但与其高度互补。  

### 2.1 可理解性  

可理解性衡量人类读者在不需外部上下文或高认知负荷的情况下,能够跟随推理步骤的程度。一个透明的 CoT 轨迹应具有连贯的逻辑流、步骤间明确的因果依赖关系,并且没有幻觉性断言。当这些属性中的任何一个被违反时,轨迹就未能实现其主要解释目的,削弱了用户信任。为了定量评估可理解性,我们采用 **“LLM 作为裁判”** 框架进行成对比较。对于相同的问题,一个裁判大语言模型评估来自不同模型的 CoT 轨迹,并选择逻辑一致性更强、表达更清晰、推理缺陷更少的那一个。完整的评估提示见附录 B (https://arxiv.org/html/2607.12395#A2)。  

### 2.2 可复现性  

可复现性评估一个缺乏先验领域知识的智能体(例如,一个新手人类或一个较弱的 student 模型)能否有效且高效地学习底层推理过程并获得可比的解决问题的能力。理想的轨迹编码了可泛化的问题解决策略,而非直觉跳跃,使较弱的 student 模型能够学习底层逻辑。我们通过**知识蒸馏**来测量可复现性。通过在一个较弱的模型上微调生成的 CoT 轨迹,我们使用 student 模型下游性能的提升作为代理指标。改进越大,表明教师模型的轨迹承载了丰富且可迁移的推理技能。  

### 2.3 效率  

效率评估模型简洁解决问题的能力,避免不必要的冗长、冗余推导或循环逻辑。此外,由于 CoT 轨迹被大量集成到代理工作流中,生成效率直接转化为更快的推理速度和更低的令牌成本。一个高效的 CoT 在没有牺牲清晰度或正确性的情况下,提取了通往解决方案的必要路径。在实践中,我们通过计算**正确 CoT 轨迹的平均令牌数**来衡量效率。在有效解决方案中,令牌越少表明效率越高,说明模型已经识别出通往答案的直接且最优的路径,而不是在不相关的探索中迂回。  

## 3 方法学  

参考图标题  
图 1:Ring-2.5-1T-Zero 概览。(a) 多阶段训练流程。第一阶段 RL 从基础模型中激励推理。自蒸馏压缩 CoT 轨迹并重置训练-推理引擎差距。第二阶段 RL 转变为样本级损失以实现持续改进。第三阶段 RL 引入基于层级的分级训练以实现自适应推理深度。(b) 用于大规模稳定高效训练的基础设施优化。(c) 没有显式监督下自发产生的涌现行为。  

在本节中,我们提出一个训练框架,该框架直接从基础模型中激发并扩展推理能力,而不依赖人工标注数据。我们框架的一个核心设计原则是**极简主义**。根据我们的发现,过于复杂的算法设计往往是不必要的,我们仅在严格需要引导模型迭代学习时才引入优化元素。我们首先概述多阶段训练流程(第 3.1 节 (https://arxiv.org/html/2607.12395#S3.SS1)),该流程逐步构建推理能力。

相似文章

MindZero:零标注下的在线心智推理学习

arXiv cs.AI

MindZero 提出了一种自监督强化学习框架,用于训练多模态大语言模型,使其能够高效且鲁棒地进行在线心智推理,而无需心智状态标注,在准确性和效率上均优于基于模型的方法。

Self-Distillation Zero:自我修订将二元奖励转化为密集监督

Hugging Face Daily Papers

Self-Distillation Zero (SD-Zero) 是一种新颖的训练方法,通过双角色训练将稀疏的二元奖励转化为密集的token级监督,其中模型同时充当生成器和修订者,在数学和代码推理基准上实现了超过10%的性能提升,且样本效率高于强化学习方法。

Ring-2.6-1T 在真实世界智能体任务中达到 SOTA 水平

Reddit r/ArtificialInteligence

蚂蚁集团发布了 Ring-2.6-1T,这是一个拥有 1 万亿参数的推理模型,专为智能体工作流设计,采用 MIT 许可证、扩展上下文,并使用了异步强化学习 (Async RL) 和 IcePop 训练方法,取得了最先进的成果。