@StasBekman:经过数月的紧张工作,@Snowflake AI Research 团队很高兴为您带来新的开源项目……

X AI KOLs Following 工具

摘要

Snowflake AI Research 发布 Arctic RL,这是一个开源统一的强化学习后端,集成了 VeRL 和 SkyRL,可实现高达 6 倍的演员更新加速和 3.5 倍的端到端训练速度提升。它包含了文本到 SQL 和多跳问答的配方,在企业基准测试中达到了具有竞争力的准确率。

经过数月的紧张工作,@Snowflake AI Research 团队很高兴为您带来新的开源项目:Arctic RL https://snowflake.com/en/blog/engineering/arctic-rl-open-source-backend/… - Arctic RL 目前已与 VeRL 和 SkyRL 集成;通过一个配置标志即可启用 ZoRRo,无需修改代码 - ZoRRo 提供高达 6 倍的演员更新加速和 3.5 倍的端到端训练速度提升,将 Arctic-Text2SQL-R2 的训练时间从约 5 天缩短至约 36 小时(使用 32 块 H200 GPU) - 在测试条件下,Arctic-Text2SQL-R2 在 Snowflake 评估的企业 SQL 基准测试中取得了更高的准确率分数(48.7),超过了 Gemini 3.1 Pro(47.9)和 Claude 4.7(47.3) - 此次发布附带两个开源配方:一个将 BIRD 开发集准确率从 59.92% 提升至 70.35% 的文本到 SQL 配方,以及一个将平均准确率从 69.6% 提升至 72.3% 的多跳问答配方
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:38

经过数月的紧张工作,@Snowflake AI Research团队很高兴向您呈现新的开源项目:Arctic RL

https://snowflake.com/en/blog/engineering/arctic-rl-open-source-backend/…

  • Arctic RL 现已集成 VeRL 和 SkyRL;通过一个配置标记即可启用 ZoRRo,无需修改代码
  • ZoRRo 可实现高达 6 倍的 Actor 更新加速和 3.5 倍的端到端训练加速,将 Arctic-Text2SQL-R2 在 32 块 H200 GPU 上的训练时间从约 5 天缩短至约 36 小时
  • 在 Snowflake 评估的企业 SQL 基准测试的测试条件下,Arctic-Text2SQL-R2 获得了比 Gemini 3.1 Pro(47.9)和 Claude 4.7(47.3)更高的准确率分数(48.7)
  • 此版本附带两个开源方案:一个文本转 SQL 方案,将 BIRD 开发集准确率从 59.92% 提升至 70.35%;一个多跳问答方案,将平均准确率从 69.6% 提升至 72.3%

Arctic RL:用于企业后训练的统一开源 RL 后端

来源:https://www.snowflake.com/en/blog/engineering/arctic-rl-open-source-backend/ 强化学习(RL)对现代 AI 至关重要,但由于冗余计算和缺乏统一的系统后端,其效率仍然低下且成本高昂。

Arctic RL(https://github.com/Snowflake-AI-Research/Arctic-Platform/tree/main/arctic_platform/rl)是一个开源库,提供了这一缺失的基础设施层,负责 GPU 编排和系统优化,从而在多个 RL 框架间提供可移植的性能提升。

关键要点:

  • Arctic RL 现已集成 VeRL 和 SkyRL;通过一个配置标记即可启用 ZoRRo,无需修改代码
  • ZoRRo(https://www.snowflake.com/en/blog/engineering/zorro-enterprise-rl-training/)可实现高达 6 倍的 Actor 更新加速和 3.5 倍的端到端训练加速,将 Arctic-Text2SQL-R2 在 32 块 H200 GPU 上的训练时间从约 5 天缩短至约 36 小时
  • Arctic-Text2SQL-R2(https://www.snowflake.com/en/blog/engineering/enterprise-text-to-sql-arctic-r2/)在 Snowflake 评估的企业 SQL 基准测试的测试条件下,获得了比 Gemini 3.1 Pro(47.9)和 Claude 4.7(47.3)更高的准确率分数(48.7)
  • 此版本附带两个开源方案:一个文本转 SQL 方案,将 BIRD 开发集准确率从 59.92% 提升至 70.35%;一个多跳问答方案,将平均准确率从 69.6% 提升至 72.3%

以下章节将探讨 Arctic RL 的架构、详细的系统优化以及我们与主流框架的集成。我们还将分享开源训练方案,并展示解决方案的性能可移植性。

为什么 RL 后训练需要一个统一的后端

RL 训练的效率低下具有独特性:生成 rollout、计算对数概率和更新 Actor 会执行大量冗余计算。然而,RL 是唯一一个缺乏统一开源系统后端的主要 LLM 工作负载(相比之下,预训练有 DeepSpeed 和 Megatron-LM,推理有 vLLM 和 SGLang)。每个框架都独立地重新实现相同的系统层,因此优化无法共享。

因此,RL 框架必须深度感知 GPU——它们直接集成训练和推理引擎,管理跨引擎的内存共享/权重同步,并处理 Actor 更新、rollout 生成和对数概率计算之间的底层编排(例如,用于 MoE 的 router-replay(一种缓存 MoE 路由决策的方法)(https://arxiv.org/abs/2510.11370))。这种紧密耦合使得系统创新难以共享,并迫使每个框架独自解决相同的优化、集成和编排问题。

Arctic RL 是我们针对上述问题的答案。Arctic RL 是一个完全开源的 RL 后端,自设计之初就旨在成为 RL 后训练的统一开源系统层。

这种分离对于 RL 来说是一种范式转变。像 ZoRRo(https://www.snowflake.com/en/blog/engineering/zorro-enterprise-rl-training/)这样的整体系统优化变得可移植,因为它们位于后端,而不是分散在多个框架中。RL 库可以专注于 RL 算法,而 Arctic RL 则处理优化以及分布式 GPU 编排。

Arctic RL 现已与 VeRL 和 SkyRL 实现端到端集成,PrimeRL 的集成正在进行中。如果您已经在使用 VeRL 或 SkyRL,只需在训练脚本中选择 arctic-rl 后端,即可获得完整的 ZoRRo 优化套件。您可以在所有集成的框架中实现类似的性能提升(图 1)。无需修改代码或重新实现。

在 Snowflake 的生产测试中,与评估的 VeRL 基线配置相比,Arctic RL 将 Arctic-Text2SQL-R2 的训练时间缩短了最多 3.5 倍(图 1)。

图 1:此图显示,在 Arctic-Text2SQL-R2 生产运行(使用 4 个节点,32 块 H200 GPU)中,使用 VeRL + Arctic RL 相比原生 VeRL,迭代时间缩短了 3.5 倍。

图 1。此图显示,在 Arctic-Text2SQL-R2 生产运行(使用 4 个节点,32 块 H200 GPU)中,使用 VeRL + Arctic RL 相比原生 VeRL,迭代时间缩短了 3.5 倍。

Arctic RL 架构

从外部看,RL 后训练步骤与从内部看是不同的。从外部看,它是一系列高层操作:生成 rollout、进行评分、计算对数概率、然后进行梯度更新*。从内部看,每一步都是一个多引擎、多 GPU 的协同过程,涉及训练引擎、推理引擎、两者之间的权重传输、微批处理和序列打包。当今每个后训练框架都必须处理这两方面。

Arctic RL 反其道而行之:该库仅处理外部视图;后端将内部视图作为一个统一的整体系统来拥有(图 2)。这就是系统优化可移植的原因,因为优化发生在抽象层之下,位于拥有 GPU 的那一侧。

图 2:Arctic RL 的架构和集成概览。突出显示了 Arctic RL 的关键部分:服务器后端、RL 感知的系统优化层以及仅限 CPU 的 RL 感知客户端。该图还显示了与三个流行 RL 框架(SkyRL、VeRL 和 PrimeRL)的集成。

图 2。Arctic RL 的架构和集成概览。突出显示了 Arctic RL 的关键部分:服务器后端、RL 感知的系统优化层以及仅限 CPU 的 RL 感知客户端。该图还显示了与三个流行 RL 框架(SkyRL、VeRL 和 PrimeRL)的集成。

Arctic RL 架构包含三层:

  1. 统一的训练和推理服务器后端:Arctic RL 在一组统一的训练 API 后面启动 DeepSpeed 训练工作器和 ArcticInference(vLLM)采样及对数概率副本。服务器后端拥有分布式 GPU 栈以及训练和 rollout 组件的编排。
  2. RL 感知的系统优化层。Arctic RL 整体看待完整的 RL 循环,并在训练、推理和建模边界之间应用优化。这就是 ZoRRo 的所在。这些优化的实现对上层框架是透明的,但能带来乘法加速。由于这些优化位于后端,因此它们是可移植的——每个集成 Arctic RL 的框架都可以访问它们。
  3. GPU 无关的 RL 感知客户端。后训练框架通过一个完全在 CPU 上运行的轻量客户端库集成 Arctic RL。客户端适配器将框架特定的 RL 抽象转换为 Arctic RL API 调用,并且对后端优化或分布式 GPU 实现细节保持无关。

Arctic RL 是一个有主见但灵活的后端,旨在支持多样化的高性能训练工作流。

  • 任何模型架构。Arctic RL 继承了其底层引擎的模型覆盖范围——DeepSpeed 训练和 ArcticInference/vLLM 推理支持的任何架构都可以开箱即用,包括完整的 Hugging Face 因果 LM 系列。我们已验证了 Qwen3(0.6B 至 32B)和 Qwen2.5。由于整个栈是开源的,对底层引擎尚未支持的特殊架构的支持是一个可行的贡献路径——对 DeepSpeed 或 ArcticInference 的添加会自动流入 Arctic RL。
  • 自定义损失函数。Arctic RL 维护一个开源的损失函数注册表,通过一个装饰器添加新的损失函数:@register_loss_fn(“my_loss”)。默认的 GRPO 实现涵盖了现代方案使用的完整功能集——PPO 裁剪(https://arxiv.org/abs/2312.12065)、M2PO 掩码(https://arxiv.org/abs/2510.01161)、CISPO 损失(https://arxiv.org/abs/2506.13585)、用于离策略训练的解耦近端对数概率(https://arxiv.org/html/2512.06547v2)等。
  • 自定义后处理器。同样的注册机制处理前向传播和损失之间的每个 token 计算。
  • 全参数训练。Arctic RL 不局限于 LoRA(https://arxiv.org/abs/2106.09685)。默认路径是使用 DeepSpeed ZeRO 进行全参数训练。LoRA 是一个选项,而非约束。

系统性能优化

Arctic RL 附带了一系列系统级优化,针对现代 RL 工作负载中的主要成本中心:长提示训练和 rollout 中的冗余计算和内存、端到端流水线序列化以及不灵活的 GPU 放置。此处每个优化都位于服务器中,在训练 API 背后。

  • ZoRRo(零冗余 Rollout):使用分离注意力(训练)和森林级联注意力(推理)对提示计算进行去重,实现高达 6 倍的 Actor 更新加速。
  • 异步流水线:通过异步 API 重叠生成和训练,以最大化资源利用率并隐藏计算延迟。
  • 灵活放置:通过单个配置标记支持训练和推理工作器的共置或分离,以优化内存或计算密集型工作负载。

这些优化相互叠加。ZoRRo 降低了每步的计算和内存成本;异步流水线将剩余计算隐藏在生成后面;灵活放置消除了争用。在 Snowflake 评估的生产配置中,这些优化将训练时长从大约五天缩短至大约 36 小时。

与 VeRL、SkyRL 和 PrimeRL 的集成

所有框架与 Arctic RL 的集成方式一致。每个框架都使用一个集中式控制器在 CPU 上管理编排、数据加载和奖励评分,同时将 GPU 密集型操作——生成、log_probs、fwd_bwd、step 和 sync_weights——委托给 Arctic RL 训练 API。

与 VeRL、SkyRL 和 PrimeRL 的集成通过一个轻量级、仅 CPU 的客户端适配器标准化。框架维护一个用于编排和奖励的中央控制器,同时通过统一的训练 API 将繁重的 GPU 操作(如生成、对数概率计算和梯度更新)委托给 Arctic RL 后端。

适用于企业工作负载的 Arctic RL

Arctic RL 在 Snowflake 中投入生产运行,以下工作负载是社区可以复现的真实方案。

Arctic-Text2SQL-R2

在 Snowflake 的 Text-to-SQL 基准测试中,Arctic-Text2SQL-R2 的表现优于(https://www.snowflake.com/en/blog/engineering/enterprise-text-to-sql-arctic-r2/)Gemini 3.1 Pro 和 Claude 4.7,尽管其规模比其他高性能模型小 30-150 倍。该基准测试是一个刻意设计的困难评估集,即使是能力最强的前沿模型也难以应对。

该方案将 Snowflake 首选的训练语料库(真实的 DDL、文档和分析脚本,经过重新接地以将问题与任何特定模式分离)与一个抗冲突的执行奖励相结合,该奖励注入边缘案例行并在 RL 期间收紧等价性检查。

开源文本转 SQL 方案

为了证明性能提升并非依赖于专有数据,我们使用仅包含公共基准 BIRD 和 Qwen3-32B 作为基底,构建了一个完全开源的文本转 SQL 方案。

该方案使用带有执行匹配奖励的 GRPO:每个预测的 SQL 都会针对真实的 SQLite 数据库运行,并与黄金输出进行比较。使用评估的 GRPO 训练配置,BIRD 开发集准确率从 59.92% 提升至 70.35%——在没有任何专有数据的情况下,相比相应的开源 RL 基线,获得了 +10.43 个百分点的提升。在相同硬件上,与基线 VeRL/SkyRL 相比,Arctic RL 将得到结果的时间缩短了 1.4 倍/1.5 倍。

开源长上下文多跳 QA 方案

我们将 Arctic RL 扩展到了一个截然不同的挑战:长上下文多跳 QA,其中模型必须跨长文档定位并串联证据。

使用 GRPO 和 Qwen3-32B,我们在来自 HotpotQA、MuSiQue 和 2WikiMQA 的约 14K 个公开样本(上下文最长 16K 个 token,包含标准变体和干扰项变体)上进行训练,使用子字符串精确匹配奖励。推理通过 YaRN(一种基于 RoPE 的长序列扩展方法)(https://arxiv.org/abs/2309.00071)将上下文窗口扩展至 128K 个 token。

在评估的 LongBench v1 配置中,跨五个 QA 任务(Qwen-Long 评估设置),平均准确率从 69.6% 提升至 72.3%——获得了 +2.7 个百分点的提升,其中难度最大的多跳基准测试提升最大:MuSiQue 提升 7.5 个百分点,HotpotQA 提升 4.5 个百分点,2WikiMQA 提升 3.5 个百分点。

性能可移植性

下面的图表(图 3)显示了在开源文本转 SQL 工作负载上,VeRL 和 SkyRL 通过集成 Arctic RL 并在 32 块 H200 GPU 上运行所获得的加速。Arctic RL 将 VeRL 和 SkyRL 的端到端训练时间分别缩短了 1.4 倍和 1.5 倍。

图 3:对于开源文本转 SQL 工作负载,将 Arctic RL 集成到 VeRL 和 SkyRL 中分别将端到端训练时间提升了 1.4 倍和 2 倍。这些加速来自于启用 Arctic RL 优化。对于此工作负载,最大提示长度为 32K,生成长度为 4K。

图 3。对于开源文本转 SQL 工作负载,将 Arctic RL 集成到 VeRL 和 SkyRL 中分别将端到端训练时间提升了 1.4 倍和 2 倍。这些加速来自于启用 Arctic RL 优化。对于此工作负载,最大提示长度为 32K,生成长度为 4K。

如何开始

要开始使用,请参阅 Arctic RL README(https://github.com/Snowflake-AI-Research/Arctic-Platform/tree/main/arctic_platform/rl)获取安装说明和可重复的运行脚本。

我们接下来的计划以及如何贡献

Arctic RL 自第一天起就是开源的。我们邀请研究社区在此栈之上进行构建,集成新的后训练框架,并将优化贡献回后端。

对于 Snowflake 客户,Arctic RL 的基础设施效率大大降低了训练专门 SQL 推理模型的成本和时间。Arctic RL 使组织能够构建和维护高精度、领域特定的 AI 代理,这些代理可以在数小时而不是数天内适应其独特的业务环境。Arctic RL 确保随着您的业务数据演变,您的 AI 模型能够跟上步伐,而无需巨大的基础设施开销。

贡献者

系统:Tunji Ruwase, Michael Wyatt, Stas Bekman, Karthik Ganesan, Thong Nguyen, Ye Wang, Reza Yazdani, Jaeseong Lee, Mert Hidayetoglu, Xinyu Lian, Jeff Rasley, Yuxiong He, Samyam Rajbhandari(负责人)

建模:Zhewei Yao, Xiaodong Yu, Lukasz Borchmann, Krzysztof Jankowski, Yite Wang, Gaurav Nuti。

集成伙伴:VeRL、SkyRL 和 PrimeRL 团队,没有他们,这项工作就不可能完成。


基准/比较方法披露

本文讨论的性能结果基于特定的工作负载配置和硬件环境下的内部测试。实际性能可能因模型架构、工作负载、配置和其他因素而异。其他模型名称供参考,不使用其对应商标。

相似文章