zero-rl

标签

Cards List
#zero-rl

@rosinality: https://arxiv.org/abs/2607.12395 RL without SFT. 一个有趣的点是,他们能够使推理过程变得…

X AI KOLs Timeline · 5天前 缓存

论文《Ring-Zero》提出了一种稳定的训练流程,将零强化学习(无需监督微调)扩展到1万亿参数,实现了涌现推理能力,如自我验证和结构化格式化,并在数学基准测试中表现出色。

0 人收藏 0 人点赞
#zero-rl

Ring-Zero: 将零强化学习扩展到万亿参数以实现涌现推理

arXiv cs.CL · 6天前 缓存

Ring-Zero将带可验证奖励的强化学习扩展到万亿参数模型,展示了无需人工标注数据的涌现推理行为,如自我验证和结构化格式。

0 人收藏 0 人点赞
#zero-rl

Oyster-II:面向大型语言模型建设性安全对齐的强化学习方法

arXiv cs.AI · 2026-07-07 缓存

Oyster-II提出了一种针对大型语言模型建设性安全对齐的强化学习框架,通过多阶段Zero-RL范式克服了先前基于SFT方法的局限性,在保持通用能力的同时实现了最先进的安全性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈