标签
论文《Ring-Zero》提出了一种稳定的训练流程,将零强化学习(无需监督微调)扩展到1万亿参数,实现了涌现推理能力,如自我验证和结构化格式化,并在数学基准测试中表现出色。
Ring-Zero将带可验证奖励的强化学习扩展到万亿参数模型,展示了无需人工标注数据的涌现推理行为,如自我验证和结构化格式。
Oyster-II提出了一种针对大型语言模型建设性安全对齐的强化学习框架,通过多阶段Zero-RL范式克服了先前基于SFT方法的局限性,在保持通用能力的同时实现了最先进的安全性能。