标签
本文揭示了可验证奖励强化学习中的精确匹配验证器在多语言数学推理中引入了语言依赖偏差,提出了一个审计协议,并识别了跨语言选择瓶颈。
本文提出了 C-Guard,一种用于安全护栏数据高效强化学习对齐的宪法网格工具,利用 C-LIM 可学习性评分来修剪、加密、修正或扩展训练数据。它将过度拒绝从 22.4% 降低到 12.8%,并提高了数据效率。