rl-alignment

标签

Cards List
#rl-alignment

RLVR中的多语言验证器偏差:基准测试、Rollout诊断与跨语言选择瓶颈

arXiv cs.CL ↗ · 2026-08-24 缓存

本文揭示了可验证奖励强化学习中的精确匹配验证器在多语言数学推理中引入了语言依赖偏差,提出了一个审计协议,并识别了跨语言选择瓶颈。

0 人收藏 0 人点赞
#rl-alignment

一种用于数据高效 RL 对齐的宪法网格工具(C-Guard)

arXiv cs.CL ↗ · 2026-08-04 缓存

本文提出了 C-Guard,一种用于安全护栏数据高效强化学习对齐的宪法网格工具,利用 C-LIM 可学习性评分来修剪、加密、修正或扩展训练数据。它将过度拒绝从 22.4% 降低到 12.8%,并提高了数据效率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈