reward-signal

标签

Cards List
#reward-signal

解密语言模型的强化学习后训练

arXiv cs.LG · 2天前 缓存

本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。

0 人收藏 0 人点赞
#reward-signal

闭环:形式化验证的法律作为自我改进法律AI的奖励信号

arXiv cs.LG · 2026-06-24 缓存

本文提出了一种架构,该架构使用形式化验证的法律作为训练法律AI的奖励信号,自适应地将法律规则自动形式化为形式化演算,并采用验证器确保可证明的正确性,在德国和美国法律示例上进行了演示。

0 人收藏 0 人点赞
#reward-signal

基于跨模型熵的无标签强化学习

arXiv cs.LG · 2026-05-29 缓存

提出跨模型熵(CME)作为一种无标签奖励信号,用于大型语言模型的强化学习后训练,无需真实验证器或人类偏好标签即可实现开放式指令遵循。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈