advantage-estimation

标签

Cards List
#advantage-estimation

BV-Blend: 不确定性加权历史基线用于可验证奖励下稳定无评论家强化学习

arXiv cs.AI · 2026-06-30 缓存

BV-Blend是一种无评论家的强化学习框架,它将提示本地在线策略统计与来自语义聚类的历史矩相结合,以稳定优势估计,从而提高使用可验证奖励对齐大型语言模型的训练稳定性和性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈