标签
RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。
本文提出了一种基于评分标准对齐的方法,用于在段落级别评估人类同声传译,使用LoRA适配的COMET-KIWI模型来解耦意义传递和表达质量等维度,相比基线方法,提高了与人类评分的相关性。
PaperGym是一个框架,通过将研究问题与评估评分类分离,将科学论文转化为训练环境,使强化学习能够改进研究计划。它展示了优于现有方法的性能,训练后的模型在基准测试中优于更大的模型。
康奈尔研究者提出 POP 自博弈框架,让大模型自行生成评分规则与训练样本,在医疗问答、创意写作、指令遵循等开放式任务上提升 Qwen-2.5-7B,无需人工标注。