rubric-evaluation

标签

Cards List
#rubric-evaluation

RewardVerse:评分标准指导的策略优化用于视频奖励建模

Hugging Face Daily Papers ↗ · 6天前 缓存

RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。

0 人收藏 0 人点赞
#rubric-evaluation

评分标准对齐的解耦人类同声传译评估

arXiv cs.CL ↗ · 2026-09-11 缓存

本文提出了一种基于评分标准对齐的方法,用于在段落级别评估人类同声传译,使用LoRA适配的COMET-KIWI模型来解耦意义传递和表达质量等维度,相比基线方法,提高了与人类评分的相关性。

0 人收藏 0 人点赞
#rubric-evaluation

PaperGym:以评分为中心的研究计划生成进化框架

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

PaperGym是一个框架,通过将研究问题与评估评分类分离,将科学论文转化为训练环境,使强化学习能够改进研究计划。它展示了优于现有方法的性能,训练后的模型在基准测试中优于更大的模型。

0 人收藏 0 人点赞
#rubric-evaluation

基于预训练文本的自评规则自博弈,为开放式任务自举后训练信号

arXiv cs.CL ↗ · 2026-04-23 缓存

康奈尔研究者提出 POP 自博弈框架,让大模型自行生成评分规则与训练样本,在医疗问答、创意写作、指令遵循等开放式任务上提升 Qwen-2.5-7B,无需人工标注。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈