rubric-design

标签

Cards List
#rubric-design

CalibratedRubric:面向开放式LLM评估的任务自适应评分标准库

arXiv cs.CL · 2026-08-03 缓存

CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。

0 人收藏 0 人点赞
#rubric-design

量化评分标准修改对人类与自动评分者一致性影响的统计分析

arXiv cs.CL · 2026-05-08 缓存

本研究分析了评分标准(rubrics)的修改(例如从整体性标准转变为分析性标准)如何影响人类评分者与 AI 自动评分者之间的一致性。研究结果表明,提供示例和减少偏见有助于提高一致性,而更高的复杂性往往会降低一致性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈