标签
CalibratedRubric是一个任务自适应框架,用于为开放式LLM评估构建紧凑且可测量的评分标准库,通过贝叶斯可测量性过滤和基于IRT的选择,在金融、医疗、通用和法律基准上提升人类-金标准一致性和排序保真度。
本研究分析了评分标准(rubrics)的修改(例如从整体性标准转变为分析性标准)如何影响人类评分者与 AI 自动评分者之间的一致性。研究结果表明,提供示例和减少偏见有助于提高一致性,而更高的复杂性往往会降低一致性。