rubric-based-evaluation

标签

Cards List
#rubric-based-evaluation

LLM作为评委评估的一致性指标:报告什么以及为什么

arXiv cs.CL ↗ · 2026-06-02 缓存

本文探讨了当标准为二元时,哪些用于LLM评委验证的一致性统计是冗余的,并提供了一个包含弃权处理在内的正确报告清单。

0 人收藏 0 人点赞
#rubric-based-evaluation

关于预测预训练大语言模型(LLM)的后训练潜力

arXiv cs.CL ↗ · 2026-05-13 缓存

本文介绍了 RuDE,这是一种通过利用响应鉴别力来预测预训练大语言模型(LLM)后训练潜力的框架,旨在解决 MMLU 等传统基准测试的局限性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈