rubric-construction

标签

Cards List
#rubric-construction

Elmes*:长尾教育场景下大型语言模型细粒度评估标准的自动构建

arXiv cs.LG · 2026-06-08 缓存

本文介绍了Elmes+,一个面向长尾教育场景下LLMs细粒度评估标准构建的自动化框架,并提出了涵盖11个学科330个场景的Edu-330基准。该框架使用多智能体引擎和自演化模块来协同优化评估标准与测试数据,揭示了顶级LLMs在多维教育能力上的差异。

0 人收藏 0 人点赞
#rubric-construction

基于LLM的自动化评分中可学习的评估技能:通过迭代优化构建评分标准

arXiv cs.CL · 2026-05-29 缓存

本文提出为LLM学习评估技能,以自动化评分任务的评分标准构建,达到与专家编写的评分标准相当的性能,且无需人工编写的示例。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈