open-ended-questions

标签

Cards List
#open-ended-questions

评分依赖标准,而非智能

arXiv cs.CL · 6天前 缓存

当使用明确的评分标准时,小型语言模型在评分开放式考试答案时可以与更昂贵的模型一样可靠,从而降低了评分任务中对先进AI智能的需求。

0 人收藏 0 人点赞
#open-ended-questions

WuYuEval:面向固体废物管理的大语言模型多层级基准

arXiv cs.CL · 2026-08-11 缓存

WuYuEval 是一个用于评估固体废物管理领域大语言模型的多层级基准,涵盖基础知识、领域推理和专家决策。它包含 4,590 道多选题和 247 道基于场景的开放式问题,并报告了 33 个 LLM 的表现。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈