scientific-benchmark

标签

Cards List
#scientific-benchmark

SciCustom:一种面向大型语言模型科学能力定制评估的框架

arXiv cs.CL · 2026-05-20 缓存

SciCustom是一个从大规模数据中构建定制化科学基准的框架,无需专家标注即可对LLM的科学能力进行细粒度评估。它利用本体化知识单元和基于投票的共识机制来选取相关基准,并在化学和医疗领域进行了验证。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈