标签
ToolSense 是一个开源诊断框架,能够生成三个基准测试(真实检索、多选题探测、问答探测),用于审计大语言模型的参数化工具知识,揭示了知识-检索分离现象:强大的检索性能可能与较差的事实理解共存。
本文提出了一种以语料库为中心的诊断框架,用于分析生物医学NER和EL基准测试,揭示了九个语料库之间的显著差异,并论证了标准统计量不足以描述评估需求。