面向基础模型综合评估的细粒度基准生成

arXiv cs.LG 论文

摘要

一种新的自动化基准生成框架能够实现基础模型的细粒度、全面评估,具有更低的错误率和更丰富的元数据,在机器学习、公司金融和个人金融基准上得到了验证。

arXiv:2605.18824v1 公告类型:新 摘要:基础模型的评估常常依赖于缺乏全面覆盖和细粒度评估元数据的基准的聚合分数。我们引入了一个自动化基准生成框架。我们的框架生成基于参考资料(如教科书)的评估问题,生成覆盖广泛、元数据丰富且对污染具有鲁棒性的基准。该流程采用多智能体架构进行问题生成,以及一种显著提高真实解决方案可靠性的解决方案图驱动策略。利用该框架,我们生成了机器学习、公司金融和个人金融三个基准。专家评审发现,其真实错误率显著低于之前的基准,如MMLU和GSM8K。对12个商业和开源模型的评估表明,我们的基准实现了接近均匀的能力覆盖,并揭示了现有基准未能捕捉到的模型间性能差异。我们将很快开源该框架及我们精选的基准。
查看原文

相似文章

BehaviorBench:面向行为科学任务的基础模型基准测试

arXiv cs.CL

本文介绍了BehaviorBench,一个用于评估基础模型在行为科学任务(包括行为预测、战略决策、主体特征推断和行为知识应用)上表现的综合基准。它还介绍了Be.FM-1.5,一个经过微调的模型,实现了出色的分布对齐,突显了通用模型与行为适应模型之间的差距。