@cwolferesearch: 评估不应该是静态的。我们需要随着时间的推移不断演变评估集/基准,使其保持相关性……
摘要
讨论了通过难度、质量和多样性细化来演进AI评估基准的必要性,并引用MMLU-Pro、MMLU-Redux、BIG-Bench Extra Hard、RealMath、MathArena和DatBench等示例。
评估不应该是静态的。我们需要随着时间的推移不断演变评估集/基准,使其保持相关性和未饱和状态。我们可以通过三种主要方式来改进评估,使其更好:
- 基于难度的细化:在基准内筛选更困难的任务或数据用于评估。
- 基于质量的细化:识别并修复基准中的问题(例如,错误标记的数据、模糊或不切实际的问题、格式不佳等)。
- 基于多样性的细化:扩展特定基准所涵盖的问题和主题范围。
有很多方法可以实现这一点,以下是一些具体示例……
MMLU-Pro 通过使 MMLU 更准确、更困难和更具区分性来扩展它。通过使用基于模型的难度过滤去除简单问题:我们取一个包含八个模型的池,移除大多数模型都能正确回答的问题。更困难的问题来自各种公共数据集。所有新问题和剩余问题都经过结合人工和LLM监督的广泛质量审计。
MMLU-Redux 采用不同的方法,每个 MMLU 类别采样约100个问题,并进行广泛的人工质量审计。所有问题都被归类到预定义的错误分类法中,并由人工修改以形成更准确的基准。大约7%的MMLU问题被发现存在错误,但各类别的比例有所不同。
BIG-Bench Extra Hard 通过将 BIG-Bench Hard 中的每个任务替换为测试类似推理能力类别但难度显著更高的对应任务来构建。任务来自各种现有的推理基准,并根据其主题和难度手动选择。基于模型的过滤(即测试几个模型在任务上的表现以查看它们失败的地方)也被用来指导选择过程。基准作者优先考虑那些无法通过作弊或随机猜测解决的较长问题。
RealMath 和 MathArena 都是不断演进的数学基准。RealMath 自动更新,从新发布的研究论文和讨论论坛中衍生出新问题。MathArena 在数学竞赛问题发布后的短时间内评估LLM,以避免污染风险,并随着新问题的出现频繁更新。
DatBench 使用数据过滤/选择技术的组合来细化视觉语言模型(VLM)的各种基准:
- 将多项选择题转换为生成式问题。
- 移除无需视觉信息即可解决的问题。
- 执行基于模型的质量过滤以发现质量问题,然后由更强大的模型进一步过滤。
- 使用项目反应理论选择最具区分性的示例(即能够区分不同模型性能的示例)。
相似文章
@OpenAI: 我们来聊聊评估。我们一直在寻找更好的方法来衡量和预测模型的进展,尤其是在基准测试...
OpenAI讨论了评估(evals)的重要性,用于衡量和预测模型进展,尤其是在基准测试变得饱和或被操纵的情况下,并邀请了Tejal Patwardhan和Andrew Mayne分享见解。
@OpenAI: 随着编码模型的改进,评估需要变得更严格、更公平、更可信。更好的基准有助于领域了…
OpenAI 强调编码AI模型评估需要更严格、更可信,以更好地衡量实际进展。
不要声称面向基准测试的优化能提升通用编码能力——需要多样化的评估
该论文批评了依赖如SWE-bench等有限的编码基准测试来衡量AI模型的通用编码能力的做法,表明针对这些基准测试的优化无法泛化,并倡导多样化的评估方法。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。
MLS-Bench:对 AI 系统在构建更优 AI 方面能力的全面与严格评估
本文介绍了 MLS-Bench,这是一个旨在评估 AI 系统能否发明具有通用性和可扩展性的机器学习方法,而非仅仅进行工程调优的基准测试。