@cwolferesearch: 评估不应该是静态的。我们需要随着时间的推移不断演变评估集/基准,使其保持相关性……

X AI KOLs Following 新闻

摘要

讨论了通过难度、质量和多样性细化来演进AI评估基准的必要性,并引用MMLU-Pro、MMLU-Redux、BIG-Bench Extra Hard、RealMath、MathArena和DatBench等示例。

评估不应该是静态的。我们需要随着时间的推移不断演变评估集/基准,使其保持相关性和未饱和状态。我们可以通过三种主要方式来改进评估,使其更好: - 基于难度的细化:在基准内筛选更困难的任务或数据用于评估。 - 基于质量的细化:识别并修复基准中的问题(例如,错误标记的数据、模糊或不切实际的问题、格式不佳等)。 - 基于多样性的细化:扩展特定基准所涵盖的问题和主题范围。 有很多方法可以实现这一点,以下是一些具体示例…… MMLU-Pro 通过使 MMLU 更准确、更困难和更具区分性来扩展它。通过使用基于模型的难度过滤去除简单问题:我们取一个包含八个模型的池,移除大多数模型都能正确回答的问题。更困难的问题来自各种公共数据集。所有新问题和剩余问题都经过结合人工和LLM监督的广泛质量审计。 MMLU-Redux 采用不同的方法,每个 MMLU 类别采样约100个问题,并进行广泛的人工质量审计。所有问题都被归类到预定义的错误分类法中,并由人工修改以形成更准确的基准。大约7%的MMLU问题被发现存在错误,但各类别的比例有所不同。 BIG-Bench Extra Hard 通过将 BIG-Bench Hard 中的每个任务替换为测试类似推理能力类别但难度显著更高的对应任务来构建。任务来自各种现有的推理基准,并根据其主题和难度手动选择。基于模型的过滤(即测试几个模型在任务上的表现以查看它们失败的地方)也被用来指导选择过程。基准作者优先考虑那些无法通过作弊或随机猜测解决的较长问题。 RealMath 和 MathArena 都是不断演进的数学基准。RealMath 自动更新,从新发布的研究论文和讨论论坛中衍生出新问题。MathArena 在数学竞赛问题发布后的短时间内评估LLM,以避免污染风险,并随着新问题的出现频繁更新。 DatBench 使用数据过滤/选择技术的组合来细化视觉语言模型(VLM)的各种基准: - 将多项选择题转换为生成式问题。 - 移除无需视觉信息即可解决的问题。 - 执行基于模型的质量过滤以发现质量问题,然后由更强大的模型进一步过滤。 - 使用项目反应理论选择最具区分性的示例(即能够区分不同模型性能的示例)。
查看原文

相似文章

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。