有人能解释一下为什么我们认为90%以上的基准被视为饱和吗?
摘要
本文质疑为什么AI基准测试在90%以上准确率时被视为饱和,并主张瞄准100%或开发新的基准。
帮我理解这一点,因为我找不到一个诚实的理由。我明白我们达到了95%,但我们需要可信赖的模型,为什么不瞄准100%?为什么我们添加新的'基准'而不是尝试达到100%?
相似文章
当AI基准陷入平台期:基准饱和的系统性研究
一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。
当所有AI都在基准测试上达到100%之后会发生什么
这篇文章推测当所有AI模型在基准测试上都达到100%时会发生什么,质疑它们将如何展示优越性。
AI基准测试的含义是什么?
简单解释AI基准测试、分数含义,以及为何100%不代表AI无法进一步改进。
现在的基准测试要么已经饱和,要么残酷无比,而这两类数字都无法告诉你真正导致部署失败的原因
作者反思了AI基准测试目前要么在顶尖水平上饱和,要么难度极高,并认为这两者都无法捕捉到真实的生产失败模式——模型缺乏对任务是否值得做的判断力。他们询问是否有人找到了在发布前评估判断力的方法。
基准饱和之后:CORE-Bench 案例研究
本文反对在基准准确率饱和时直接“废止并替换”的做法,以 CORE-Bench 为例,证明在准确率持平后,从构建效度、效率、可靠性以及人机协作等维度衡量智能体性能,仍能获得有意义的洞见。