有人能解释一下为什么我们认为90%以上的基准被视为饱和吗?

Reddit r/ArtificialInteligence 新闻

摘要

本文质疑为什么AI基准测试在90%以上准确率时被视为饱和,并主张瞄准100%或开发新的基准。

帮我理解这一点,因为我找不到一个诚实的理由。我明白我们达到了95%,但我们需要可信赖的模型,为什么不瞄准100%?为什么我们添加新的'基准'而不是尝试达到100%?
查看原文

相似文章

当AI基准陷入平台期:基准饱和的系统性研究

Hacker News Top

一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。

基准饱和之后:CORE-Bench 案例研究

arXiv cs.AI

本文反对在基准准确率饱和时直接“废止并替换”的做法,以 CORE-Bench 为例,证明在准确率持平后,从构建效度、效率、可靠性以及人机协作等维度衡量智能体性能,仍能获得有意义的洞见。