基准分数及Parsewave在分数之外关注的要素
摘要
本文批判了AI模型评估中对基准分数的过度依赖,提倡使用执行跟踪和错误分析等全面评估方法,Parsewave等公司强调更深层次的洞察。
每当一个AI模型获得高基准分数时,网上就会发布一张图表,大家都认为它是个天才,但这个分数实际上并没有告诉我们真正发生了什么。一个智能体可能生成正确的最终文件,但其路径可能完全混乱,伴随着重复的重试或不必要的工具调用。它甚至可能破坏了其他东西,但测试仍然通过,因为测试只检查最终输出。尽管结果满足了基准的最终状态检查,但这些隐性成本可能使系统变慢、消耗更多资源,并在实际使用中带来更多风险。这时,像Parsewave这样的AI数据集公司就派上用场了。他们的工作是确保评估过程超越通过或失败的二元判断,即检查执行跟踪、错误、重试、捷径以及智能体是否真正正确地执行了任务。基准分数仍然有用。它们提供了一种快速比较模型的方式,但更像是标题而非完整故事。对于从事模型评估的人来说,除了最终基准分数,你们还关注什么?失败模式、工具使用、重试,还是其他?
相似文章
@svpino: 我不信任基准测试。我们都看过这样的戏码:新模型在基准测试中击败所有人。人们热议它。然后…
这条推文批判了传统的AI基准测试,并介绍了TRACES,这是一个新的基准测试,专注于评估模型如何得出答案的过程,包括工具使用、错误纠正和证据追踪。
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
@HamelHusain: 新博客文章:自动化评估有效吗?最近出现了一些工具,通过AI分析你的追踪数据来识别问题…
Parlance Labs的一篇博客文章在真实生产数据上测试了自动化AI评估工具(Braintrust Loop、Arize Alyx、LangSmith Engine),发现它们能捕获人类标记的87%的问题,但会遗漏领域特定的失败案例并引入噪音,建议采用迭代式人机协同使用。
我们基准测试的是无人实际运行的模型
文章批评了AI模型在不同量化格式下缺乏系统性基准测试,突出了基准测试结果与实际使用之间的差异,并呼吁进行更彻底的评估。
@OpenAI: 我们来聊聊评估。我们一直在寻找更好的方法来衡量和预测模型的进展,尤其是在基准测试...
OpenAI讨论了评估(evals)的重要性,用于衡量和预测模型进展,尤其是在基准测试变得饱和或被操纵的情况下,并邀请了Tejal Patwardhan和Andrew Mayne分享见解。