@charliermarsh: 我担心基准测试与实际能力之间的差距正在扩大
摘要
一次Twitter讨论凸显了日益增长的担忧:AI基准测试未能反映现实世界中模型的能力,因为它们测试的是孤立的任务,而非用户遇到的复杂、长期运行的提示。
我担心基准测试与实际能力之间的差距正在扩大
查看缓存全文
缓存时间: 2026/09/28 11:33
我担心基准测试与实际能力之间的差距正在不断扩大。
埃里克·普罗文谢尔 (@pvncher): 虽然你说得很对,这类路由器确实不太合理,但我已经对运行那些仅通过一系列独立小任务来评估这类产品的基准测试完全失去了兴趣。
在现实世界中,用户运行的提示词可能需要花费一小时以上才能完成。模型必须
相似文章
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
@karpathy:从我的时间线来看,人们对 AI 能力的理解差距正越来越大。我认为第一个问题在于时效性以及与……
Andrej Karpathy 指出公众对 AI 能力的认知正出现日益扩大的落差,他将其部分原因归结为许多人仍基于一年前过时的免费版 ChatGPT 体验来形成观点。
新评测标准的时机
本文讨论了在AI领域引入新评测标准的必要性,以更好地评估模型性能并解决现有标准的局限性。
AI基准测试不如模型能否处理乏味的现实责任重要
文章认为,AI基准测试和华丽的演示被过度强调了;真正考验AI可信度的是模型如何处理乏味的现实责任,如遵循指令、承认不确定性、处理边缘情况以及可审计性。
@svpino: 我不信任基准测试。我们都看过这样的戏码:新模型在基准测试中击败所有人。人们热议它。然后…
这条推文批判了传统的AI基准测试,并介绍了TRACES,这是一个新的基准测试,专注于评估模型如何得出答案的过程,包括工具使用、错误纠正和证据追踪。