@charliermarsh: 我担心基准测试与实际能力之间的差距正在扩大

X AI KOLs Timeline 新闻

摘要

一次Twitter讨论凸显了日益增长的担忧:AI基准测试未能反映现实世界中模型的能力,因为它们测试的是孤立的任务,而非用户遇到的复杂、长期运行的提示。

我担心基准测试与实际能力之间的差距正在扩大
查看原文
查看缓存全文

缓存时间: 2026/09/28 11:33

我担心基准测试与实际能力之间的差距正在不断扩大。

埃里克·普罗文谢尔 (@pvncher): 虽然你说得很对,这类路由器确实不太合理,但我已经对运行那些仅通过一系列独立小任务来评估这类产品的基准测试完全失去了兴趣。

在现实世界中,用户运行的提示词可能需要花费一小时以上才能完成。模型必须

相似文章

新评测标准的时机

Reddit r/singularity

本文讨论了在AI领域引入新评测标准的必要性,以更好地评估模型性能并解决现有标准的局限性。