我们确实需要用于研究、广泛网络搜索和事实检索的基准。
摘要
该文呼吁为AI研究更新基准测试,要求在现实条件下测试模型,并允许无限制的工具和互联网访问,指出当前的基准测试已经过时或限制过多。
https://preview.redd.it/kzf66pdcvurh1.png?width=1080&format=png&auto=webp&s=1ec903085f115f01510ee56886b30e9e685219ea 几乎所有的基准测试要么已经饱和,要么是在严格条件下测试的。例如 - AA Omniscience 的工具访问受到限制。许多人使用聊天机器人进行信息检索、深入研究和广泛信息收集。有一些基准测试,例如 - https://preview.redd.it/b0ky46sdvurh1.png?width=257&format=png&auto=webp&s=fe6375b098eaab1c4f8341341f2229a1541e07f7 但问题是 - 它们没有官方排行榜,且最后一次更新是在多年前。我们确实需要一个在实际环境中测试的基准(允许工具访问和互联网搜索),并且使用无任何限制的系统(如 Claude、ChatGPT Work 等)。如果存在这样的基准,请有人告知?
相似文章
新评测标准的时机
本文讨论了在AI领域引入新评测标准的必要性,以更好地评估模型性能并解决现有标准的局限性。
我在想,人们什么时候才能意识到我们需要把这个重新带回来呢?
作者主张恢复'大海捞针'基准测试来评估AI能力,分享了私人测试结果,显示许多模型在记忆指令方面表现不佳,质疑其在实际任务中的可靠性。
@charliermarsh: 我担心基准测试与实际能力之间的差距正在扩大
一次Twitter讨论凸显了日益增长的担忧:AI基准测试未能反映现实世界中模型的能力,因为它们测试的是孤立的任务,而非用户遇到的复杂、长期运行的提示。
好的基准
这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。
(吐槽;)) 让你的基准测试更贴近现实
社区吐槽:呼吁AI模型基准测试应更贴近现实,考虑上下文大小、多模态特性、具体硬件配置和并行处理,而不仅仅是原始速度。