我们确实需要用于研究、广泛网络搜索和事实检索的基准。

Reddit r/singularity 新闻

摘要

该文呼吁为AI研究更新基准测试,要求在现实条件下测试模型,并允许无限制的工具和互联网访问,指出当前的基准测试已经过时或限制过多。

https://preview.redd.it/kzf66pdcvurh1.png?width=1080&format=png&auto=webp&s=1ec903085f115f01510ee56886b30e9e685219ea 几乎所有的基准测试要么已经饱和,要么是在严格条件下测试的。例如 - AA Omniscience 的工具访问受到限制。许多人使用聊天机器人进行信息检索、深入研究和广泛信息收集。有一些基准测试,例如 - https://preview.redd.it/b0ky46sdvurh1.png?width=257&format=png&auto=webp&s=fe6375b098eaab1c4f8341341f2229a1541e07f7 但问题是 - 它们没有官方排行榜,且最后一次更新是在多年前。我们确实需要一个在实际环境中测试的基准(允许工具访问和互联网搜索),并且使用无任何限制的系统(如 Claude、ChatGPT Work 等)。如果存在这样的基准,请有人告知?
查看原文

相似文章

新评测标准的时机

Reddit r/singularity

本文讨论了在AI领域引入新评测标准的必要性,以更好地评估模型性能并解决现有标准的局限性。

好的基准

arXiv cs.AI

这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。