@heyshrutimishra: 90%的人工智能进展是一种建立在奖励记忆而非思考的基准测试上的幻觉。TRACES 通过…来剥离这一点…

X AI KOLs Timeline 工具

摘要

TRACES 是 Apodex 推出的新 AI 基准测试,通过关注问题解决过程而非记忆答案来衡量探索性 AI,挑战传统基准。

90%的人工智能进展是一种建立在奖励记忆而非思考的基准测试上的幻觉。 TRACES 仅通过压力下的原始发现过程来剥离这一点。 这就是评估从一开始就应该有的样子。 @Apodex_AI #TRACES
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:53

AI进展的90%,不过是建立在奖励记忆而非思考的基准测试上的幻象。

TRACES仅凭原始压力下的探索过程,便将其彻底剥离。

这本该是评估机制从一开始就该有的样貌。

@Apodex_AI #TRACES

Apodex (@Apodex_AI): 多数AI基准测试都在考察检索能力——模型能否找到已知答案?然而科学领域最艰巨的难题要求的是发现能力,系统能否凭空获得无人知晓的解答?

请认识TRACES 🧭——全球首个衡量发现型AI的基准测试:这类AI能够

相似文章

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。