@heyshrutimishra: 90%的人工智能进展是一种建立在奖励记忆而非思考的基准测试上的幻觉。TRACES 通过…来剥离这一点…
摘要
TRACES 是 Apodex 推出的新 AI 基准测试,通过关注问题解决过程而非记忆答案来衡量探索性 AI,挑战传统基准。
查看缓存全文
缓存时间: 2026/08/20 10:53
AI进展的90%,不过是建立在奖励记忆而非思考的基准测试上的幻象。
TRACES仅凭原始压力下的探索过程,便将其彻底剥离。
这本该是评估机制从一开始就该有的样貌。
@Apodex_AI #TRACES
Apodex (@Apodex_AI): 多数AI基准测试都在考察检索能力——模型能否找到已知答案?然而科学领域最艰巨的难题要求的是发现能力,系统能否凭空获得无人知晓的解答?
请认识TRACES 🧭——全球首个衡量发现型AI的基准测试:这类AI能够
相似文章
@svpino: 我不信任基准测试。我们都看过这样的戏码:新模型在基准测试中击败所有人。人们热议它。然后…
这条推文批判了传统的AI基准测试,并介绍了TRACES,这是一个新的基准测试,专注于评估模型如何得出答案的过程,包括工具使用、错误纠正和证据追踪。
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence
This paper introduces Apodex Discovery, a framework and reality benchmark (TRACES) for evaluating and building 'discoverative AI'—AI systems that investigate open-ended real-world problems. The proposed heavy-duty solvers outperform published state-of-the-art on AAV capsid design and improve drug repurposing prediction scores.
@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
ClawProBench:基于运行时覆盖和冻结工作区风格保留集的AI代理跟踪感知评估
ClawProBench引入了一个跟踪感知的基准测试,用于评估AI代理,强调运行时执行和安全性,以揭示最终答案排名的局限性。
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。