@VraserX: 我愿意付费的AI科学家会花大量时间检查他人的研究结果。在最新的RECLAIM预印本中…

X AI KOLs Following 新闻

摘要

一条推文讨论了新的RECLAIM预印本,该预印本显示AI代理能够根据代码的可用性以不同速率重现研究结果,强调了AI在复制现有研究中的潜在价值。

我愿意付费的AI科学家会花大量时间检查他人的研究结果。 在最新的RECLAIM预印本中,最佳代理在代码、数据和权重都可用的层级中重现了41%的结果。没有代码时,最佳比率是15%。 一个常见的失败是在不检查论文数字的情况下实现方法。 你会资助一个主要复制现有研究的AI实验室吗?我会。
查看原文
查看缓存全文

缓存时间: 2026/09/29 19:53

我愿意付费聘请的AI科学家,会花大量时间复核他人的研究成果。

在RECLAIM的新预印本中,最佳智能体在代码、数据和权重均开放的层级中,成功复现了41%的研究成果。而在无代码提供的层级中,最佳复现率仅为15%。

常见的失败案例是:在复现方法时,未核对论文中的原始数据。

你愿意资助一个主要复现现有研究的AI实验室吗?我愿意。

相似文章

RECLAIM:智能体能否复现机器学习论文的主张?

arXiv cs.AI

RECLAIM 是一个针对人工智能智能体的基准测试,用于复现机器学习论文中的主张,其难度层级基于可用的代码、数据和权重。研究表明智能体在复现结果时面临困难,在最简单的层级中,最佳成功率为41%。

AI编程代理可复现社会科学发现

arXiv cs.CL

本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。

PaperBench:评估AI复现AI研究的能力

OpenAI Blog

OpenAI推出PaperBench,一个评估AI代理复现最先进AI研究能力的基准。该基准通过复现20篇ICML 2024论文,包含8,316个可评分任务。表现最好的模型(Claude 3.5 Sonnet)仅达到21%的复现分数,低于人类博士级别的表现,凸显了当前自主研究能力的局限性。