@VraserX: 我愿意付费的AI科学家会花大量时间检查他人的研究结果。在最新的RECLAIM预印本中…
摘要
一条推文讨论了新的RECLAIM预印本,该预印本显示AI代理能够根据代码的可用性以不同速率重现研究结果,强调了AI在复制现有研究中的潜在价值。
查看缓存全文
缓存时间: 2026/09/29 19:53
我愿意付费聘请的AI科学家,会花大量时间复核他人的研究成果。
在RECLAIM的新预印本中,最佳智能体在代码、数据和权重均开放的层级中,成功复现了41%的研究成果。而在无代码提供的层级中,最佳复现率仅为15%。
常见的失败案例是:在复现方法时,未核对论文中的原始数据。
你愿意资助一个主要复现现有研究的AI实验室吗?我愿意。
相似文章
RECLAIM:智能体能否复现机器学习论文的主张?
RECLAIM 是一个针对人工智能智能体的基准测试,用于复现机器学习论文中的主张,其难度层级基于可用的代码、数据和权重。研究表明智能体在复现结果时面临困难,在最简单的层级中,最佳成功率为41%。
AI编程代理可复现社会科学发现
本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。
@askalphaxiv: 70%的AI研究不可重复。上周ICML 2026期间,有超过6000+篇研究论文发布,但……
Alphaxiv和Hugging Face发起了一项社区挑战,旨在检验ICML 2026上AI研究论文的可重复性,提供4500美元的GPU积分和一个自动研究代理来帮助参与者。
PaperBench:评估AI复现AI研究的能力
OpenAI推出PaperBench,一个评估AI代理复现最先进AI研究能力的基准。该基准通过复现20篇ICML 2024论文,包含8,316个可评分任务。表现最好的模型(Claude 3.5 Sonnet)仅达到21%的复现分数,低于人类博士级别的表现,凸显了当前自主研究能力的局限性。
@tunguz: 哇。这可能比可重复性危机严重得多。
一款名为 Astra 的 AI 工具被用于分析学术复现包,发现了大量代码错误,其中一些错误推翻了顶级期刊的核心结论,同时还揭示出许多模型并未被正确运行。