@seclink: 另一个开源样本... 通常,你得为此付费,但既然它是开源的,它绝对是那些在手中不那么有价值的东西之一,所以他们将其作为开源发布。
摘要
这篇文章宣布了Autoresearch Bench,一个用于编码代理自主解决研究问题的开源基准测试,指出模型在自主研究循环中存在显著差异。
查看缓存全文
缓存时间: 2026/09/03 12:05
又一个开源示例……通常这类内容需要付费获取,不过既然已经开源,说明它在市场上的价值确实有限,因此才作为开源项目发布。
Joseph Wang (@potatodonkey): 推出 Autoresearch Bench
针对编程智能体自主解决研究问题的评测基准
尽管现有编程基准测试正快速趋于饱和,但在自主研究闭环中,各模型间的能力差异依然显著
相似文章
@VukRosic99: DeepSeek 研究员刚刚开源了他的个人项目 AutoResearch。该项目首次实现了自动化研究代理...
DeepSeek 研究员开源了 AutoResearch,这是一个自主框架,能够在无需人工干预的情况下,为 DeepSeek 285B 模型规划、执行并调试强化学习实验,并附带了一篇关于自我对弈的综述论文。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
@KaiZhang_CS: 看看由 @jianxie_ 训练的最佳开源搜索代理之一!!很高兴看到早期经验方法在……
Yu Su 的团队在有限的学术预算下训练了一个前沿的 Deep Research Agent,使用 8K 合成样本和强化学习,并发布了完全开放的训练基础设施和从 2B 到 35B 参数的模型。
ResearchClawBench:面向端到端自主科学研究的基准测试
ResearchClawBench 是一个用于评估端到端自主科学研究的基准测试,涵盖来自10个领域的40个任务,结果显示当前AI智能体和LLM的重新发现准确率较低,其中Claude Code平均得分为21.5,Claude-Opus-4.7平均得分为20.7(在可能的总分中)。
@lftherios:1/ @karpathy 的 autoresearch 是今年最具代表性的智能体范式之一。问题在于……
Andrej Karpathy 的 autoresearch 范式揭示:当下 AI 智能体各自为战做实验,重复劳动、浪费算力,还不断「重新发明」死路。