标签
本文介绍了AIDE^2,这是一个系统,它使AI研究智能体能够通过递归自我改进自主提升其代码,从而在多种AI研究任务中获得性能提升。
Paper2Agent 是一个发表在 Nature 上的多智能体框架,它自动将研究论文转化为虚拟作者,使 AI 智能体能够与科学知识进行交互并在此基础上构建,从而促进更深入的发现。
Andy Matuschak 分享了一项可编程荧光笔的实验,该工具可以自动化查找引文、进行事实核查以及与AI代理交互。
文章回顾了AlphaFold如何变革蛋白质结构预测,并推测类似的AI进步可能会颠覆数学领域,将人类角色转向解释和验证,同时可能自动化关键任务。
OpenAI 声称,其 AI 智能体现在每 1 个人类研究员工作日可贡献 3.1 个工作日,已达到“自动化研究实习生”水平,并预计 2028 年 3 月实现“自动化 AI 研究员”。该公司表示,智能体系统加速了递归自我改进的进程,使其研究团队规模从约 1000 人有效扩充至相当于 4000 人以上。
本文开发了一个LLM流水线,用于自动化疾病传播建模中的系统文献综述,并将GPT-4.1和GPT-5.0的性能与人工进行的综述进行比较。
本文质疑,像AQuA这样拥有持久记忆但模型权重固定的系统是否算递归自我提升,并引用了一篇采用更狭义定义的论文。
本文介绍了一个个性化自动研究系统的框架,该框架将研究过程的每个阶段都基于个体科学家的表示进行条件化,认为个性化是AI作为真正科研伙伴而非通用工具的关键。
Akshay Pachaar 介绍了 Transformer Lab 的 Primus,这是一个自主 AI 研究员,它自动化了从文献综述到论文写作的完整研究循环,并在实验中展示了其自我纠正能力。
本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。
SciForge 是一个开源的、AI原生的多模态科学发现工作台,集成了搜索、推理、工作流执行和证据治理功能,通过八个端到端用例(包括基因发现和蛋白质设计)进行了展示。
一则推特串强调了新兴的自动化研究实验室,它们正在构建AI系统来全自动化研究循环,从提出假设到进行实验。
本文提出了一种面向自主研究代理的方法,通过假设树精炼生成并测试假设,旨在实现通用科学发现。
AutoSci是一个以记忆为中心的智能代理系统,旨在自动化完整的科学研究生命周期,从文献理解到回复审稿意见,使用基于LLM的智能体,具有持久记忆和自我进化能力。
开源AI代理Feynman通过四大智能体协同,将博士级研究流程(包括arXiv调研、文献综述、代码验证)压缩成全自动执行,用户只需一句话指令即可完成。
一个基于Claude Code构建的系统,使其能够从终端控制Google的NotebookLM,通过搜索YouTube、上传资料源,并将带引用的答案直接导出到Obsidian,实现研究自动化。该工作流消除了对多个浏览器标签页和手动复制粘贴的需求,并确保了引用准确性得到验证。
Hugging Face 开源了 ml-intern,一个自主智能体,能够完成整个机器学习后训练循环——阅读论文、查找数据集、编写脚本、生成数据、监控训练并上传权重——在无需人工干预的情况下,使用1.7B模型在10小时内实现了显著的GPQA提升。
一篇综述论文,探讨了AI从特定任务助手到工作流级研究自动化工具的转变,将AutoResearch定义为AI驱动的科学工作流自动化的光谱,并分析了自主性、可重复性和问责制方面的挑战。
ARIS 是一个在 GitHub 上爆火(8.8k stars)的开源工具,它通过轻量级的 Markdown 技能包,让 Claude Code 或其他 LLM Agent 能够自主完成机器学习研究的完整闭环,包括文献调研、实验执行和论文写作。
NanoResearch 是一个多智能体框架,旨在通过协同进化技能、记忆和策略,适应个人用户的偏好和研究风格,从而实现个性化研究自动化。