标签
论文提出了 MIRA,一种用于长时程研究智能体的分层元推理架构,将研究资源分配与具体执行分离;以及 MIRA-AC,一种生成式 actor-critic,可在元推理决策边界处学习信用分配,从而提升定理证明与神经架构搜索研究的效果。
查尔姆斯理工大学的研究人员开发出一种闭环AI科学家,能够生成生物学假设、通过实验室机器人设计并执行实验,并从结果中学习。他们以酵母为对象进行测试,共产生了1,933个候选假设。
一项对 Vais 自主研发(autonomous-R&D)趋势测量方法的分析预测,前沿级 AI 研究员将于 2027 年 7 月出现,与此前 AI 2027 情景报告所预测的时间线完全吻合。
Qwen 最新的 Planner-Agent 预印本描述了一个 AI 系统:它能自动生成任务、收集训练数据,并将失败反馈回模型训练,而人类仍然负责审核修改。这指向一个 AI 研究越来越自动化的趋势。
十个Sonnet 5.5 AI智能体通过15小时的自主研究,解决了一个源自1904年的数学难题,产出了一个包含17,895行的证明。
本文将Andrej Karpathy的AutoResearch范式应用于生产规模的机器学习,识别出五种常见的故障模式,并提出一个多智能体框架,相比手动调优的基线,实现了显著的性能提升。
微软研究人员推出了 DualGraph,这是一种将智能体记忆分割为大纲和知识图谱的架构,以增强自主研究。该架构在 Claude Opus 5.5 和 GPT-6 Sol 上实现了前所未有的 RACE 分数和成本节约。
ScientistTwo 是来自 Google Cloud AI Research 的一个自主多代理框架,它在无需人工干预的情况下执行端到端的科学发现周期,并与顶级 AI 会议如 ICLR、ICML 和 NeurIPS 进行基准测试,超越了人类最先进的模型。
介绍PrimeScientist,这是一种在自主研究智能体中使用自适应MCTS策略来策略性分配研究投入的方法,旨在资源约束下提高研究质量和样本效率。
Auto-RecSys 是一个自主研究系统,用于自动化工业级推荐模型的长期实验,通过分布式执行、集中式记忆和认知程序分离来提高效率和可靠性。
由求是引擎(Qiushi Engine)进行的自主研究项目对BabyLM 2026 Strict-Small进行了端到端的研究,通过原则指导的方法改进了数据高效的语言模型,并在公开快照中取得了最高分。
Meta的自主AI研究系统AIRA₃在一场由NVIDIA主办的Kaggle竞赛中排名第8(约4000支参赛队伍),赢得金牌。该竞赛旨在对300亿参数的Nemotron模型进行微调,AIRA₃的表现优于拥有相同工具访问权限的人类竞争者。
GPT-6 Astra 通过研究数百张参考照片、迭代3D场景并渲染视频,以极少的人工干预自主地在 Blender 中再现了艺术宫。
本文介绍了AIMC,一个用于人类监督自主科学发现的可视化分析框架,支持对AI生成的研究成果进行监控和理解。
Starpower Technology 开发了 arXiv-WVY-43M,这是一款微小的 43.5M 参数语言模型,基于 arXiv 标题和摘要从零开始训练,专为自主研究应用设计。
Amplio 是一个由 Google DeepMind 开源的轻量级、健壮的代理工具,用于自主长期 AI 研究运行,具有崩溃恢复功能和简单的步骤模型。
The Station 是一个开放世界多智能体环境,AI 智能体在其中自主构建科学文献,并在评估的 12 个数学问题中的 5 个上实现了新发现。
AutoResearch 引入了一个两阶段自主系统,通过集成生成和基于证据的执行来奠定研究理念的基础,以提高实验可靠性和减少幻觉。
本文报道了在nanoGPT优化器速度竞赛中,对18个前沿AI模型进行自主测试的比较,详细阐述了它们在缩小与人类记录差距方面的表现。
ASI-Bench 是一个新的基准测试,旨在评估 AI 系统在 11 个科学领域中创新探索和自主科学执行的能力,揭示了当前 AI 对人类指导的严重依赖。