@_akhaliq: 论文:
摘要
一篇论文介绍了Arbor,这是一种AI框架,通过结合策略协调、隔离假设测试和持久知识树,实现跨多个领域的自主科学研究,并迭代改进研究成果。
查看缓存全文
缓存时间: 2026/06/11 19:41
paper: https://t.co/cTacdxfPBa
Paper页面 - 通过假设树精炼迈向通用自主研究
来源: https://huggingface.co/papers/2606.11926 发布于 6月10日
#2 今日论文 (https://huggingface.co/papers/date/2026-06-11) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一种名为Arbor的AI框架通过结合策略协调、隔离假设测试和持久知识树,能够在多个领域迭代改进研究成果,从而实现自主科学研究。
科学进步依赖于探索、实验和抽象这一循环的反复进行。研究人员测试候选方向,解读证据,并将经验教训带入后续尝试。我们研究了AI代理如何在长时间跨度(https://huggingface.co/papers?q=long%20horizons)内自主运行这一循环。我们提出了Arbor,一个用于自主研究(https://huggingface.co/papers?q=autonomous%20research)的通用框架,它结合了长期存活的协调器(https://huggingface.co/papers?q=coordinator)、短期存活的执行器(https://huggingface.co/papers?q=executors)以及假设树精炼(Hypothesis Tree Refinement, HTR)——一种持久的树结构,将假设、产物、证据和提炼出的见解跨时间地联系起来。协调器(https://huggingface.co/papers?q=coordinator)管理整体研究策略,作用于该树之上;而执行器(https://huggingface.co/papers?q=executors)则在隔离的工作树(https://huggingface.co/papers?q=worktrees)中实现并测试单个假设。随着结果返回,Arbor更新树结构,传播可复用的经验,精炼搜索前沿,并接纳经过验证的改进。这一设计将自主研究(https://huggingface.co/papers?q=autonomous%20research)从一系列局部尝试转变为累积过程,使策略、执行和证据能够跨时间传递。我们在自主优化(Autonomous Optimization, AO)环境下评估Arbor,该环境允许代理通过迭代实验(https://huggingface.co/papers?q=iterative%20experimentation)改进初始研究产物(https://huggingface.co/papers?q=research%20artifact),而无需逐步人工监督。在涉及模型训练、工具工程和数据合成等六个真实研究任务中,Arbor在所有六个任务上均取得了最佳留出结果(https://huggingface.co/papers?q=held-out%20result),在相同任务界面和资源预算下,平均相对留出增益比Codex和Claude Code高出2.5倍以上。在MLE-Bench Lite(https://huggingface.co/papers?q=MLE-Bench%20Lite)上,Arbor使用GPT-5.5达到了86.36%的Any Medal,这是我们对比中最强的结果。
查看arXiv页面 (https://arxiv.org/abs/2606.11926) 查看PDF (https://arxiv.org/pdf/2606.11926) 项目页面 (https://ruc-nlpir.github.io/Arbor/) GitHub63 (https://github.com/RUC-NLPIR/Arbor) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11926)
在你的代理中获取此论文:
hf papers read 2606.11926
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2606.11926即可从此页面关联。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2606.11926即可从此页面关联。
引用此论文的Spaces0
没有Space关联此论文
在Space README.md中引用arxiv.org/abs/2606.11926即可从此页面关联。
包含此论文的收藏1
相似文章
@HuggingPapers: Microsoft Research 推出 Arbor,一个使用持久假设树精炼的通用自主研究代理…
Microsoft Research 推出 Arbor,一个使用持久假设树精炼进行累积学习的通用自主研究代理,在六个研究任务上超越 Codex 和 Claude Code,并在 MLE-Bench Lite 上达到 86% 的 Any-Medal。
通过假设树优化实现通用自主研究
Arbor是一个用于自主科学研究的AI框架,它使用协调器、执行器和一个持久的假设树,在多个领域迭代改进研究成果,在六个真实研究任务上取得了强劲的成果。
@dair_ai: 值得阅读的新论文.(收藏)自主研究系统通常通过精心挑选的胜利来证明自己,人类…
FARS是一个全自动研究系统,使用阶段特定的AI代理来处理构思、规划、实验和写作,在其首次公开部署中产生了166篇完整的研究论文,涵盖67个AI/ML主题。
Arbor:树搜索作为自主代理的认知层
Arbor 引入了结构化树搜索作为自主代理的认知层,通过制衡多代理架构,实现多日、全栈 LLM 推理优化,相比供应商基线,吞吐量-延迟提升高达 193%。
@_ar9av: 连续第6天每天阅读一篇关于AI的arXiv论文并分享真正印象深刻的内容:AutoSci(北京大学)概要:…
一条推文介绍北京大学开发的AutoSci系统,该系统可自动化从文献调研到回复审稿意见的整个研究流程,并在项目间进行自我改进。