AREX:迈向递归自我改进的深度研究代理
摘要
AREX 引入了一系列用于深度研究的递归自我改进代理,在内层研究循环和外层自我改进循环之间交替,并通过长周期强化学习进行训练。在 BrowseComp 和 Humanity's Last Exam 等基准测试中,其表现大幅优于同量级基线模型。
查看缓存全文
缓存时间: 2026/07/24 05:06
论文页面 - AREX:迈向递归自我改进的深度研究智能体
来源:https://huggingface.co/papers/2607.21461
发表于 7 月 23 日
#1 今日论文 (https://huggingface.co/papers/date/2026-07-24)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
深度研究要求智能体找到同时满足多重约束的答案。发现此类答案成本高昂,而验证候选答案通常可分解为可处理的逐约束检查。这种发现-验证不对称性表明,研究智能体不应仅仅是更长时间地搜索:它应通过验证中间结果,并利用部分验证的状态来指导后续改进,从而递归地改进当前答案。我们提出了 AREX,一个递归自我改进(RSI)深度研究智能体家族。AREX 在内部研究循环(收集证据并构建临时答案)与外部自我改进循环(逐约束审计答案、识别未解决的声明并启动有针对性的后续研究)之间交替进行。为了在长时间跨度内维持 RSI,AREX 学习了一种自主上下文更新工具,该工具将不断增长的交互历史压缩成一个紧凑的改进状态,保留已验证的证据和未解决的约束,而无需依赖外部模型。我们通过智能体中期训练和长视界强化学习,在经过验证的合成任务与高质量轨迹上训练 AREX。为了缓解长视界学习过程中稀疏最终奖励的问题,我们强调那些获取决定性证据或纠正错误研究方向的关键步骤。我们实例化了一个密集的 4B 模型和一个 122B-A10B 专家混合模型。在 BrowseComp、WideSearch、DeepSearchQA、人类最后考试(HLE)以及其他推理与工具使用基准测试中,AREX 显著优于同规模基线,并且与使用更多激活参数的模型相比仍具有竞争力。
查看 arXiv 页面 (https://arxiv.org/abs/2607.21461)
查看 PDF (https://arxiv.org/pdf/2607.21461)
项目页面 (https://vectorspacelab.github.io/arex-model/)
GitHub1 (https://github.com/VectorSpaceLab/arex-model)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21461)
在你的智能体中获取这篇论文:
hf papers read 2607\.21461
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型3
BAAI/AREX-Turbo 文本生成• 5B• 约2小时前更新 • 5 (https://huggingface.co/BAAI/AREX-Turbo)
BAAI/AREX-Base 文本生成• 123B• 约2小时前更新 • 4 (https://huggingface.co/BAAI/AREX-Base)
cfli/A-base 文本生成• 123B• 约2小时前更新 (https://huggingface.co/cfli/A-base)
引用此论文的数据集0
无数据集链接此论文
请在一个数据集的 README.md 中引用 arxiv.org/abs/2607.21461,以将其链接到此页面。
引用此论文的 Spaces0
无 Space 链接此论文
请在一个 Space 的 README.md 中引用 arxiv.org/abs/2607.21461,以将其链接到此页面。
包含此论文的收藏0
无收藏包含此论文
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
Autoresearch:自我完善智能体背后的反馈循环(11分钟阅读)
Introspection是一家由前xAI工程师创立的新AI初创公司,它推出了'autoresearch'——一种反馈循环系统,智能体通过信号、评估和人类输入来维护并完善自身,超越了传统的智能体框架。
递归自我改进的首个实验证据(3分钟阅读)
研究人员展示了AIDE²,这是一个具有递归自动研究循环的系统,在超过100次迭代中改进了自己的代码,发现了七项改进,并在保留的基准测试上击败了手动调优的智能体。
AI中的递归自我改进:从有界自我优化到自主研究循环
对2024–2026年间1,250篇关于AI递归自我改进的论文进行了全面综述,提出了将有界自我优化与开放式递归自我改进相区分的分类体系,并分析了评估器设计空间和失败模式。
APEX: Adaptive Principle EXtraction — 面向生产级AI智能体的三层自进化框架
APEX 提出了一个面向生产级AI智能体的三层自进化框架,同时优化了控制层(harness)、行为原则和工作流拓扑。在生产级智能体上的实验显示,健康评分和工作流质量显著提升,且仅需极少的LLM调用。
利用专家代理进行自动研究:开发高效且非平凡的训练配方
本文介绍了一种自动研究框架,利用专家代理通过代码执行与反馈的经验闭环,迭代优化训练配方。该系统借助谱系反馈(lineage feedback),无需人工干预,即可在 Parameter Golf 和 NanoChat 等任务上自主提升性能。