AREX:迈向递归自我改进的深度研究代理

Hugging Face Daily Papers 论文

摘要

AREX 引入了一系列用于深度研究的递归自我改进代理,在内层研究循环和外层自我改进循环之间交替,并通过长周期强化学习进行训练。在 BrowseComp 和 Humanity's Last Exam 等基准测试中,其表现大幅优于同量级基线模型。

深度研究需要代理能够找到同时满足多个约束条件的答案。发现这类答案成本高昂,而验证候选答案往往可以分解为可处理的逐约束检查。这种发现与验证的不对称性表明,研究代理不应仅仅进行更长时间的搜索,而应递归地改进当前答案:通过验证中间结果,并利用部分验证状态来指导后续改进。我们引入了AREX,一个递归自我改进(RSI)深度研究代理系列。AREX在内层研究循环(收集证据并构建临时答案)和外层自我改进循环(按约束条件审计答案、识别未解决的主张并启动针对性后续研究)之间交替进行。为了在长周期内维持RSI,AREX学习了一个自主上下文更新工具,该工具将不断增长的交互历史压缩为紧凑的改进状态,保留已验证的证据和未解决的约束,无需依赖外部模型。我们通过智能体中期训练和长周期强化学习,在已验证的合成任务和高质量轨迹上训练AREX。为了缓解长周期学习中的稀疏最终奖励问题,我们强调了在获取关键证据或纠正错误研究方向的关键步骤。我们实例化了一个稠密的4B模型和一个122B-A10B混合专家模型。在BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam(HLE)以及其他推理和工具使用基准测试中,AREX在性能上大幅超越同量级基线,并且与使用了更多激活参数的模型相比仍然具有竞争力。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - AREX:迈向递归自我改进的深度研究智能体

来源:https://huggingface.co/papers/2607.21461
发表于 7 月 23 日

#1 今日论文 (https://huggingface.co/papers/date/2026-07-24)
作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

深度研究要求智能体找到同时满足多重约束的答案。发现此类答案成本高昂,而验证候选答案通常可分解为可处理的逐约束检查。这种发现-验证不对称性表明,研究智能体不应仅仅是更长时间地搜索:它应通过验证中间结果,并利用部分验证的状态来指导后续改进,从而递归地改进当前答案。我们提出了 AREX,一个递归自我改进(RSI)深度研究智能体家族。AREX 在内部研究循环(收集证据并构建临时答案)与外部自我改进循环(逐约束审计答案、识别未解决的声明并启动有针对性的后续研究)之间交替进行。为了在长时间跨度内维持 RSI,AREX 学习了一种自主上下文更新工具,该工具将不断增长的交互历史压缩成一个紧凑的改进状态,保留已验证的证据和未解决的约束,而无需依赖外部模型。我们通过智能体中期训练和长视界强化学习,在经过验证的合成任务与高质量轨迹上训练 AREX。为了缓解长视界学习过程中稀疏最终奖励的问题,我们强调那些获取决定性证据或纠正错误研究方向的关键步骤。我们实例化了一个密集的 4B 模型和一个 122B-A10B 专家混合模型。在 BrowseComp、WideSearch、DeepSearchQA、人类最后考试(HLE)以及其他推理与工具使用基准测试中,AREX 显著优于同规模基线,并且与使用更多激活参数的模型相比仍具有竞争力。

查看 arXiv 页面 (https://arxiv.org/abs/2607.21461)
查看 PDF (https://arxiv.org/pdf/2607.21461)
项目页面 (https://vectorspacelab.github.io/arex-model/)
GitHub1 (https://github.com/VectorSpaceLab/arex-model)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21461)

在你的智能体中获取这篇论文:

hf papers read 2607\.21461

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型3

BAAI/AREX-Turbo 文本生成• 5B• 约2小时前更新 • 5 (https://huggingface.co/BAAI/AREX-Turbo)

BAAI/AREX-Base 文本生成• 123B• 约2小时前更新 • 4 (https://huggingface.co/BAAI/AREX-Base)

cfli/A-base 文本生成• 123B• 约2小时前更新 (https://huggingface.co/cfli/A-base)

引用此论文的数据集0

无数据集链接此论文

请在一个数据集的 README.md 中引用 arxiv.org/abs/2607.21461,以将其链接到此页面。

引用此论文的 Spaces0

无 Space 链接此论文

请在一个 Space 的 README.md 中引用 arxiv.org/abs/2607.21461,以将其链接到此页面。

包含此论文的收藏0

无收藏包含此论文

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

递归自我改进的首个实验证据(3分钟阅读)

TLDR AI

研究人员展示了AIDE²,这是一个具有递归自动研究循环的系统,在超过100次迭代中改进了自己的代码,发现了七项改进,并在保留的基准测试上击败了手动调优的智能体。