RSIAgent: 在新环境中递归自我改进的自主探索
摘要
RSIAgent 是一个无需训练的多智能体框架,它使数字智能体能够通过递归自我改进、自主记忆构建和广度优先然后深度优先的探索来适应新环境,在基准测试中优于闭源模型。
查看缓存全文
缓存时间: 2026/09/15 06:39
论文页面 - RSIAgent:在新环境中实现递归自我改进的自主探索框架
来源:https://huggingface.co/papers/2609.15364
摘要
RSIAgent 是一个无需训练的多智能体框架,通过自主记忆构建和“先广后深”的探索策略,使数字智能体能够在新环境中实现递归自我改进。
数字智能体经常需要适应新环境,而这些环境的接口、工具和失效模式往往无法被预训练模型完全覆盖。我们提出了 RSIAgent(https://huggingface.co/papers?q=RSIAgent),一个无需训练的多智能体框架(https://huggingface.co/papers?q=multi-agent%20framework),通过自主记忆构建(https://huggingface.co/papers?q=autonomous%20memory%20construction)实现递归自我改进(https://huggingface.co/papers?q=recursive%20self-improvement)。RSIAgent(https://huggingface.co/papers?q=RSIAgent)协调课程智能体、执行智能体和验证智能体,持续探索环境、验证结果并保留环境特定知识,包括可重用的、关于行为、条件和后果之间的因果关系(https://huggingface.co/papers?q=causal%20relationships)。它进一步采用了“先广后深”的探索策略(https://huggingface.co/papers?q=broad-then-deep%20exploration),将并行的广泛递归自我探索(https://huggingface.co/papers?q=recursive%20self-exploration)以发现多样化的环境结构,与集中的深度自我探索相结合,以揭示困难案例、隐藏约束、边界条件以及先前未知的因果依赖关系。由此生成的记忆将被冻结,并可直接用于下游任务,无需更新模型参数。在 OSWorld-v2 和 Agent’s Last Exam 上的实验表明,RSIAgent(https://huggingface.co/papers?q=RSIAgent)显著提升了强大的开源模型性能,使 Kimi-K3 和 GLM-5.3 能够超越包括 GPT-6 在内的前沿闭源模型。
查看 arXiv 页面 (https://arxiv.org/abs/2609.15364)查看 PDF (https://arxiv.org/pdf/2609.15364)项目主页 (https://aetherlabsai.github.io/RSIAgent/)GitHub50 (https://github.com/AetherLabsAI/RSIAgent)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.15364)
在你的智能体中获取此论文:
hf papers read 2609\.15364
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.15364 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.15364 以从此页面链接它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.15364 以从此页面链接它。
包含此论文的收藏夹0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接它。
相似文章
@EinsiaAI: 1/ 递归自我改进 (RSI) 取决于代理如何改进AI系统的训练——而不仅仅是调整超参数…
本文介绍了AI4AI-Bench,这是一个评估AI代理改进训练算法能力的基准测试,展示了在十个研究仓库中性能分数低和探索成本高的情况。
Dream-RSI: 通过进化世界的递归自我改进
Dream-RSI 是一个用于AI代理的可扩展递归自我改进框架,它利用历史发现树创建重放模拟器,用于离线策略评估,减少在线成本并提高发现效率。
ModularRSI:模块化与可泛化的递归式智能体框架自我改进
ModularRSI 提出了一种模块化、可泛化的递归式自我改进框架,用于智能体框架。该框架利用跨任务的对比学习独立演进模块,提升在未见任务上的性能。
@hooshaaii: 扩展推理不仅仅是更长的上下文——而是修复递归自我改进(RSI)中的'上下文拖拽'。IC…
本文介绍了Dream-RSI,一个用于AI代理可扩展递归自我改进的框架,它使用重放模拟器来优化探索策略,降低发现成本并提高质量。
AREX:迈向递归自我改进的深度研究代理
AREX 引入了一系列用于深度研究的递归自我改进代理,在内层研究循环和外层自我改进循环之间交替,并通过长周期强化学习进行训练。在 BrowseComp 和 Humanity's Last Exam 等基准测试中,其表现大幅优于同量级基线模型。