RRSI: 智能体框架的正则化递归自我改进

Hugging Face Daily Papers 论文

摘要

本文介绍了针对AI智能体框架的正则化递归自我改进(RRSI),该方法在递归进化过程中应用正则化以防止过拟合,在多个基准测试中展示了性能提升。

LLM智能体的能力在很大程度上被其框架放大,即围绕冻结骨干模型的提示、控制流、工具、记忆和上下文管理。近期方法通过迭代地提议和选择智能体框架的组件级编辑,越来越自动化这一过程,实际上在智能体系统层面建立了一种递归自我改进(RSI)的形式。然而,这种递归进化可能通过记忆训练任务而过拟合,显示出巨大的分布内增益,这些增益在分布外基准测试中缩小甚至消失。我们引入了智能体框架的正则化递归自我改进(RRSI),通过约束进化候选提议和选择,将正则化原理融入框架自我改进。提议器使用时间退火预算操作,限制一个候选可以捆绑的编辑数量,并根据进化历史鼓励未探索的轨迹。选择器配备了一个评估器和一个修剪器:评估器筛选基准特定的提案,而修剪器移除太小、太昂贵或不再有用的更改。这些约束共同倾向于可重用的智能体机制,而非基准特定机制甚至噪声。在涵盖编码、智能体工作空间和工程设计任务的八个基准测试中,RRSI在它进化所针对的分割上获得最多14.1分,在五个分布外基准测试上获得最多4.7分,同时产生的框架比未正则化进化少运行30%的策略令牌。代码可在 https://github.com/google-research/rrsi 获取,项目页面是 https://regularized-rsi.com/。
查看原文
查看缓存全文

缓存时间: 2026/09/22 03:24

论文页面 - RRSI:智能体框架的正则化递归自改进

来源:https://huggingface.co/papers/2609.24972 发布于 9 月 21 日

#2 每日论文(https://huggingface.co/papers/date/2026-09-22) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

大型语言模型智能体的能力在很大程度上由其框架(即围绕冻结的主干模型的提示、控制流、工具、记忆和上下文管理)所放大。近期的方法通过迭代地提出和选择智能体框架的组件级编辑,日益自动化这一过程,实际上在智能体系统层面建立了一种递归自改进(RSI)的形式。然而,这种递归进化可能通过记忆训练任务而过拟合,表现为在分布内任务上获得巨大收益,但在分布外基准测试上收益缩小甚至消失。我们提出了智能体框架的正则化递归自改进(RRSI),它将正则化原则引入框架自改进中,通过约束进化候选方案的提议和选择来实现。提议者采用时间退火预算运作,限制一个候选方案可以捆绑的编辑数量,并鼓励基于进化历史探索未尝试的路径。选择者配备了一个批评者和一个剪枝器:批评者筛选针对特定基准的方案,而剪枝器则移除那些过于微小、成本过高或不再有用的变更。这些约束共同作用,使得可重用的智能体机制优于特定基准的机制甚至噪音。在涵盖编码、智能体工作空间和工程设计任务的八个基准测试中,RRSI 在其进化的分裂集上最高提升了 14.1 分,在五个分布外基准测试上最高提升了 4.7 分,同时生成的框架运行所需的策略 token 比未正则化的进化减少了 30%。代码可在 https://github.com/google-research/rrsi 获取,项目页面为 https://regularized-rsi.com/。

查看 arXiv 页面(https://arxiv.org/abs/2609.24972) 查看 PDF(https://arxiv.org/pdf/2609.24972) 项目页面(https://regularized-rsi.com/) GitHub(https://github.com/google-research/rrsi) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.24972)

在您的智能体中获取此论文:

hf papers read 2609.24972

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.24972,即可从此页面链接该模型。

引用此论文的数据集 0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.24972,即可从此页面链接该数据集。

引用此论文的 Space 0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.24972,即可从此页面链接该 Space。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接它。

相似文章

递归式 Harness 自我改进

arXiv cs.AI

介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。