Matryoshka Agent:为长期机器学习工程展开子代理

arXiv cs.AI 论文

摘要

Matryoshka Agent 是一个层次化代理框架,它将长期机器学习工程任务分解为高级编排器和低级子代理,实现高效探索和迭代优化。它在复杂的 MLE 任务上显著提升性能,使 4B 模型匹配 o4-mini 的编排能力,并在 30B 编码器模型上带来高达 36.7% 的相对收益。

arXiv:2607.25090v1 公告类型: 新 摘要: 机器学习工程 (MLE) 任务需要在迭代式的解决方案调试与优化中进行长期决策,且环境交互成本高昂、依赖反馈。为此类任务开发和训练单一代理本质上极具挑战,因为它必须同时管理极其冗长且嘈杂的上下文、探索庞大的解空间,并在有限的模型容量和计算预算下保持有效性。为应对这些挑战,我们提出 Matryoshka Agent,一个用于复杂长期任务的统一层次化代理框架。Matryoshka Agent 将代理问题求解分解为决策与执行的分层协调:高级编排器维护紧凑的长期探索状态并发出策略指令,而低级子代理通过标准化工具接口直接与环境交互来执行具体的解决方案尝试。这种设计将策略探索与昂贵的执行解耦,大幅减轻了长上下文推理的负担,并实现了高效的迭代优化。我们进一步为 Matryoshka Agent 开发了高效的训练范式。在多种模型类型和规模下的广泛 MLE 任务上的实验结果表明,Matryoshka Agent 是长期 MLE 任务及复杂代理问题求解的一种有效且可扩展的范式。值得注意的是,Matryoshka Agent 使 Qwen3-4B-Instruct 达到了与 o4-mini 相当的编排器性能。将 Matryoshka Agent 应用于 Qwen3-30B-Coder 带来了最多 36.7% 的相对性能提升。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:53

# 套娃智能体:面向长周期机器学习工程任务的子智能体展开方法

来源:https://arxiv.org/html/2607.25090

Rushi Qiang, Changhao Li, Haotian Sun¹, Yuchen Zhuang, Chao Zhang, Bo Dai

佐治亚理工学院
{rqiang6, cli911, haotian.sun}@gatech.edu
[email protected]
[email protected]
[email protected]

###### 摘要

机器学习工程(MLE)任务需要在昂贵且反馈驱动的环境交互下,进行长周期决策以迭代调试和优化解决方案。为这类任务开发并训练单一智能体面临根本性挑战:它必须同时处理极其冗长且嘈杂的上下文、探索庞大的解空间,并在有限的模型容量和计算预算下保持有效性。为解决这些挑战,我们提出**套娃智能体(Matryoshka Agent)**,一个面向复杂长周期任务的统一层次化智能体框架。该框架将智能体问题求解分解为协调的决策与执行层次:高层级的**编排器(Orchestrator)**维护紧凑的长周期探索状态并发出策略性指令,而低层级的**子智能体(Sub-Agent)**则通过直接环境交互(经标准化**工具(Tool)**接口中介)执行具体的解决方案尝试。这一设计将策略性探索与昂贵执行分离,显著减轻了长上下文推理的负担,并实现了高效的迭代优化。我们进一步为套娃智能体开发了一套高效的训练范式。在涵盖多种模型类型与规模的广泛MLE任务上的实验结果表明,套娃智能体(Matryoshka Agent)是面向长周期MLE任务及复杂智能体问题求解的有效且可扩展的范式。值得注意的是,套娃智能体使Qwen3-4B-Instruct达到了与o4-mini可比的编排器性能。将套娃智能体应用于Qwen3-30B-Coder,可获得最高36.7%的相对性能提升。

## 1 引言

大型语言模型(LLM)已从静态问答聊天机器人发展为能够通过与真实世界环境交互来解决复杂多步挑战的自主智能体 [chan2024mle](https://arxiv.org/html/2607.25090#bib.bib6); [jimenez2023swe](https://arxiv.org/html/2607.25090#bib.bib24); [qiang2025mledojo](https://arxiv.org/html/2607.25090#bib.bib40); [zhou2023webarena](https://arxiv.org/html/2607.25090#bib.bib63); [merrill2026terminal](https://arxiv.org/html/2607.25090#bib.bib30); [wei2025browsecomp](https://arxiv.org/html/2607.25090#bib.bib52); [yao2024tau](https://arxiv.org/html/2607.25090#bib.bib58); [xie2024osworld](https://arxiv.org/html/2607.25090#bib.bib54); [patwardhan2025gdpval](https://arxiv.org/html/2607.25090#bib.bib37)。在这一不断扩大的领域中,涌现出一类新的性能优化型智能体任务,其目标并非仅仅是完成单个可执行目标,而是通过环境反馈逐步提升解的质量 [ouyang2025kernelbench](https://arxiv.org/html/2607.25090#bib.bib36); [press2025algotune](https://arxiv.org/html/2607.25090#bib.bib39); [rank2026posttrainbench](https://arxiv.org/html/2607.25090#bib.bib42)。这些任务通常具备几个根本性挑战。首先,长周期交互自然会生成日益增长的上下文,包括跨回合累积的执行日志、中间输出和调试反馈 [du2025deepresearch](https://arxiv.org/html/2607.25090#bib.bib12); [wei2025browsecomp](https://arxiv.org/html/2607.25090#bib.bib52)。其次,这些任务涉及庞大且开放的动作和观测空间,多样化的观测结果可能引发大量后续的优化选择 [phan2025humanity](https://arxiv.org/html/2607.25090#bib.bib38); [merrill2026terminal](https://arxiv.org/html/2607.25090#bib.bib30); [ouyang2025kernelbench](https://arxiv.org/html/2607.25090#bib.bib36); [press2025algotune](https://arxiv.org/html/2607.25090#bib.bib39)。第三,环境交互通常带来高昂的墙钟时间和计算成本,这使得推理时探索和训练时数据收集都变得昂贵 [starace2025paperbench](https://arxiv.org/html/2607.25090#bib.bib44); [huang2023mlagentbench](https://arxiv.org/html/2607.25090#bib.bib20); [rank2026posttrainbench](https://arxiv.org/html/2607.25090#bib.bib42)。机器学习工程(MLE)任务,因其依赖于具有多种模态(例如图像、文本)、模式、数据分布和评估目标的任务特定数据集,构成了这些困难的一个特别具有挑战性和代表性的实例 [nam2025mle](https://arxiv.org/html/2607.25090#bib.bib32); [jing2024dsbench](https://arxiv.org/html/2607.25090#bib.bib25); [chan2024mle](https://arxiv.org/html/2607.25090#bib.bib6); [qiang2025mlesmith](https://arxiv.org/html/2607.25090#bib.bib41); [huang2023mlagentbench](https://arxiv.org/html/2607.25090#bib.bib20)。因此,有效的MLE智能体必须将强大的编码和调试技能与深厚的领域知识以及系统性探索和利用多样化方法论备选方案的能力相结合 [jiang2025aide](https://arxiv.org/html/2607.25090#bib.bib23); [li2024autokaggle](https://arxiv.org/html/2607.25090#bib.bib27); [yang2025r](https://arxiv.org/html/2607.25090#bib.bib57); [guo2024ds](https://arxiv.org/html/2607.25090#bib.bib17); [nam2025mle](https://arxiv.org/html/2607.25090#bib.bib32); [toledo2025ai](https://arxiv.org/html/2607.25090#bib.bib48),这不可避免地需要积累包含冗余信息的大量历史上下文。此外,MLE代码的实际执行通常计算密集且耗时,特别是对于大规模数据集。在嘈杂且部分冗余的历史记录下处理长上下文的需求、环境交互的巨大时间和计算成本,以及对持续探索和迭代优化的要求,共同对智能体有效解决这类重要而高度复杂的任务构成了严峻挑战。

为应对这些挑战,我们提出**套娃智能体(Matryoshka Agent)**,一个面向长周期MLE任务的层次化框架。套娃智能体将迭代性能优化分解为三个协调的层级。**编排器**充当高层决策层:它维护跨回合的紧凑状态,包括先前的指令、总结性的结果和评估分数,并决定下一步应优化哪个解决方案方向。**子智能体**充当执行层:它们以全新的上下文实例化,通过直接环境交互来实现、运行和调试具体的解决方案尝试。**工具**则通过格式化编排器指令、注入从先前尝试中选择的参考信息、启动子智能体,并返回结构化的总结和分数,来在这些层级之间进行调解。这一设计在策略演进与具体执行之间建立了有效的分离,减轻了长上下文负担,同时保留了用于迭代优化的关键信息。除了推理时框架,套娃智能体还进一步开发了一套针对昂贵性能优化任务定制的训练范式。在训练期间,基于**解决方案优化树**的采样重用共享的执行前缀,并从共同状态收集不同优化方案之间的结构化比较结果。这些比较提供了轨迹级别的偏好信号,用于通过在线基于排序的强化学习来优化编排器,同时成功的执行轨迹被用于改进子智能体。

参见图注

图1:套娃智能体(Matryoshka Agent)概览。上图:三层结构间的交互逻辑。下图:基于解决方案优化树采样的训练范式。

我们的贡献可总结如下:

- •我们提出套娃智能体(Matryoshka Agent),一个层次化的MLE智能体框架,通过结构化的工具中介反馈将高层编排与低层代码执行解耦。
- •我们引入了一个基于解决方案优化树采样和轨迹级别排序优化的训练范式,使得编排器能够从昂贵的环境交互中进行高效学习,同时支持从成功执行中改进子智能体。
- •我们在涵盖多种模型类型、规模和组合的广泛MLE任务上对套娃智能体进行了全面的评估与分析。实验结果证明了套娃智能体及其训练范式的有效性。

## 2 相关工作

#### 模块化LLM智能体

基于LLM的智能体近期进展日益强调模块化架构,其中专门的组件协调处理多样化的决策上下文 [wang2024simulating](https://arxiv.org/html/2607.25090#bib.bib51); [hong2024metagpt](https://arxiv.org/html/2607.25090#bib.bib18); [yan2025selftalk](https://arxiv.org/html/2607.25090#bib.bib55); [chen2024autoagents](https://arxiv.org/html/2607.25090#bib.bib8); [zhang2024chainagents](https://arxiv.org/html/2607.25090#bib.bib61)。此类模块之间的交互已显示出在改善推理、探索和任务执行方面的强大潜力 [liang2024encouraging](https://arxiv.org/html/2607.25090#bib.bib28); [talebirad2023multi](https://arxiv.org/html/2607.25090#bib.bib45); [chen2023agentverse](https://arxiv.org/html/2607.25090#bib.bib9); [bettini2024benchmarl](https://arxiv.org/html/2607.25090#bib.bib4); [zhang2026agentorchestra](https://arxiv.org/html/2607.25090#bib.bib60)。早期的模块化框架主要依赖基于顾问或控制器的指导,通过引入可训练模块,借助中间信号来引导冻结的基础模型 [asawa2025train](https://arxiv.org/html/2607.25090#bib.bib1); [shang2025agentsquare](https://arxiv.org/html/2607.25090#bib.bib43); [wei2025reactplannercentric](https://arxiv.org/html/2607.25090#bib.bib53)。超越这一范式,Matryoshka-Pilot [li2025matryoshka](https://arxiv.org/html/2607.25090#bib.bib26) 采用了控制器-生成器框架,其中轻量级可训练控制器通过结构化指导显式控制黑盒LLM。后续工作探索了将智能体显式分解为专门的规划、执行、验证和生成模块,同时保留一部分可训练组件以提高效率 [chen2025agentflow](https://arxiv.org/html/2607.25090#bib.bib7); [zhang2026agentorchestra](https://arxiv.org/html/2607.25090#bib.bib60); [wan2025rema](https://arxiv.org/html/2607.25090#bib.bib49)。更近期的方法采用了“子智能体即工具”范式,使子模块能够通过双角色和多角色自博弈交互,通过自生成的任务和奖励共同演进 [jiang2025adaptation](https://arxiv.org/html/2607.25090#bib.bib22); [huang2025r](https://arxiv.org/html/2607.25090#bib.bib19); [chen2025multi](https://arxiv.org/html/2607.25090#bib.bib10)。尽管前景广阔,模块化智能体系统在系统复杂性、训练成本和稳定性方面仍面临重大挑战 [cemri2025multi](https://arxiv.org/html/2607.25090#bib.bib5); [zhang2025lazyagent](https://arxiv.org/html/2607.25090#bib.bib62); [yan2025selftalk](https://arxiv.org/html/2607.25090#bib.bib55)。将研究扩展到长周期智能体工作流,我们提出套娃智能体(Matryoshka Agent),一个模块化LLM智能体框架,能够系统地编排端到端解决方案流水线,并在复杂MLE任务上取得强劲性能。

#### 面向MLE的编码智能体

借助LLM编码和推理能力的快速进展 [jain2024livecodebench](https://arxiv.org/html/2607.25090#bib.bib21); [jimenez2023swe](https://arxiv.org/html/2607.25090#bib.bib24),近期工作探索了用于MLE任务的基于LLM的编码智能体。这些努力涵盖了面向ML任务的智能体解决方案 [chan2024mle](https://arxiv.org/html/2607.25090#bib.bib6); [qiang2025mledojo](https://arxiv.org/html/2607.25090#bib.bib40); [qiang2025mlesmith](https://arxiv.org/html/2607.25090#bib.bib41); [tang2023ml](https://arxiv.org/html/2607.25090#bib.bib46); [huang2023mlagentbench](https://arxiv.org/html/2607.25090#bib.bib20)、数据科学问题 [jing2024dsbench](https://arxiv.org/html/2607.25090#bib.bib25); [bendinelli2025exploring](https://arxiv.org/html/2607.25090#bib.bib3); [grosnit2024large](https://arxiv.org/html/2607.25090#bib.bib16) 以及更广泛的ML工作流,如数据预处理、模型选择和超参数调优 [liu2024large](https://arxiv.org/html/2607.25090#bib.bib29); [zhang2023automl](https://arxiv.org/html/2607.25090#bib.bib59); [mohr2018ml](https://arxiv.org/html/2607.25090#bib.bib31)。该领域的先前工作大致可分为智能体脚手架和专门的训练方法。早期的脚手架方法通过预定义的智能体框架构建上下文推理和工具使用,但常常表现出不稳定的提示改进 [auffarth2023generative](https://arxiv.org/html/2607.25090#bib.bib2); [wang2024openhands](https://arxiv.org/html/2607.25090#bib.bib50); [jiang2025aide](https://arxiv.org/html/2607.25090#bib.bib23); [errica2025did](https://arxiv.org/html/2607.25090#bib.bib14) 以及对局部最优解的敏感性 [du2025automlgen](https://arxiv.org/html/2607.25090#bib.bib13)。更近期研究已转向基于LLM的多智能体系统(MAS),其将MLE工作流分解为交互的智能体、工具和记忆,以提高鲁棒性和性能 [li2024autokaggle](https://arxiv.org/html/2607.25090#bib.bib27); [huang2023mlagentbench](https://arxiv.org/html/2607.25090#bib.bib20); [fang2025mlzero](https://arxiv.org/html/2607.25090#bib.bib15)。互补的方法进一步引入了显式探索机制 [ou2025automind](https://arxiv.org/html/2607.25090#bib.bib35); [yang2025r](https://arxiv.org/html/2607.25090#bib.bib57); [du2025automlgen](https://arxiv.org/html/2607.25090#bib.bib13) 或基于学习的优化,特别是强化学习,以直接提升智能体在ML工程任务上的性能 [yang2025reinforcement](https://arxiv.org/html/2607.25090#bib.bib56)。与先前方法不同,套娃智能体(Matryoshka Agent)设计的编排器动态选择优化目标和操作,而非协调固定的智能体角色。通过在线强化学习范式进行优化,这一设计使得在长周期MLE工作流中能够进行有原则的探索和学习。

## 3 方法

### 3.1 问题设定:带可执行反馈的迭代式MLE

我们考虑迭代式机器学习工程(MLE)任务,其进展通过迭代的代码生成、执行、调试和评估来实现。一个任务实例 $x$ 提供自然语言描述、数据集文件、目标指标以及所需的提交格式。在每个回合中,一个可执行的解决方案尝试(通常是以代码形式生成提交文件)由执行环境 $\mathcal{E}$ 进行评估。该环境执行代码、验证提交格式、根据任务特定指标评估生成的预测,并返回一个标量分数。如果执行失败,$\mathcal{E}$ 则返回可用于调试的结构化错误反馈。目标是在有限次解决方案尝试预算内最大化所达到的最佳分数,即 $\max \mathbb{E}[\max_{1\leq t\leq T} r_t]$,其中 $r_t$ 表示第 $t$ 次解决方案尝试获得的分数。

### 3.2 套娃智能体(Matryoshka Agent)框架

套娃智能体是一个层次化框架,将长周期决策制定与低级执行分离。它由三个交互组件构成:一个**编排器**、一组按需生成的**子智能体**,以及一个连接到执行环境的标准化**工具**接口。编排器负责决定下一步应朝着哪个解决方案方向进行优化。

相似文章

OneDayAgent:迈向自主智能体的长时程执行框架

Hugging Face Daily Papers

OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。

Matryoshka归因:学习将语言模型输出归因到表示和权重

arXiv cs.CL

论文介绍了Matryoshka Attribution(MAttr),一种用于将语言模型输出归因到内部组件的掩码学习方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能,并展示了通过调整权重来修改大语言模型行为的实际应用。