ADIAS:交互式智能体系统的自动化设计
摘要
ADIAS 是一个用于智能体系统自动化设计的框架,采用以问题为中心的优化方式,在修复轮次之间维护持久的问题状态。在五个交互式基准测试中,其平均性能比最强基线高出 25.2%,并在四种骨干模型上表现出持续提升。
arXiv:2608.06410v1 公告类型:新
摘要:自动化智能体设计通过迭代修订、评估和反馈总结来改进智能体框架。现有方法大多以候选者为中心:跨轮次经验围绕候选智能体组织,这使得修复进展隐含不清。这导致修复目标定位效率低下、部分进展整合缓慢,以及无效干预在轮次间传播。因此,我们提出以问题为中心的智能体优化,在这种优化中,修复进展作为显式的持久问题状态被携带前行以指导优化,而不是每轮从候选者历史中重新推导。我们将这一公式实例化为 ADIAS,一个具有两种机制的自动化全代码智能体设计框架。持久问题状态维护稳定的问题标识、生命周期状态、支持证据和干预-结果历史。问题引导的优化利用该状态联合提出修复目标和修订方向,用于后续有针对性的全代码修改。在五个交互式基准测试中,ADIAS 的平均性能比最强基线高出 25.2%,并在四种骨干模型上取得了一致的提升。受控消融实验进一步表明,移除持久问题状态或以候选者为中心的策略替代以问题为中心的修订会导致性能下降高达 40.7%。
查看缓存全文
缓存时间: 2026/08/10 07:58
# ADIAS:交互式智能体系统的自动化设计
来源:https://arxiv.org/html/2608.06410
Lekang Jiang
University of Cambridge
lj408@cam\.ac\.uk
&Bohan Tang∗
LIGHTSPEED
bohantang@global\.tencent\.com
&Stephan Goetz
University of Cambridge
smg84@cam\.ac\.uk
&Yiwen Guo
Independent Researcher
guoyiwen89@gmail\.com
###### 摘要
自动化智能体设计通过迭代修订、评估和反馈总结来改进智能体框架。现有方法大多以候选者为中心:跨轮次的经验围绕候选智能体组织,这使得修复进展变得隐式。这会导致修复目标定位低效、部分进展难以快速整合,以及无效干预在多轮迭代中的传播。因此,我们提出**以问题为中心(issue-centric)的智能体优化**,在这种方法中,修复进展以显式的持久化问题状态被携带到后续优化中,而不是每轮都从候选者历史中重新推导。我们将这一形式化方法实例化为**ADIAS**,一个用于自动化全代码智能体设计的框架,包含两种机制。持久化问题状态维护稳定的问题身份、生命周期状态、支持性证据和干预-结果历史。问题引导的优化利用该状态,联合提出后续聚焦式全代码修改的修复目标和修订方向。在五个交互式基准上,ADIAS平均超越最强基线25.2%,并在四个骨干模型上取得一致的性能提升。受控消融实验进一步表明,移除持久化问题状态或将问题中心化修订替换为候选者中心化策略,会导致性能下降高达40.7%。¹¹¹代码可在https://github.com/scylj1/adias/获取。
## 1 引言
大型语言模型(LLMs)越来越多地通过智能体系统进行部署,这些系统为骨干模型增加了规划、记忆、工具使用等机制(Huang et al., 2024 (https://arxiv.org/html/2608.06410#bib.bib10); Wang et al., 2024a (https://arxiv.org/html/2608.06410#bib.bib32))。这些机制共同构成了一个智能体框架(agent harness),用于协调模型与环境的交互(Weng, 2026 (https://arxiv.org/html/2608.06410#bib.bib38); Wang et al., 2026a (https://arxiv.org/html/2608.06410#bib.bib33))。由于有效的框架依赖具体任务,且人工设计劳动密集,近期工作转向了**自动化智能体设计**,即利用执行反馈自动生成和改进智能体系统(Madžar & Mekterović, 2026 (https://arxiv.org/html/2608.06410#bib.bib20); Gao et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib6); Yue et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib46); Ning et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib23))。
自动化智能体设计通常遵循迭代的**修订-评估-总结**循环。在每一轮中,优化器修订智能体设计以解决先前评估揭示的问题,评估生成的候选以获取得分和轨迹,并将这些结果总结成跨轮次历史以用于后续修订(Hu et al., 2025 (https://arxiv.org/html/2608.06410#bib.bib9); Zhang et al., 2025b (https://arxiv.org/html/2608.06410#bib.bib49); Lee et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib13); Lin et al., 2026a (https://arxiv.org/html/2608.06410#bib.bib16); Chen et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib3); Zhang et al., 2026a (https://arxiv.org/html/2608.06410#bib.bib50))。现有方法可以被描述为**以候选者为中心的智能体优化**:跨轮次经验围绕候选智能体组织,每轮的目标是提出一个更高质量的下一候选智能体。例如,在每一轮中,Meta-Harness基于先前智能体的代码、得分和原始执行轨迹生成新候选(Lee et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib13)),而HarnessX则总结执行证据以提出新修订,从而获得更优的候选智能体(Chen et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib3))。尽管这些方法可能保留丰富的行为证据和优化经验,但它们并未显式维护持久化问题的生命周期和修复进展作为优化状态。然而,围绕候选者组织跨轮次经验会使修复进展变得隐式,从而导致三个局限。首先,**修复目标定位低效**:关于问题是否仍未解决、应修改哪些方面以及哪些干预已被尝试的证据分散在候选记录中。优化器必须在每次修订前重新构建这一修复上下文,常常导致宽泛、冗余或错位的修改。其次,**修复进展整合碎片化**:因为每个候选者可能影响多个问题且被整体评估,特定干预的结果难以被隔离,而同一问题上的互补进展则分散在不同候选者中。第三,**退步性干预传播**:因为干预及其结果在候选者层面记录,有益和有害的变化纠缠在一起,使得一些无效干预被带入后续轮次。
参见图注
图1:候选者中心化智能体优化与问题中心化优化的比较。
为了解决这些局限,我们引入**以问题为中心的智能体优化**,它将跨轮次经验围绕持久化问题而非候选智能体组织。评估结果和总结反馈被累积到一个持久化问题状态中,该状态显式记录每个问题的当前状态、支持性证据和干预历史。该状态直接指导下一轮的修复目标和修订方向,从而能够做出更聚焦的修复决策、整合跨轮次的部分进展,并避免先前无效的干预。图1 (https://arxiv.org/html/2608.06410#S1.F1) 将这一范式与候选者中心化智能体优化进行了对比。
实现以问题为中心的智能体优化面临两个关键挑战。首先,**可靠的问题状态维护**需要将异构的执行轨迹和稀疏的结果转化为稳定、有证据支撑的问题身份,同时将新观察与历史记录相协调,并跟踪每个问题跨轮次的修复进展。同一个根本问题在不同候选者中可能有不同表现,而单次修订可能同时改进某些行为并使其他行为回退,这使得身份关联和结果归因都变得复杂。其次,**可操作且可归因的修订**需要将动态、多问题且主要处于描述性状态的信息转化为具体的代码修改。必须根据问题的当前证据和先前的干预历史联合确定目标问题和修订方向,且所得到的修改必须保持足够的聚焦性,以便后续行为结果可以归因于计划中的修复。
为应对这些挑战,我们提出**ADIAS**(交互式智能体系统的自动化设计),一个以问题为中心的智能体优化框架,包含两种机制。首先,**持久化问题状态**将新诊断出的失败与稳定的问题身份关联起来,并跟踪其支持性证据、生命周期转换和干预-结果历史。该结构在跨轮次整合异构失败模式的同时,将目标问题的结果与其他问题上的改进或回退分开跟踪。其次,**问题引导的优化**从当前状态中联合选择目标问题和修订方向,并通过聚焦式全代码修改实现该计划。联合规划使描述性问题状态对代码改进具有可操作性,而聚焦式修订则在不限制智能体设计空间的前提下,提高后续行为结果的可归因性。
我们的主要贡献包括:
∙ 我们引入**以问题为中心的智能体优化**,这是一种新范式,将跨轮次经验围绕持久化问题组织,并使用显式问题状态指导优化。
∙ 我们将该范式实例化为**ADIAS**,一个全代码智能体设计框架,将用于维护跨轮次修复进展的持久化问题状态与用于提出和执行聚焦修订的问题引导优化相结合。
∙ 我们证明,在五个交互式基准上,ADIAS平均超越最强基线25.2%,并在四个骨干模型上表现出持续提升。受控消融进一步说明了以问题为中心的优化的重要性:移除持久化问题状态或将问题引导修订替换为候选者中心化策略,会导致性能下降高达40.7%。
## 2 相关工作
近期工作越来越多地从手动设计智能体系统转向根据执行反馈自动改进系统(Madžar & Mekterović, 2026 (https://arxiv.org/html/2608.06410#bib.bib20); Gao et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib6); Yue et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib46); Ning et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib23))。我们沿两个维度回顾相关文献:被优化产物的表达能力,以及为跨轮次协调改进而保留的信息。
### 自动化智能体设计
先前的工作在不断提高的表达层级上实现智能体设计的自动化。提示层面的方法优化指令或文本模块(Zhou et al., 2022 (https://arxiv.org/html/2608.06410#bib.bib55); Pryzant et al., 2023 (https://arxiv.org/html/2608.06410#bib.bib26); Yang et al., 2024 (https://arxiv.org/html/2608.06410#bib.bib39); Agrawal et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib1); Khattab et al., 2024 (https://arxiv.org/html/2608.06410#bib.bib12))。架构层面的方法在预定义工作流、模块组合或结构化框架原语上进行搜索(Li et al., 2024 (https://arxiv.org/html/2608.06410#bib.bib15); Zhang et al., 2025c (https://arxiv.org/html/2608.06410#bib.bib51); Zhuge et al., 2024 (https://arxiv.org/html/2608.06410#bib.bib56); Shang et al., 2025 (https://arxiv.org/html/2608.06410#bib.bib28); Chen et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib3))。全代码方法直接生成或修改可执行的智能体实现,使用迭代档案、进化探索、自我修改或测试时反馈(Hu et al., 2025 (https://arxiv.org/html/2608.06410#bib.bib9); Zhang et al., 2025b (https://arxiv.org/html/2608.06410#bib.bib49); Wang et al., 2025 (https://arxiv.org/html/2608.06410#bib.bib35); Lee et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib13); Lou et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib19); Cai et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib2); Nie et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib22))。ADIAS在全代码层面运行,但在搜索状态控制上有所不同。
### 经验与可复用知识
一系列工作通过累积可复用经验来改进智能体。反思和经验学习方法保留从先前轨迹中提取的经验教训或启发式规则,而ACE和SkillOpt等系统则维护可编辑的剧本或技能文档(Shinn et al., 2023 (https://arxiv.org/html/2608.06410#bib.bib29); Zhao et al., 2024 (https://arxiv.org/html/2608.06410#bib.bib54); Zhang et al., 2026c (https://arxiv.org/html/2608.06410#bib.bib53); Yang et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib40))。其他方法则在迭代之间持久化并演化结构化知识、工作流、工具或验证产物(Lin et al., 2026b (https://arxiv.org/html/2608.06410#bib.bib17); Huang et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib11); Lin et al., 2026a (https://arxiv.org/html/2608.06410#bib.bib16); Wang et al., 2026a (https://arxiv.org/html/2608.06410#bib.bib33))。这些方法展示了携带跨轮次信息的价值。然而,其持久化对象主要是可复用知识或可编辑的智能体产物。ADIAS则维护那些促使编辑的问题本身的演化状态,包括其状态、证据和干预历史。
### 持续与回退感知的智能体改进
近期工作表明,迭代式智能体改进不一定是单调的。持续适配可能在工作流、技能、记忆和模型演化方面使先前获得的能力退化(Yu et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib45))。GRASP(Moll et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib21))对有界技能库的编辑应用回退感知的接受策略,而SKILL.nb(Hattami et al., 2026 (https://arxiv.org/html/2608.06410#bib.bib8))使用生命周期治理和验证门控来提高可复用工作流的持久性。这些方法主要控制更新后的技能或工作流产物是否应被保留。ADIAS解决的是另一个但互补的问题:在全代码智能体演化过程中,维护修复目标本身的连续性。
## 3 方法
### 3.1 任务定义与候选者中心化优化
**任务定义**。我们研究固定任务环境、评估器和骨干模型下交互式智能体的自动化设计,所有这些都与智能体设计工作区隔离。设\(A\in\mathcal{A}\)表示合法全代码设计空间\(\mathcal{A}\)中的一个可执行智能体实现。对来自划分\(q\in\{\mathrm{train},\mathrm{val},\mathrm{test}\}\)的实例\(x\sim P_{q}\)执行\(A\)会生成轨迹\(\mathcal{T}(A,x)=(z_{1},\ldots,z_{L})\),其中\(z_{h}=(o_{h},a_{h},o_{h+1},r_{h},d_{h})\)记录交互步骤\(h\)处的观察\(o_{h}\)、动作\(a_{h}\)、环境响应\(o_{h+1}\)、任务得分\(r_{h}\)和终止指示符\(d_{h}\)。任务反馈通常是稀疏的:中间奖励往往不具信息量,而最终任务结果通常是二元的,\(1\)表示成功完成,\(0\)表示失败。我们用\(M_{q}(A)\)表示智能体\(A\)在划分\(q\in\{\mathrm{train},\mathrm{val},\mathrm{test}\}\)上的总体性能。从初始实现\(A_{0}\)和\(T\)轮优化预算开始,设计系统在每轮\(t=1,\ldots,T\)生成新候选\(A_{t}\)并评估其验证性能\(M_{\mathrm{val}}(A_{t})\)。随后,诊断过程分析训练轨迹和性能,生成诊断报告\(D_{t}\),总结观察到的失败和与优化相关的经验,供后续轮次使用。\(T\)轮之后,系统从集合\(\{A_{0},\ldots,A_{T}\}\)中选择验证性能最高的候选者,并在留出测试集上评估其性能。目标是实现高测试性能\(M_{\mathrm{test}}\)(Wang et al., 2026b (https://arxiv.org/html/2608.06410#bib.bib37))。
**候选者中心化优化**。大多数现有方法维护一个优化历史\(H_{t}\),其中包含到第\(t\)轮为止生成的候选智能体\(A\)及其轨迹\(\mathcal{T}\)、性能指标\(M\)和诊断报告\(D\)。在每一轮中,优化器重新解释这一围绕候选者组织的历史,以提出下一个候选者:
\(A_{t+1}=\arg\max_{A\in\operatorname{Propose}(H_{t})}J_{相似文章
# 先规划,再判断,跑得更好:一个受DMAIC启发的工业异常检测智能体系统
DMAIC-IAD 是一个多智能体大语言模型系统,其设计灵感来源于 DMAIC 质量管理框架,专为工业异常检测而构建。该系统采用"先规划、后判断"的方法,通过标准化操作流程制定检测策略,并利用无需执行的裁判模型对策略进行排序,在四种数据模态上相较于智能体基线实现了 37.76% 的性能提升。
ADE
ADE 是一个免费的、同步的开发环境,用于编码代理。
AutoDesign:面向长周期智能体设计的元Harness优化
AutoDesign 引入了一种元Harness优化器,能够递归改进代码智能体,以完成长周期结构化媒体生成任务,在论文到海报合成任务上取得了最先进的结果,并在新的 PosterBench 基准上超越了 Claude Design 等商业系统。
# 数字学徒:人类主导的智能体AI开发框架
本文介绍了"数字学徒"(Digital Apprentice)框架——一个可扩展且安全的智能体 AI 体系,其中自主权通过观察学习、人工授权和持续对齐校正的方式逐步获得。本文还介绍了 ADAPT,一种推理时控制平面,用于将渐进式自主权等级付诸实践,并将人工校正转化为可复用的偏好数据。
Adaptive Auto-Harness: 在开放式任务流上实现智能体系统部署的持续自我改进
Adaptive Auto-Harness 是一个框架,用于在开放式任务流上部署的智能体系统的持续自我改进,通过状态性多智能体进化器、harness树和人工引导钩子超越基线。