长时智能体架构:层级、滴答与级联智能
摘要
本文提出了一种面向长时AI智能体的层级架构,结合了层级、滴答和级联智能,以实现持续运行而无遗忘,并在十天的活动中进行了验证。
arXiv:2609.19519v1 公告类型:新
摘要:语言模型智能体越来越多地被要求执行跨越数天或数周的工作,例如运营修复或研究计划。此类任务超越了任何上下文窗口、任何流程以及任何人可以关注的时间间隔。在本文中,我们论证了长时智能体必须在能够持续学习之前,持续运行而不遗忘。这种能力存在于模型周围的框架中,而非模型本身。我们从长时设置中推导出七个瓶颈,并通过一个三部分的层级架构来回答它们:(i) 按时间尺度索引的层级,每个层级保留一个有界文件以总结下级层级;(ii) 作为自主行动单位的时钟滴答;以及 (iii) 级联智能,其中工作仅在审查失败后才升级到更强大的模型。我们报告了一个十天的活动,其中基于此架构构建的智能体在人类每天参与一次的情况下,重现了一个已发表的强化学习结果,并展示 (1) 智能体在活动的每次上下文重置和会话边界上都保持了线程,(2) 早期写入的操作知识在不改变模型权重的情况下改变了后来的行为,以及 (3) 学习组件在此类系统中的位置。总体而言,我们的经验表明,这些智能体的持续学习需要一个超越每个上下文和流程的载体,而框架已经运行的检查正是学习者应归属之处。
查看缓存全文
缓存时间: 2026/09/18 09:19
# 长期智能体架构:层级、时钟与级联智能 来源:https://arxiv.org/html/2609.19519 ###### 摘要 语言模型智能体越来越多地被要求执行跨越数天或数周的工作,例如运营修复或研究项目。这类任务的生命周期超越了任何上下文窗口、任何处理流程以及人类可介入的任何时间间隔。本文认为,长期智能体必须在持续运行中实现不遗忘,才能在此基础上持续学习。这种能力并非源于模型本身,而是围绕模型的框架系统所赋予。我们从长期应用场景中提炼出七个瓶颈问题,并提出了一个由三部分组成的分层架构来解决这些问题:(i) 按时间尺度索引的层级结构,每个层级维护一个有界文件,用于总结下一层级的信息;(ii) 以时钟驱动的时钟作为自主行动的基本单元;(iii) 级联智能,即工作仅在未通过审核时才升级至更强大的模型。我们报告了一项为期十天的实验,其中基于该架构的智能体在人工每日仅参与一次的情况下,成功复现了一项已发表的强化学习成果。实验表明:(1) 该智能体在活动中每一次上下文重置和会话边界都保持了任务连贯性;(2) 早期记录的操作知识在未改变模型权重的情况下改变了后期行为;(3) 学习型组件可嵌入此类系统的潜在位置。总体而言,我们的经验表明,这些智能体的持续学习需要一个超越所有上下文和进程的基础载体,而框架系统已运行的检查机制正是学习者应介入之处。 ## 1 引言:超越单次交互的智能体 语言模型智能体现在能够执行软件工程、研究和运维中的多步骤任务(Yao等, 2022 (https://arxiv.org/html/2609.19519#bib.bib22); Wang等, 2025 (https://arxiv.org/html/2609.19519#bib.bib19)),其可维持的任务时间尺度在两年内从分钟级增长到小时级(Kwa等, 2025 (https://arxiv.org/html/2609.19519#bib.bib11); Wijk等, 2024 (https://arxiv.org/html/2609.19519#bib.bib21))。然而,已部署的智能体仍然在单次交互周期内运作:一个上下文窗口结束后即停止,而主动权、跨周期记忆以及启动下一次交互的任务,都留给了发起任务的人类。企业级工作并不具备这种形态:一次运营修复可能持续超过发起它的换班时段,一项合规调查可能运行一周,一个研究项目可能持续数月。更长的上下文和更强大的模型只是将交互边界向外推移,并未消除它:上下文压缩会悄然消除状态和约束(Chen, 2026 (https://arxiv.org/html/2609.19519#bib.bib5)),随着任务跨度增加智能体会偏离目标(Arike等, 2025 (https://arxiv.org/html/2609.19519#bib.bib1); Wang等, 2026 (https://arxiv.org/html/2609.19519#bib.bib20)),而且无论上下文窗口多长,整个任务活动的跨度总是更长。 先前的研究解决了该问题的部分方面。记忆架构决定了智能体跨会话记取什么(Packer等, 2023 (https://arxiv.org/html/2609.19519#bib.bib14); Park等, 2023 (https://arxiv.org/html/2609.19519#bib.bib15); Hu等, 2025 (https://arxiv.org/html/2609.19519#bib.bib9));分层智能体将长任务分解为子目标(Sutton等, 1999 (https://arxiv.org/html/2609.19519#bib.bib17); Jin等, 2026 (https://arxiv.org/html/2609.19519#bib.bib10));模型级联根据出错成本将工作路由给更强的模型(Fanconi与van der Schaar, 2025 (https://arxiv.org/html/2609.19519#bib.bib6); Bouchard, 2026 (https://arxiv.org/html/2609.19519#bib.bib2));自主研究智能体则端到端地运行整个项目(Lu等, 2024 (https://arxiv.org/html/2609.19519#bib.bib13); Gaddipati等, 2026 (https://arxiv.org/html/2609.19519#bib.bib7))。这些方案都存在于单一的上下文或进程中;持久化执行(Candea与Fox, 2003 (https://arxiv.org/html/2609.19519#bib.bib3))虽然超越了单个进程的生命周期,但缺乏关于保留什么内容的概念。它们均未指明当上下文、进程和人类注意力各自结束时,哪些内容必须存活下来;这个缺口是架构层面的。 在本文中,我们认为长期智能体的持续学习建立在一个先决属性之上:无遗忘的持续运行。此属性属于框架系统——决定模型何时运行、读取什么以及可执行什么的周围系统。对智能体失败案例的研究(Cemri等, 2025 (https://arxiv.org/html/2609.19519#bib.bib4); Raj等, 2026 (https://arxiv.org/html/2609.19519#bib.bib16))将许多问题追溯至此层面,而非模型本身。基于一个前提——智能体超越任何上下文、进程或人类注意力间隔而存在,我们推导出七个瓶颈问题,并提出一个分层架构来回应它们。一个基于该架构构建的智能体运行了十天,并复现了一项已发表的成果(Hou等, 2026 (https://arxiv.org/html/2609.19519#bib.bib8));它没有更新任何权重,但早期记录的内容改变了其后期行为。我们做出三点贡献: 1. 1. 特征化——从长期前提推导出的七个瓶颈问题(§2 (https://arxiv.org/html/2609.19519#S2))。 2. 2. 架构——四个抽象概念(层级、时钟、协议、智能层)回应了这些瓶颈问题,并实现了无遗忘运行、积累以及学习者介入点(§3 (https://arxiv.org/html/2609.19519#S3), §5 (https://arxiv.org/html/2609.19519#S5))。 3. 3. 经验——智能体在十天内自主复现了一项已发表的强化学习成果,跨越了两百多次时钟周期和约二十几次对人类的升级请求(§4 (https://arxiv.org/html/2609.19519#S4))。 ## 2 场景:从一个前提推导出七个瓶颈 本节中,我们将智能体置于两个轴线上——自主性和任务跨度(图1 (https://arxiv.org/html/2609.19519#S2.F1)),并推导出当两者都较高时出现的七个瓶颈。每个瓶颈都成为第3节(https://arxiv.org/html/2609.19519#S3)所述架构的一项要求。 #### 两个轴线。 *自主性*是指智能体在没有人类参与的情况下做出的决策比例:在高端,*主动*智能体持有目标,决定何时以及如何行动,并持续运行直至目标达成或受约束停止;而*被动*主导者则设定目标、读取报告并响应升级请求。*任务跨度*HH是指智能体为达成目标必须维持的轨迹长度,可用动作数、令牌数或固定动作速率下的墙钟时间衡量。 自主性长期智能体任务跨度HH:轨迹长度(动作、令牌或墙钟时间)自主性:谁提供主动权、委派和检查人类智能体上下文窗口CC进程生命周期PP人类注意力间隔AA故障间隔FF顶层成本自主性:主动权从人类转向智能体跨度抽象层级结构状态文件作为记忆,恢复委派简报、指导、升级弹性看门狗,惰性探针成本级联智能智能体单次交互重新提示,总结重启,重新解释编排,决策发现,修复支付,或停止单次交互助手人类驱动的项目正确性:无人检查步骤,错误累积,压缩隐藏它们推动跨度:一个资源接一个耗尽推动自主性:人类停止提供 图1:长期场景。沿跨度轴的每个阈值对应一个资源耗尽点;沿自主性轴的问题是当资源耗尽时,功能由谁提供。线下由人类提供;线上则由架构必须提供,每列标注了它必须回应的瓶颈。 #### 阈值。 使该场景不同的不是HH的大小,而是轨迹沿途跨越了什么。在跨度轴线上有四个量:单次模型调用的上下文窗口CC,单个进程或会话的生命周期PP,主导者的注意力间隔AA,以及智能体所依赖的任何组件的故障间隔FF。每个量在企业场景中都有对应:一个工单可能比发起它的对话存续更久,一个作业可能比其容器运行更久,一个决策可能等待管理者批准,一个系统可能在活动期间故障。在高自主性下,无人吸收跨越的后果,每个阈值都成为对架构的要求。 #### 正确性和成本。 另外两个瓶颈随两个轴线共同增长。*正确性*:自主性移除了原本会检查步骤的人,而跨度使任何未经检查的错误不断累积,同时压缩又将证据从视野中移除。*成本*:在最强大模型层上的花费以速率c_top随HH增长,预算BB对其进行上限约束,因此在顶层成本下可负担的跨度为B/c_top,将工作级联至更廉价的层级可将此上限外推。 #### 七个瓶颈。 我们研究的场景是C、P、A、F ≪ H,处于高自主性且预算在BB内,由此产生七个瓶颈:四个来自阈值——自主性(A ≪ H)、跨度(C ≪ H)、状态(P ≪ H)和弹性(F ≪ H);一个来自规模——委派(工作超出单个进程);正确性和成本则来自两个轴线。附录表2(https://arxiv.org/html/2609.19519#A1.T2)推导了每项要求。 ## 3 架构:层级、时钟、协议与智能层 ### 3.1 四个抽象概念及其关系 该架构基于四个抽象概念。*层级*是按其操作时间尺度索引的系统层;它维护一个有界状态,总结下一层级的信息,并向其发布稀疏指令。*时钟*是在判断所在层级进行自主行动的单元:即*驱动器*(运行循环的判断层会话)的一次唤醒,从读取状态到写回状态。*协议*是一个具名文件,指定了写入者、读取者、节奏和检查;每个通信通道和每片持久化状态都是一个协议。存在三个*智能*层:判断层、劳力层(常规或强力;其会话是*工作者*)和确定性进程层。智能层随层级上升。图2(https://arxiv.org/html/2609.19519#S3.F2)展示了由此产生的层级以及每个层级维护的文件。 L0 工具调用秒级原始日志、追踪、指标L1 劳力回合分钟级会话日志;每次试验进度L2 指导30-60分钟指令:评估,下一次试验L3 时钟∼1小时检查点≤8k字符;日志L4 关卡审查5个时钟/关卡审查备忘录;关卡裁决L5 人类日1天每日报告≤1,500字符L6 目标1周目标、规范、预算时间尺度层级维护的状态(有界)下上 图2:时间层级结构:从秒级工具调用到周级目标的七个层级。每个层级维护一个有界文件,压缩下一层级的信息。指令向下传递;摘要、升级项和注意力事项向上传递。工作者和进程在L0-L1层行动,判断层在L2-L4层行动,主导者在L5-L6层行动。 七个瓶颈命名了一个对象——层级的七个属性:时间尺度与压缩比(跨度)、有界文件(状态)、特定智能层的执行者(成本)、到邻居的通道(委派)、触发器(自主性)、对下一层级的验证(正确性),以及上一层级带有检测器的故障模式(弹性)。向下的通道携带*指导*(发送者节奏的稀疏指令);向上的通道携带*反压*(压缩状态加升级线路、监控器提出的注意力事项)以及终止裁决——唯一未经压缩跨越边界的消息,因为压缩会隐藏它们。时钟是所有七个属性交汇之处。 ### 3.2 七种机制家族 #### 自主性。 主动性必须被制造。时钟启动一个新的驱动器会话,然后休眠驱动器退出前写入的间隔时间;时钟读取状态,应用所有预注册规则,做出决策,执行行动并写回状态;钩子拒绝在时钟层状态文件(检查点)写入前结束会话。主导者的答案作为*常驻决策*保存,在每次唤醒时读取,从而使智能体在主导者缺席时仍能继续运作。 #### 跨度。 数天的跨度通过按时间尺度索引的抽象来处理:每个层级看到下一层级的有界压缩,并按自身的节奏行动;驱动器从不读取原始输出。规则是硬性的:任何日志或源代码最多显示四十行;其余部分被委派并总结。 #### 状态。 任何内容都不能仅存在于上下文中。每个层级的状态是一个文件,有界以便上一层级能够负担读取,原地重写以描述当前状态,每个数字都标明其来源文件。恢复协议在每次会话开始以及驱动器上下文每次压缩后运行:先检查点,然后是常驻决策、计划、未决事项和活动实验卡;如果追加日志比检查点更新,则以日志为准。 #### 委派。 工作以合同形式向下传递,返回时附带证据;决策向上传递,最终到达主导者。*简报*是一个文件:任务、目标、智能层、要读取的文件、约束、需返回的内容。对于开放式工作,*受指导的劳力*增加两个文件:工作者在每次试验前后编写*进度*,驱动器按指导节奏编写*指令*,说明数据支持哪个假设以及下一步尝试什么,工作者在每次行动前重新读取。决策沿阶梯攀升,每级有明确的触发条件:常规劳力、驱动器自身的评估、强力层会话、主导者(仅针对特定类别的决策)。 #### 正确性。 若未经预注册、测量并放置在结果不会丢失之处,智能体的调优将是盲目的。每个实验卡都包含假设、成功标准、早停规则、资源上限和种子,驱动器在每个时钟应用该规则,因此终止裁决是摘要中的一个位。只有当运行的*环境条件*被测量而非请求时,该运行才被视为可比较的,例如实际数据陈旧度。*对抗性审查员*——一个没有对话历史的判断层会话,在每个*关卡*(计算或声明之前的预注册检查)读取计划和证据:哪些混淆是开放的,代理指标是否衡量了声明,以及终止什么。 #### 弹性。 每个组件在数日内至少会失败一次,包括智能体自身的会话,因此恢复不能依赖注意力。每个层级在上一层级有一个检测器和无需判断的恢复机制:停滞的工作者会收到新的简报,死亡的驱动器从检查点恢复,并在看门狗监控下运行(看门狗在重复重启后停止),探针作为其观察的任务步骤运行,而非登录会话。 简报每简报的智能层常规层执行审查高一级通过接受结果,提交强力层诊断,重试审查主导者特定决策通过失败一次:反馈,重试失败再次:提升一层反馈,重试失败再次,或非智能体职责 图3:带审查升级的级联智能:工作在最低可行层级运行,并在高一层级接受审查;失败返回反馈进行重试,第二次失败提升一层,直至主导者。 #### 成本。 最强大的模型仅处理最压缩的状态;在层级间移动工作的规则是*审查与升级*(图3 (https://arxiv.org/html/2609.19519#S3.F3)):工作在最低可行层级完成,在高一层级审查,失败则返回反馈,仅在再次失败时才提升一层。强力层的分配基于出错成本而非任务规模,且该阶梯是对称的:一旦强力层找到了方法,后续工作以该方法为简报在常规层运行。会话每几个时钟轮换一次,以便新会话读取简短的检查点,且确定性时钟前摘要在无待办事项时跳过唤醒(Liu等, 2026 (https://arxiv.org/html/2609.19519#bib.bib12), 比较)。 ### 3.3 操作
相似文章
关于长期代理的思考
作者讨论了从将自助入职重建为代理流程中获得的见解,强调了将确定性任务管理与非确定性LLM操作相结合的长期代理如何提高企业AI部署的可靠性并减少幻觉。
如何让代理运行数小时,以及哪些架构真正对代理友好?#深度探讨 #氛围程序员问题
作者探讨了AI编码代理的两个关键挑战:确保长时间自主执行(数小时)以及为本地应用设计对代理友好的架构。他们提出在规划和执行之前,增加一个显式的知识组织阶段来管理混乱的上下文。
OneDayAgent:迈向自主智能体的长时程执行框架
OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。
超越最终分数:长期AI研发智能体的系统性评估
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?
AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。