针对关键任务基础设施运营中LLM Agent的任务感知型Harness配置
摘要
本文提出了一种针对关键任务基础设施运营中LLM Agent的任务感知型Harness配置方法,该方法在液体冷却任务中提高了精度并减少了token使用,同时识别了依赖于领域的精度-成本权衡。
arXiv:2608.17433v1 公告类型:新
摘要:LLM Agent已被广泛用于运营关键任务基础设施 (MCI)。这些Agent通常依赖于一个Harness,该Harness决定了它们可以访问哪些信息、使用哪些工具以及采取哪些行动。现有系统常常向每个任务暴露相同的全面Harness,这可能并非必要,并导致资源浪费。在本文中,我们专注于识别最优的Harness配置,并将其视为每个任务所需与Harness所提供之间的资源匹配问题。为了衡量这种匹配,我们基于底层系统的数学表示对MCI任务进行分类,并根据Harness配置提供的信息数量和类型对其进行排名。然后,我们从两个来源构建任务到Harness的映射:挖掘研究文献和测量受控Agent执行。利用测量到的映射,我们提出了一种新的Harness配置算法:映射引导的逐步升级。它从一个特定于任务的Harness开始,仅在自检失败后才扩展到全面配置。我们在两个代表性的MCI任务中评估我们的方法:在液体冷却中,它将Agent精度从全面配置下的0.652提高到0.715,并在减少48% token的情况下达到了与Reflexion相当的精度;在电网中,全面配置仍然是精度最优的,而基于映射的配置提供了更低成本的替代方案。这些发现表明,Harness配置遵循依赖于领域的精度-成本帕累托前沿,而非普遍最优。
查看缓存全文
缓存时间: 2026/08/19 10:02
# 面向关键基础设施运营中LLM代理的感知任务资源调度 来源:https://arxiv.org/html/2608.17433 ## 面向关键基础设施运营中LLM代理的感知任务资源调度 CCS: 计算方法学 智能代理 CCS: 应用计算 物理科学与工程 CCS: 计算方法学 仿真评估 林良涛, 张庆刚 单位:新加坡南洋理工大学 邮箱:[[email protected]](mailto:[email protected]) 朱兆盟 单位:新加坡南洋理工大学 邮箱:[[email protected]](mailto:[email protected]) 张天伟 单位:新加坡南洋理工大学 邮箱:[[email protected]](mailto:[email protected]) 文勇刚 单位:新加坡南洋理工大学 邮箱:[[email protected]](mailto:[email protected]) © 无 ###### 摘要 LLM代理已被广泛用于运营关键基础设施(MCI)。这些代理通常依赖于一个**资源调度层**,该层决定了它们可以访问哪些信息、使用哪些工具以及执行哪些操作。现有系统通常向每个任务暴露相同的综合资源调度,这可能并非必要并导致资源浪费。在本文中,我们专注于识别最优的资源调度配置,并将其视为任务需求与资源调度供给之间的资源匹配问题。为了衡量这种匹配度,我们基于底层系统的数学表示对MCI任务进行分类,并根据资源调度层提供的信息量和类型对其配置进行排序。然后,我们从两个来源构建任务到资源调度的映射:挖掘研究文献和测量受控代理执行。利用测得的映射,我们提出了一种新的资源调度算法:**映射引导升级**。它始于一个特定于任务的资源调度,并在自检失败后才扩展到完整的资源供应。我们在两个代表性的MCI任务中评估了我们的方法:在液冷任务中,它将代理准确度从完整供应下的0.652提高到0.715,并在使用少48%令牌的情况下达到了与Reflexion相当的准确度;在电网任务中,完整供应仍是最优准确度的,而基于映射的供应提供了成本更低的选择。这些发现表明,资源调度遵循依赖于领域的精度-成本帕累托前沿,而非普适的最优解。 ## 1. 引言 关键基础设施(MCI),包括信息技术、电力和水务系统,由其受损或破坏可能严重影响安全、经济、公共卫生或公共安全的系统和资产组成。这些系统的运营和维护(O&M)需要持续监控、故障诊断、未来状态预测、维护规划和控制。最近的研究探索了用于云运营和工业资产管理的LLM代理。为了执行这些任务,代理依赖于一个提供任务相关信息、工具和系统访问权限的**资源调度层**。因此,为每个给定任务配置最优的资源调度层至关重要。我们将其框架化为一个资源匹配问题:资源调度层决定了代理可用的信息和能力,而每个任务对其可靠执行施加了自身的要求。最简单的一刀切资源调度策略——向每个任务提供相同配置——已受到质疑。更先进的解决方案被提出,例如通过检索与当前任务相关的资源来调整资源调度,根据预定义规则授予访问权限,或允许代理决定其需要哪些资源。然而,这些方法通常推断什么可能有用,而不是衡量什么是真正足够的。在MCI O&M中,供应不仅要平衡任务成功,还要平衡经济性(包括令牌使用、延迟和计算)以及通过限制不必要的数据暴露来确保信息安全。供应过少可能无法可靠执行,而过度供应会增加成本和暴露风险。这激发了我们的核心问题:我们能否确定给定任务可靠执行所需的最小资源调度层?我们假设每个任务类别都有一个特征性的资源调度需求,并寻求识别它们之间的映射,我们称之为**任务到资源调度的映射**。为此,我们首先需要两个可比较的表示:一个用于任务需求,一个用于资源调度供应。MCI O&M任务通常使用检测、诊断和预测等标签来描述,但这些标签在不同领域和研究中缺乏一致的定义,并未系统地涵盖整个任务空间。因此,我们从底层物理系统的数学表示中推导出一个新的任务分类法,产生具有明确且可区分边界的类别。在供应方面,我们根据提供给代理的系统信息量和类型,单独定义了一个累积的资源调度层次结构。这些表示共同提供了任务类型和资源供应的两个结构化空间。我们提出两种互补的策略来识别任务到资源调度的映射。首先,我们检查它是否已在先前的MCI O&M研究中隐含。我们收集并分析了过去十年发表的1200多篇论文,发现了一个清晰的模式:涉及未来结果、潜在状态或干预措施的任务往往使用更广泛的资源调度资源。其次,为了验证这种文献推导的模式是否反映了实际的代理需求,我们在两个MCI案例(液冷和电网)中进行了受控执行实验。我们构建了基于仿真的代理环境,具有多个资源调度层级和一个包含240个经过验证任务的基准。执行结果部分符合文献推导的模式,但也揭示了领域特定的差异。在液冷中,多个任务类别在完整供应以下实现最佳性能,同时使用更少的令牌和更短的时间,表明最全面的资源调度并不总是最优的。通过任务到资源调度的映射,MCI代理可以根据每个原子任务的类型和估计需求来供应资源。最简单的解决方案是从文献推导或执行推导的映射中直接检索相应的资源调度层级,无需额外的路由调用。为了考虑同一类别内任务之间的差异,我们进一步提出了**映射引导升级**策略:代理从执行推导的供应开始,仅当初始执行未能通过自检时才使用完整资源调度重试。在保留任务上,执行映射查找的性能与经验增强的LLM路由相当,同时比完整供应少用14%和12%的令牌。在液冷中,映射引导升级将准确度从完整供应下的0.652提高到0.715。它还达到了与Reflexion相当的准确度,这是一种迭代方法,利用对任务反馈的言语自我反思来改进后续尝试,同时少用48%的令牌。在电网领域,完整供应仍然是最优准确度的,而执行映射查找提供了成本更低的运行点。总体而言,这些结果揭示了执行精度与资源成本之间依赖于领域的帕累托前沿,而非单一的跨系统最优供应策略。我们的贡献总结如下: - •我们将MCI代理的资源调度供应表述为一个资源匹配问题,平衡任务性能、执行成本和不必要的信息暴露。 - •我们引入了一种从系统方程推导的新型MCI代理任务分类法,以及一个具有递增系统访问权限的有序资源调度层次结构,提供了任务需求和资源调度供应的可比较表示。 - •我们通过数据分析1200多篇MCI论文和在两个物理案例的新基准(包含240个经过验证任务)上进行受控执行,构建了两个任务到资源调度的映射。 - •我们提出了映射引导升级,它使用测得的映射来初始化资源调度供应,并仅在需要时扩展访问权限,相比固定和动态路由供应提高了精度-成本权衡。 参见标题 图1.所提框架概述,该框架定义了任务和资源调度空间,估计了文献和执行推导的任务到资源调度映射,并使用所得映射进行资源调度选择,并带有可选的自检触发升级。 ## 2. 相关工作 ### 2.1. LLM代理与MCI基准 关键基础设施中的运营智能传统上依赖于特定于任务的流水线。代表性的KDD系统包括用于可扩展异常检测的EGADS、用于时间序列监控的SR-CNN和OmniAnomaly,以及用于因果根因分析的CIRCA。这些方法为单独的检测或诊断任务提供了强大的解决方案,但不支持跨O&M生命周期的通用代理。最近的工作转向交互式代理和可执行基准。AIOpsLab部署故障注入云环境并在事件生命周期内评估代理,而AssetOpsBench提供了用于工业资产运营和维护的工具和场景。在相关的基础设施控制中,LLMLight评估用于交通信号决策的LLM代理。现有综述强调,现实的代理评估必须涵盖行为、可靠性、安全性、环境和工具。这些基准在预定义的环境和接口中评估代理。相反,我们的基准沿着有序阶梯变化资源调度供应,固定执行器,并估计每个任务类别的充分供应。 ### 2.2. 提高代理性能 大多数先前的工作通过改变代理在给定环境中如何推理、学习或反应来改进执行侧。ReAct将推理与行动交错进行,Reflexion引入了反馈驱动的重试,而ExpeL从先前的轨迹中检索经验。基于训练的方法进一步加强了规划和工具使用:AgentGen生成用于面向规划的指令微调的环境和任务,而Tool-MVR从经过验证的轨迹中学习工具调用和错误纠正。这些方法主要在可用资源调度下改进执行器或其执行过程。一条互补的工作线通过适应暴露给执行器的内容来改进供应侧。ToolLLM和AnyTool从大型工具集合中检索任务相关的API,而指令-工具检索(ITR)在每个步骤动态检索相关指令片段并暴露一个简化的工具子集。Chameleon规划外部模块的组合,而充分上下文预测检索到的文本证据是否足以回答查询。模型路由方法,如RouteLLM和AutoMix,同样根据预测的需求分配计算能力,尽管它们切换执行器而不是改变固定执行器的资源调度。这些方法通过相关性、学习路由或模型报告的需求来选择资源。相反,我们的工作测量保持执行性能的最低资源调度供应。 ### 2.3. 资源调度层设计、评估与治理 最近的工作越来越多地将代理资源调度层视为一个一等系统层,涵盖执行控制、工具访问、上下文、状态、验证和恢复。自然语言代理资源调度层将控制逻辑外部化为可移植规范。元资源调度层在资源调度实现上进行搜索。资源调度基准衡量跨模型和工作流的配置级资源调度效应。这些研究确立了代理性能取决于模型-资源调度配置,但侧重于资源调度表示、优化或跨配置评估。另一项平行的工作治理资源调度资源的使用方式。Progent执行可编程的工具策略,提示流完整性约束信息流,而AgentSandbox和MiniScope提供沙箱化和权限分析。ToolPrivBench研究不必要的权限选择,而资源调度审计评估完整执行轨迹上的边界合规性。总的来说,这些研究将资源调度层视为设计、优化、评估或治理的对象。我们的工作解决了一个互补的问题:对于固定的执行器和重复出现的任务类别,保持执行性能的充分资源调度供应是什么? ## 3. 概述 图1展示了我们方法的总体工作流程,该流程包括三个阶段:定义任务和资源调度空间、估计它们之间的关系,以及使用所得映射为新任务选择资源调度。首先,为了比较不同任务的需求和不同资源调度的供应,我们从底层物理系统形式化定义任务空间,并将资源调度组织成具有递增信息和能力的层级(第4节)。其次,我们从两个角度建立任务到资源调度的映射(第5节)。我们首先挖掘现有的MCI O&M研究,以检查先前工作针对不同任务类别使用了哪些资源调度层级。然后,我们在两个MCI环境中构建受控基准,并在不同资源调度
相似文章
面向执行轨迹的推理时对齐框架
本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。
审计智能体执行框架安全性
本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。
最好的智能代理工具会这样做……
作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。