ChromaFlow: 工具增强型智能体评估中编排开销的负消融研究
摘要
本文介绍了ChromaFlow,一个工具增强的自主推理框架,并进行了一项负消融研究,表明在GAIA基准测试中,更激进的编排并未提升性能,反而增加了操作噪声。
arXiv:2605.14102v1 公告类型:新
摘要:自主语言模型智能体日益将规划、工具使用、文档处理、浏览、代码执行和验证循环结合在一起。这些能力使智能体系统更加有用,但也引入了仅从最终准确性无法看到的操作故障模式。本报告介绍了ChromaFlow,一个围绕规划器引导执行、专业化工具使用和遥测驱动评估构建的工具增强型自主推理框架。我们在干净评估约束下,在GAIA 2023 Level-1验证任务上分析了ChromaFlow。一个冻结的完整Level-1基线获得了29/53的正确回答,即54.72%。随后一个扩展了编排的恢复配置获得了27/53的正确回答,即50.94%,同时增加了回溯、超时事件、工具失败提及、令牌行调用和活动日志成本估算。两次随机的20任务冒烟评估分别产生了12/20和11/20的正确回答,表明小的诊断收益在不同样本中可能不稳定。因此,核心结果是一个负消融:更激进的编排并未改善全集性能,反而增加了操作噪声。该报告认为,有界规划器升级、确定性提取、证据协调和显式运行门控应被视为可靠自主智能体评估的一阶要求。
查看缓存全文
缓存时间: 2026/05/15 06:20
# ChromaFlow: 工具增强智能体评估中编排开销的负消融研究 来源: https://arxiv.org/html/2605.14102 \(2026年5月13日\) ###### 摘要 自主语言模型智能体日益结合规划、工具使用、文档处理、浏览、代码执行和验证循环。这些能力使智能体系统更有用,但也引入了无法仅从最终准确率中看出的操作故障模式。本报告介绍了 ChromaFlow,一个围绕规划器导向执行、专用工具使用和遥测驱动评估构建的工具增强自主推理框架。我们在干净评估约束下分析了 ChromaFlow 在 GAIA 2023 Level-1 验证任务上的表现。冻结的完整 Level-1 基线获得了 29/53 的正确回答,即 54.72%。后来一个扩展编排的恢复配置获得了 27/53 的正确回答,即 50.94%,同时增加了回溯、超时事件、工具故障提及、令牌线调用和运行日志成本估算。两个随机化的 20 任务烟雾评估分别得到 12/20 和 11/20 的正确回答,表明小的诊断性收益在不同样本间可能不稳定。因此核心结果是一个负消融:更激进的编排并未提高完整集性能,反而增加了操作噪声。本文认为,有界规划器升级、确定性提取、证据调和以及显式运行门应当被视为可靠自主智能体评估的一阶要求。 关键词: 自主智能体, 工具增强推理, 多智能体系统, GAIA, 基准评估, 可靠性, 负消融 ## 1 引言 大型语言模型系统已从单轮文本生成转向自主执行循环,这些循环进行规划、调用工具、检查中间证据并修改答案。诸如 ReAct 等系统展示了推理与动作交替进行的价值,而工具使用工作如 Toolformer 则表明语言模型可以从外部 API 和结构化工具调用中受益\[2 (https://arxiv.org/html/2605.14102#bib.bib2),3 (https://arxiv.org/html/2605.14102#bib.bib3)\]。GAIA 等基准套件衡量更长时域的助手行为,通常需要搜索、文件处理、多模态推理和仔细的答案综合\[1 (https://arxiv.org/html/2605.14102#bib.bib1)\]。自 GAIA 以来,智能体评估已扩展到多环境智能体基准、真实的网络和软件工程任务、操作系统交互、企业工作流、工具-智能体-用户交互以及显式编排基准\[4 (https://arxiv.org/html/2605.14102#bib.bib4),5 (https://arxiv.org/html/2605.14102#bib.bib5),6 (https://arxiv.org/html/2605.14102#bib.bib6),7 (https://arxiv.org/html/2605.14102#bib.bib7),8 (https://arxiv.org/html/2605.14102#bib.bib8),9 (https://arxiv.org/html/2605.14102#bib.bib9),11 (https://arxiv.org/html/2605.14102#bib.bib11)\]。最近的智能体评估和智能体技能工作还强调可靠性、污染、演化、治理以及超出原始工具使用的故障模式\[12 (https://arxiv.org/html/2605.14102#bib.bib12),10 (https://arxiv.org/html/2605.14102#bib.bib10)\]。本文定位于该评估方法学线:研究何时额外的编排未能产生可靠改进。 这些系统通常通过最终任务准确率来评估。准确率是必要的,但不完整。一种配置可以在保持甚至提高准确率的同时变得更昂贵、更慢、更难复制,或更依赖于脆弱的重试循环。相反,负结果如果暴露了哪些架构选择增加了执行不稳定性,仍然可能有用。本文将操作遥测视为评估对象的一部分,而非附带日志。 ChromaFlow 是一个自主推理框架,专为规划器导向的工具使用和基准执行而设计。它支持文档分析、网络搜索、代码执行、结构化提取、浏览器交互和最终答案验证。该系统旨在研究自适应编排和可靠性强化是否能在干净评估约束下提高基准性能。 主要发现是刻意保守的。一个更小的 20 任务诊断信号表明有针对性的可靠性修复可能有帮助。然而,后来的完整 Level-1 恢复运行并未保持改进。恢复配置得分低于冻结基线,并产生了更多操作噪声。随后的随机化烟雾运行也未能通过新完整运行的门控。因此,我们将本工作呈现为负消融和可靠性分析,而非排行榜声明。 ## 2 贡献 本报告做出三项集中贡献: - •它记录了一个自主智能体编排的负消融,其中更激进的恢复配置降低了完整 GAIA Level-1 准确率,同时增加了操作噪声和成本估算。 - •它提供了一个干净评估报告协议,通过发布聚合指标并保留任务文本、任务标识符、黄金答案、预测、附件、原始 URL 和原始轨迹来维护基准完整性。 - •它为智能体基准提出了可靠性门控:烟雾运行的收益只有在随机采样下同时通过准确率和操作噪声阈值时,才应证明完整运行的合理性。 本文未声称在 GAIA 上达到最先进性能。相反,它贡献了一个负系统消融:更激进的编排配置降低了完整 Level-1 准确率,同时增加了回溯、超时提及、工具故障提及和成本估算。结果支持一个以可靠性为中心的评估协议:智能体变更必须同时通过准确率和操作噪声门控,才能被视为进展。 ## 3 相关工作 ### 3.1 推理、行动和工具使用 ReAct 建立了一个简单但有影响力的模式,用于交织推理轨迹和任务特定动作,允许模型在与外部信息源交互时更新计划\[2 (https://arxiv.org/html/2605.14102#bib.bib2)\]。Toolformer 表明语言模型可以训练来决定何时以及如何调用外部 API,将工具使用视为习得的语言模型行为而非生成的固定包装器\[3 (https://arxiv.org/html/2605.14102#bib.bib3)\]。这些系统推动了工具增强智能体的发展,但它们本身并未解决本文研究的操作问题:额外的工具使用或规划何时提高可靠性,何时仅仅放大噪声? ### 3.2 智能体基准和真实环境 GAIA 评估跨搜索、文件处理、多模态证据和简洁答案综合的通用助手行为\[1 (https://arxiv.org/html/2605.14102#bib.bib1)\]。AgentBench 将语言模型作为智能体的评估扩展到多个交互环境\[4 (https://arxiv.org/html/2605.14102#bib.bib4)\]。WebArena 和 WorkArena 将评估推向真实浏览器和企业软件任务\[5 (https://arxiv.org/html/2605.14102#bib.bib5),8 (https://arxiv.org/html/2605.14102#bib.bib8)\],而 SWE-bench 则评估软件工程智能体对真实 GitHub 问题解决的能力\[6 (https://arxiv.org/html/2605.14102#bib.bib6)\]。OSWorld 进一步强调了与真实计算机环境的开放交互\[7 (https://arxiv.org/html/2605.14102#bib.bib7)\]。Tau-bench 增加了动态工具-智能体-用户交互及领域特定 API 和策略\[9 (https://arxiv.org/html/2605.14102#bib.bib9)\]。相对于这些基准,ChromaFlow 的贡献并非新的公共任务套件;而是对 GAIA 配置变更的操作分析,该变更在烟雾测试中看似有希望,但在完整 Level-1 比较下失败。 ### 3.3 编排和评估可靠性 2025-2026 年的智能体文献越来越多地将编排视为可测量的干预,而非无条件的利好。OrchestrationBench 明确针对跨多领域场景的 LLM 驱动规划与工具使用\[11 (https://arxiv.org/html/2605.14102#bib.bib11)\]。最近的系统化和评估工作认为,智能体行为超出了孤立的工具调用,并引发了可靠性、污染、演化、治理和安全问题\[10 (https://arxiv.org/html/2605.14102#bib.bib10),12 (https://arxiv.org/html/2605.14102#bib.bib12)\]。本文提供了一个支持该观点的具体案例研究:恢复配置增加了规划和执行表面面积,但完整运行结果降低了准确率,同时增加了操作噪声。 ## 4 系统概述 ChromaFlow 围绕一个监督执行控制器组织,该控制器选择执行策略、路由工具调用、监控故障信号并综合最终答案。控制器可以对简单任务直接综合答案,也可以将工作分配给专门的执行路径用于检索、文档分析、浏览器交互、Python 执行、Shell 执行和验证。 图1 (https://arxiv.org/html/2605.14102#S4.F1) 总结了系统拓扑结构。图表使用了分离的控制平面、执行平面、证据层和综合层,以强调 ChromaFlow 的可靠性策略不是单个组件;它是应用于路由、工具执行和最终答案组装的一个约束。 任务输入 用户提示、基准元数据、附件、运行时约束 Optimus 监督控制器 规划器选择、生命周期管理、预算执行、干净评估完整性门控 控制平面 任务签名 — 规划器策略 — 工具路由器 — 可靠性守卫 执行平面 文档/检索 — 网络/浏览器 — Python/Shell — 媒体/OCR 验证 — 可选 UI/后端/数据/文档专家 共享证据状态 提取的事实、中间观察、规范化候选、工具输出、一致性检查 综合与最终响应 基于证据的最终组装、答案规范化、生成的工件或基准答案 图 1: 专业化的 ChromaFlow 系统拓扑。控制平面对任务进行概要分析、选择执行策略、路由工具并执行可靠性门控。执行平面将观察结果写入共享证据状态,然后综合产生最终响应。分层布局使路由明确,没有重叠边或标签。 ### 4.1 规划器导向执行 输入任务被映射到任务签名,该签名估计模态、附件要求、可能的答案形状和工具需求。然后规划器选择执行路径和工具预算。目标是避免将每个问题都视为广泛的网络研究问题。包含文档、电子表格、图像或代码工件的任务应首先提取本地证据,然后再升级到搜索密集型工作流。 ### 4.2 工具层 工具层包括网络搜索、文档解析、Python 执行、Shell 执行、浏览器自动化、媒体处理和最终答案规范化。工具输出被视为证据对象,可由回答策略检查。系统跟踪工具异常、超时、备选激活和重试行为,因为这些事件通常预测答案质量和成本。 ### 4.3 可靠性层 可靠性层负责限制工具调用、检测重试风暴、处理超时以及防止不可用的可选提供者生成重复回溯。它还记录缺失的最终答案、直接求解器完整性命中、已用时间、尝试次数和聚合成本估算。这些信号用作运行门控:一种配置不应从烟雾测试升级到完整运行,除非它在不显著增加操作噪声的情况下提高了准确率。 ## 5 评估协议 评估使用了 GAIA 2023 Level-1 验证任务。为维护基准完整性,公开报告排除了任务文本、任务标识符、黄金答案、模型预测、附件名称、原始 URL 和原始执行轨迹。仅报告聚合准确率、聚合操作指标和非识别的转换计数。 干净评估约束: - •直接求解器路径禁用; - •无任务特定答案补丁或任务 ID 路由; - •不发布基准任务文本或黄金答案; - •完整运行中缺失最终答案零容忍; - •运行目录冻结供后续审计; - •完整运行启动由随机化烟雾运行性能和噪声门控。 主要比较是冻结的完整 Level-1 基线与后来的完整 Level-1 恢复配置。两次运行均覆盖 53 个 Level-1 验证任务。额外的 20 任务随机化烟雾运行用作诊断门控,而非完整集性能的证明。 ## 6 结果 ### 6.1 完整 Level-1 比较 表1 (https://arxiv.org/html/2605.14102#S6.T1) 总结了完整 Level-1 比较。冻结基线获得 29/53 正确回答。恢复配置获得 27/53 正确回答。两次运行均产生零缺失最终答案。 表 1: 完整 GAIA Level-1 验证比较。 恢复配置因此净损失了两个任务。这不是改进声明。这是表明扩展编排配置未能从较小的诊断信号推广到完整 Level-1 任务集的证据。 ### 6.2 操作噪声和成本 表2 (https://arxiv.org/html/2605.14102#S6.T2) 报告了聚合操作遥测。恢复配置增加了回溯、超时提及、工具故障提及和运行日志成本估算。 表 2: 操作噪声和运行日志成本估算。成本估算是操作估算,而非提供商账单语句。 重要的不仅是恢复运行成本更高。准确率下降,而成本和噪声增加。这种模式表明恢复变更增加了执行熵,而没有增加足够的推理或验证质量来补偿。 ### 6.3 任务级变动 任务级比较覆盖了 53 个共同任务。为保持基准机密性,仅报告聚合转换计数。恢复配置产生了六个正确变错误转换和四个错误变正确转换。二十三个任务保持正确,二十个任务保持错误。 表 3: 从冻结基线到恢复运行的聚合任务级变动。 净变动为负。错误分析显示代码与文档任务、文档与图像任务、数字/日期答案和无附件语义研究任务周围存在更强的回归信号。这些类别指向提取、规范化和证据调和问题,而非仅仅是重试不足。 ### 6.4 烟雾运行复现检查 烟雾运行用作随机化门控。它们未被视为证明运行。第一个补丁后随机化烟雾达到 12/20,即 60.00%,零缺失最终答案和零直接求解器命中。它被冻结为阳性烟雾,但并非完整集改进的证据。下一个随机化烟雾达到 11/20,即 55.00%,且具有更高的回溯和超时噪声。 表 4: 随机化 20 任务 Level-1 烟雾检查。 此序列支持完整运行门控。阳性烟雾令人鼓舞,但随后的烟雾未通过阈值。因此,适当的决定是避免启动另一个完整 Level-1 运行,并避免在 Level-1 未干净改进前进入 Level-2 或 Level-3。 ## 7 故障分析 负消融暴露了若干问题。
相似文章
工具即连续流:用于演进式智能体推理
本文介绍了 FlowAgent,这是一个新颖的框架,它利用条件流匹配将工具链重新概念化为连续轨迹生成,以提高长时序智能体推理的鲁棒性。
ClawArena-Team: 在语言模型代理中基准测试子代理编排和动态工作流
介绍了ClawArena-Team,这是一个基准测试,用于衡量单个语言模型作为领导者,通过动态工作流创建、委托和编排子代理的管理能力。实验表明,权限授予是一个瓶颈,成本与管理质量脱钩,大多数模型在性能上聚集,而编排行为则差异很大。
自主芯片设计中的智能体协调
本文探讨了使用大语言模型和AI智能体进行自主芯片设计,将其建模为AI组织,并讨论了芯片设计场景中黑盒优化的动作空间。
隐形编排者抑制保护行为并使权力持有者解离:多智能体LLM系统中的安全风险
本文对多智能体LLM系统中隐形编排的安全风险进行了实证研究,发现隐形编排者增加了解离并抑制了保护行为,且基于行为的评估不足以检测内部状态风险。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。