TelemetrySuffBench:智能体遥测是否足以进行故障起源诊断?
摘要
介绍了 TelemetrySuffBench,这是一个用于评估智能体遥测是否足以进行故障起源诊断的基准。研究发现,完整的遥测数据使某些模型在起源步骤上达到较高的准确率,但粗粒度/与 OpenTelemetry 兼容的视图会产生明显的检测-定位差距,并且多个模型在面对模糊跟踪时难以进行安全弃权。
arXiv:2608.07899v1 公告类型:新
摘要:智能体系统越来越多地暴露执行轨迹,然而,能够揭示故障的遥测数据可能仍不足以确定故障起源的位置。我们引入了 TelemetrySuffBench,这是一个受控基准,将故障检测、故障起源定位和在证据不足时的安全弃权区分开来。该基准构建了具有延迟绑定故障的典型多组件轨迹,并将其呈现为成对的粗粒度视图、七因素遥测掩码和精确相等的模糊起源对。我们使用统一协议、显式候选集、无效输出核算、子组分析和冻结盲留出集评估了五个前沿语言模型。在完整遥测下,跨模型的起源步骤 Top-1 准确率从 33.8% 到 97.2% 不等。元数据、OpenTelemetry 兼容和 OpenInference 兼容视图保留了 99.5% 至 100% 的检测 F1,同时将起源步骤准确率限制在至多 0.5%,暴露了稳健的检测-定位差距。因子消融进一步表明,移除决策内容会将每个模型的起源步骤准确率降至零,而移除来源信息也会导致较大的模型相关损失。在需要弃权的丰富模糊输入上,证据门控使三个模型的无依据唯一起源答案减少了 12.5 到 48.6 个百分点,而两个模型仍然回答了所有情况,揭示了安全弃权中的强烈模型依赖性。冻结盲留出集上的结果在相同生成器家族内再现了核心模式。这些发现表明,终端状态可以支持检测,而可靠的因果归因需要显式的决策到来源链接以及跨模型仍然有效的弃权保障。数据集和基准实现可在 https://anonymous.4open.science/r/TelemetrySuffBench-E635/README.md 获取。
查看缓存全文
缓存时间: 2026/08/11 08:04
# TelemetrySuffBench:智能体遥测是否足以进行故障起源诊断? 来源:https://arxiv.org/html/2608.07899 ###### 摘要 智能体系统日益暴露执行轨迹,然而能够揭示失败的遥测信息可能仍不足以确定失败源自何处。我们引入了 TelemetrySuffBench,这是一个受控基准,将失败检测、故障起源定位和证据不足时的安全弃权区分开来。该基准构建了具有延迟绑定故障的规范多组件轨迹,并将其呈现为配对粗粒度视图、七因子遥测掩码和精确相等的模糊起源对。我们使用统一协议、显式候选集、无效输出核算、子组分析和冻结盲留出集评估了五个前沿语言模型。在完整遥测下,跨模型的起源步骤 Top-1 准确率从 33.8% 到 97.2% 不等。元数据、OpenTelemetry 兼容和 OpenInference 兼容视图保持了 99.5% 到 100% 的检测 F1,同时将起源步骤准确率限制在至多 0.5%,暴露了稳健的检测–定位差距。因子消融进一步表明,移除决策内容使每个模型的起源步骤准确率降至零,而移除来源映射也会导致巨大的模型相关损失。在需要弃权的丰富模糊输入上,证据门控将三个模型的不受支持的唯一起源答案减少了 12.5 到 48.6 个百分点,而两个模型仍然回答每个案例,揭示了安全弃权中的强模型依赖性。冻结留出集上的结果在同一生成器族内再现了核心模式。这些发现表明,终端状态可以支持检测,而可靠的因果归因需要显式的决策到来源链接以及跨模型保持有效的弃权保障。数据集和基准实现可在 https://anonymous.4open.science/r/TelemetrySuffBench-E635/README.md 获取。 ## I 引言 大型语言模型(LLM)智能体越来越多地通过多阶段工作流来执行任务,这些工作流结合了模型决策、记忆检索、工具调用、智能体间交接和环境观察。这些系统产生了大量的执行遥测数据,新兴的 AgentOps 实践将此类遥测视为监控和调试自主行为的基础 [1 (https://arxiv.org/html/2608.07899#bib.bib1)]。长期运行的服务和并发智能体集群将每个工作流的事件转化为跨越模型、工具、记忆系统和环境的连续、高维可观测性流。在这种规模下,挑战不仅在于存储和查询遥测数据,还在于确定哪些字段保留了自动诊断所需的因果证据。 然而,仅靠可观测性并不能确立诊断充分性。终端状态可以揭示执行失败,而引入失败的事件可能位于上游的多个因果阶段。当潜在的决策错误通过其他有效的工具调用传播时,诊断人员很容易选择第一个可见偏差、下游症状或终端验证器,而不是起源事件。最近的工作已将智能体系统中的失败归因作为明确的评估目标。Who&When 在 127 个多智能体系统的日志中标注了失败负责智能体和决定性错误步骤 [2 (https://arxiv.org/html/2608.07899#bib.bib2)];TraceElephant 研究从完整和部分多智能体轨迹中进行归因 [3 (https://arxiv.org/html/2608.07899#bib.bib3)];AgentRx 使用基于约束的诊断方法从执行轨迹中定位关键失败步骤 [4 (https://arxiv.org/html/2608.07899#bib.bib4)]。这些基准和方法确立了智能体级和步骤级诊断的重要性和难度。它们通常从选定的轨迹表示中评估归因,留下一个前置问题未解决:该表示的哪些部分实际上使标注的起源可识别?没有这种区分,高检测分数可能掩盖起源证据的缺失,而定位分数可能将因果归因与对下游表现的认识混为一谈。 这种区分在分布式系统的根因分析中很熟悉,那里的基准在指标、日志和轨迹上评估粗粒度和细粒度定位 [5 (https://arxiv.org/html/2608.07899#bib.bib5)],因果方法将观察到的变化与候选干预联系起来 [6 (https://arxiv.org/html/2608.07899#bib.bib6)]。两个遥测标准框定了这里研究的表示问题。OpenTelemetry 是一个与供应商和工具无关的可观测性框架,用于生成、收集和导出诸如轨迹、指标和日志等信号;它还定义了表示这些信号的协议和语义约定 [7 (https://arxiv.org/html/2608.07899#bib.bib7)]。OpenInference 通过用于跟踪 AI 应用的约定和插桩来补充 OpenTelemetry,包括 LLM 调用、检索上下文和外部工具使用 [8 (https://arxiv.org/html/2608.07899#bib.bib8)]。我们的 OpenTelemetry 兼容和 OpenInference 兼容视图是规范轨迹到这些约定可表达字段的确定性投影。 智能体执行添加了模式级投影可能无法保留的语义依赖:模型可能选择一个符号引用,注册表可能将其绑定到一个具体对象,后续组件可能即使原始选择是错误的也正确激活该对象。因此,遥测充分性是任务特定的。足以进行失败检测、故障分类、组件定位和精确起源步骤定位的证据不必相同。有用的评估必须分离这些诊断级别,并记录归因落在因果路径上的位置。起源证据不足也产生了选择性预测问题。分类器可以通过拒绝不确定输入来以覆盖率为代价换取更低风险 [9 (https://arxiv.org/html/2608.07899#bib.bib9)],而不可回答问题基准则测试语言模型是否克制自己不产生不受支持的答案 [10 (https://arxiv.org/html/2608.07899#bib.bib10),11 (https://arxiv.org/html/2608.07899#bib.bib11)]。失败归因需要更严格的构造:当可见遥测与多个不同的因果起源兼容时,输入是不可回答的。仅仅隐藏字段或指示模型弃权并不能建立这一性质。具有相同模型可见载荷但不同注入起源的匹配轨迹,提供了直接测试模型是否尊重证据不可识别性或提供不受支持的独特原因的机会。 我们引入了 *TelemetrySuffBench*,这是一个受控基准,用于衡量跨三个相互关联问题的遥测充分性。RQ1 询问支持失败检测的视图是否也支持注入起源的定位。RQ2 将遥测分解为七个语义因子——身份和事件语义、决策内容、来源映射、传播关系、工具和状态信息、验证器证据以及终端状态——并通过配对掩码衡量它们的贡献。RQ3 评估精确相等模糊起源对上的安全弃权,并测试显式证据门控提示是否减少不受支持的归因。该基准以版本化的规范轨迹格式表示执行,从相同的底层运行确定性渲染每个视图,将无效输出计为错误,并报告组件、事件、因果阶段、覆盖率和弃权结果。我们在统一协议下评估了五个前沿语言模型,并在冻结种子留出集上重复核心分析。 结果揭示了一致的分离:检测失败与定位其来源之间存在差异。在完整遥测下,起源步骤 Top-1 准确率跨模型从 33.8% 到 97.2% 不等。元数据、OpenTelemetry 兼容和 OpenInference 兼容视图保持了 99.5% 到 100% 的检测 F1,但将起源步骤准确率限制在至多 0.5%。移除决策内容使所有模型的步骤定位降至零;移除来源映射也导致巨大的模型相关损失。在需要弃权的丰富模糊输入上,证据门控将三个模型的不受支持的唯一起源答案减少了 12.5 到 48.6 个百分点,而两个模型继续回答每个案例。冻结留出集在同一延迟绑定生成器族内再现了核心检测–定位模式。 本文贡献了一个任务层次,涵盖检测、分类、组件定位、起源步骤定位和安全弃权,以及区分起源与下游表现的因果阶段分析。它在一个确定性基准中实现了这一表述,结合配对粗粒度视图、七因子掩码和规范多组件轨迹上的精确相等模糊起源对。统一的五模型评估添加了显式候选集、无效输出核算、操作员/领域/来源子组、提示干预和冻结盲留出集,产生了关于哪些遥测支持因果诊断的可重现证据。 ## II 背景与相关工作 ### II-A LLM 智能体系统中的失败归因 失败归因已成为不同于端到端任务评估的独立问题。Who&When 在两个层面定义归因——负责任智能体和决定性错误步骤——并在来自 127 个多智能体系统的失败日志上提供细粒度标注 [2 (https://arxiv.org/html/2608.07899#bib.bib2)]。TraceElephant 关注归因方法暴露的证据:其完全可观测性基准包括智能体输入和执行上下文,而这些是部分、仅输出轨迹所省略的,并报告使用完整轨迹可获得高达 76.5% 的提升 [3 (https://arxiv.org/html/2608.07899#bib.bib3)]。AgentRx 贡献了 115 条跨结构化 API 工作流、事件管理和开放式网页/文件任务的手工标注失败轨迹,以及跨领域分类法和用于定位关键步骤的基于约束的诊断方法 [4 (https://arxiv.org/html/2608.07899#bib.bib4)]。总的来说,这些基准确立了负责任智能体和失败步骤定位是困难且操作上相关的任务。 受控执行方法使用干预来改进归因:AgenTracer 通过反事实重放和故障注入生成训练轨迹,而 REFLECT 通过诊断特定的补丁和重放来测试候选原因 [12 (https://arxiv.org/html/2608.07899#bib.bib12),13 (https://arxiv.org/html/2608.07899#bib.bib13)]。TelemetrySuffBench 解决了互补的观察性问题:可见轨迹是否将注入的起源与其激活、第一个可见偏差、下游症状和终端表现区分开来?其配对视图保持执行和标签不变,仅改变呈现给模型的证据。 ### II-B 遥测标准与根因分析 OpenTelemetry 提供与供应商无关的 API、协议和语义约定,用于生成和传输轨迹、指标和日志 [7 (https://arxiv.org/html/2608.07899#bib.bib7)]。OpenInference 通过 AI 应用轨迹的约定和插桩扩展了这一基础,包括 LLM 调用、检索上下文和外部工具使用 [8 (https://arxiv.org/html/2608.07899#bib.bib8)]。AgentOps 通过识别监控、日志记录和分析所需的工件和数据,拓宽了智能体生命周期中的可观测性范围 [1 (https://arxiv.org/html/2608.07899#bib.bib1)]。这些工作标准化了执行证据的捕获和交换方式。它们本身并不确定特定投影是否包含给定诊断目标所需的语义链接。 微服务的根因分析提供了最接近的系统先例。RCAEval 从三个系统汇编了 735 个失败案例,并在粗和细定位粒度上评估了 15 个可重现基线 [5 (https://arxiv.org/html/2608.07899#bib.bib5)]。CIRCA 将根因分析表述为因果贝叶斯网络上的干预识别 [6 (https://arxiv.org/html/2608.07899#bib.bib6)]。这些文献探讨如何从可用遥测中改进定位。TelemetrySuffBench 将遥测表示视为自变量,并衡量在受控移除身份、决策、来源、关系、状态、验证或终端信号后,哪些诊断级别仍然可回答。 ### II-C 弃权与证据可识别性 选择性分类将弃权形式化为风险–覆盖率权衡,允许预测器拒绝输入以满足目标风险水平 [9 (https://arxiv.org/html/2608.07899#bib.bib9)]。语言理解基准通过不可回答问题将相关要求操作化。SQuAD 2.0 添加了超过 50,000 个对抗性编写的不可回答问题,这些问题的形式类似可回答问题,并要求系统确定段落何时不支持任何答案 [10 (https://arxiv.org/html/2608.07899#bib.bib10)]。Abstain-QA 评估黑盒语言模型在可回答和不可回答问题上的表现,并比较改进弃权的提示策略 [11 (https://arxiv.org/html/2608.07899#bib.bib11)]。AbstentionBench 将范围扩展到 20 个数据集,涵盖未知答案、欠规范、虚假前提、主观性和过时信息,发现 20 个前沿模型持续存在弃权失败 [14 (https://arxiv.org/html/2608.07899#bib.bib14)]。 失败起源归因引入了不可回答性的不同来源。答案缺失不是因为模型缺乏世界知识或请求在语言上不完整,而是因为相同的可见执行与多个不同的注入起源兼容。TelemetrySuffBench 直接构造了这种条件:每个模糊对具有精确相等的模型可见载荷和不同的黄金起源。因此,任何唯一起源答案都不被观察所支持,即使它与某个成员的隐藏标签一致。这种构造将选择性预测与因果诊断联系起来,并允许分别测量模糊轨迹上的不安全答案和可回答轨迹上的不必要弃权。 ## III 方法论 ### III-A 任务表述 我们将执行轨迹表示为 τ=\(E,G,X,Y\)。这里,E=\(e_1,...,e_n\) 是一个有序事件序列,G 包含父边和依赖边,X 包含可用于渲染的事件属性,Y 包含私有评估标签。对于遥测配置 m,确定性渲染器 g_m 产生模型可见视图 x_m(τ)=g_m(E,G,X)。(1) 渲染器从不读取 Y。故障轨迹的黄金诊断是 y=(f,c,o),其中 f 是故障类型,c 是引入故障的组件,o 是其起源事件。干净轨迹没有故障类型或起源。评估分离四个诊断决策。 * 检测预测是否发生故障。 * 分类从封闭分类法中选择一个类型。 * 定位识别起源组件和事件。 * 可回答性确定可见证据是否支持一个唯一起源。 检测和分类可以在定位不可行时仍然可能;RQ3 提供构造性的可回答性标签,而 RQ1 和 RQ2 在受控改变可见证据下衡量诊断性能。
相似文章
深度研究Agent在何处出错?Agent轨迹中的跨度级错误定位
本文介绍了一个以声明为中心的审计框架,用于识别深度研究Agent轨迹中的错误跨度,并提出了新基准TELBench,改进了过程级可靠性评估。
智能体自驱动显微镜基准测试支持资格认证,但未必能泛化到未见任务
本文介绍了一个基准测试与轨迹记录框架,用于评估控制显微镜的基于LLM的智能体,比较了105种智能体配置,发现基准测试有助于资格验证,但无法可靠预测智能体在未见任务上的表现。
AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者
本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。
基准测试未衡量的:论自主智能体弃权能力的评估
本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。