自主分析代理的新息残差审计:定位、检测极限、错误控制与可辨识性

arXiv cs.AI 论文

摘要

本文对自主分析代理的新息残差审计进行了理论分析,研究如何定位代理生成的数据分析中的错误、控制误报,并识别错误归因的根本限制。

arXiv:2608.05490v1 公告类型:新 摘要:自主代理现在可以执行完整的数据分析,包括选择队列、连接表格和拟合模型,几乎不需要逐步监督。当这样的分析出错时,必须有人确定是哪个操作导致了错误。一种近期的方法无需任何带标签的错误样本即可做到这一点,它从已知正确的分析中学习,并标记那些偏离模型预测的操作;这种审计的可靠性尚未被研究。本文提供了这一分析。评分函数的选择决定了错误是否根本能够被定位。如果每个操作根据其在紧邻前一个操作条件下的意外程度评分,那么仅仅继承了先前错误的操作与正确操作无法区分,因此一个错误只会产生一个标记;而基于对预期分析的较长重建所计算的分数,则会将单一错误扩散到多个操作上。我们量化了这种扩散的范围,并给出了当错误逐渐累积而非一次性发生时如何选择比较长度。随后,我们给出了在单个被审计分析中控制误标记操作比例的程序,该程序仅要求正确的分析具有可交换性,而不要求拟合模型正确;我们还量化了当模型不完美,或当分析以依赖于其内容的方式被选中进行审查时,保证会削弱多少。最后,我们确立了此类审计所能报告的限制:低于一定幅度的错误根本无法归因,因为它们与正确分析之间的普通变异无法区分。随着更多正确分析的收集,这一限制下降得极其缓慢,以至于在当前使用的表示规模下,增加一百倍也只能使其降低不足百分之二。因此,表示维度而非训练数据量才是约束条件。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:47

# 自主分析代理的创新残差审计:定位、检测界限、错误控制与可辨识性  
来源:https://arxiv.org/html/2608.05490  
Mark Dredze  
Johns Hopkins University  
[email protected]  

###### 摘要  
自主代理现在能够执行完整的数据分析,选择队列、连接表、拟合模型,几乎不需要逐步监督。当这样的分析被证明是错误的时候,必须有人确定是哪个操作导致了错误。最近的一种方法在没有任何标注错误的情况下做到这一点,转而从已知正确的分析中学习,并标记那些偏离该模型预测的操作;这种审计的可靠性尚未被研究。本文提供了这一分析。评分的选择决定了错误能否被定位。如果每个操作是根据它在给定紧邻前一个操作时的意外程度来评分的,那么仅仅继承了先前错误的操作与正确操作无法区分,因此一个错误产生一个标记;而针对预期分析的更长重建计算的评分则会将单一错误扩散到许多操作上。我们量化了这种扩散的程度,以及当错误是逐渐累积而非一次性出现时如何选择比较长度。然后我们给出一些程序,在单个被审计分析中控制被错误标记的操作比例,这些程序仅要求正确的分析是可交换的,而不要求拟合模型是正确的;同时我们量化了当模型不完善或当分析以依赖其内容的方式被选择进行审查时,保证会被削弱多少。最后,我们确立了任何此类审计所能报告的极限:低于某一幅度的错误根本无法被归因,因为它们与正确分析之间的正常变异无法区分。随着收集到更多正确分析,这一极限下降得如此缓慢,以至于在目前使用的表示规模下,样本量增加一百倍也只能使其降低不到百分之二,因此表示维度而非训练数据量才是约束瓶颈。

## 1 引言  
语言模型代理越来越多地被用于端到端地执行数据分析。给定一个研究问题,这类代理会提出假设、定义队列、跨联邦数据库连接表、拟合模型并报告结论,在执行数十个操作时没有人工审查中间步骤。在生物医学环境中,由此产生的分析为实质性结论提供依据,而其生成数量之庞大,超出了专家评审者逐行核查的能力。这些分析并不总是正确的。代理可能会用一个过滤器缩小队列,从而悄无声息地排除某类患者;可能在连接键上丢失记录;或者拟合模型时遗漏设计所需的调整项。结果是一条轨迹,终止于一个看似合理但通过无效手段得出的结论。检测轨迹不正确是一个问题;对于任何必须根据发现采取行动的人来说,关键问题是另一个问题,即其中哪个操作引入了错误。这决定了需要重新运行什么、纠正什么,以及结论是否还能挽救。将失败归因到特定操作之所以困难,原因是序列执行所固有的。轨迹早期的错误会污染后续每个操作所消费的状态,因此后续即使本身正确执行的操作,相对于分析本应做的事情来说仍显得异常。症状掩盖了源头。当轨迹包含多个真实错误时,当到达审计者的轨迹已经被一个上游判断选中,而该判断本身是整个轨迹的函数时,以及当没有失败示例可供学习时,困难会进一步加剧。

现有方法在最后一个约束上存在分歧。监督式归因方法从带有标注错误步骤的失败轨迹中学习,这些标注通过人工、反事实重放或程序化故障注入获得(Zhang et al., 2025; Feng et al., 2026)。产生此类标注的成本很高,而且每条轨迹只有一个关键错误这一常见假设也反映了这一点。Yeh et al. (2026) 表明,标注要求可以完全消除,方法是仅用成功轨迹训练,并根据失败轨迹中每一步对学习到的成功动态的偏离来对它进行评分。本文采用这一表述并发展其统计理论。

在这种表述下,归因的统计属性尚未被刻画。一个报告操作集合的审计引发了三个基准准确率无法回答的问题:报告的操作中预期有多大比例是虚假的;错误必须达到多大才能被检测到;当拟合的成功执行模型本身是近似的时候,报告意味着什么。对于为科学结果决策提供信息的审计来说,这些属性与准确率同样重要。本文给出了这样的解释。我们分析这样的审计:每个操作都根据拟合于成功轨迹的可预测预测模型的一步创新来评分。定位是精确的:以其实现的输入状态为条件,在早期错误之后正确执行的操作具有零残差,因此继承的污染不会产生信号,上述掩盖问题不会出现(定理 1)。该结果要求可预测条件作用和一步评分;第 3.2 节和第 6.1 节刻画了哪些评分规则满足这些条件,以及当它们不满足时还有什么可用的。预测视界在定位与累积之间构成权衡,因此逐步引入的错误对一步评分不可见,但在匹配的视界下可以恢复(第 3.2 节)。在任意轨迹内依赖下,标记集合的假发现控制是可行的,其形式仅要求跨轨迹的可交换性,而非拟合模型的正确设定,同时附带一个敏感性分析,报告需要多少审计选择效应才能移除每个标记(第 5 节)。另外三个结果涉及部署模型和轨迹总体。成本归一化时间只有在执行成本和操作嵌入的联合模型下才是可预测的,这种分解还使成本成为一个可审计的通道(第 6.1 节);明确的支持外方差膨胀条件给出了使继承早期误差的操作保持保守零状态而非不受控制的保证(第 7 节)。跨许多轨迹合并重复出现的操作类型将可检测扰动降低了一个因子 \(\sqrt{m_c}\)(第 10 节)。最后,如果没有最小效应阈值,估计目标本身是不可检验的,而有了阈值,最小可归因错误的下界不会因额外校准数据而消失(第 11 节)。

第一部分为任意可预测一步预测族发展定位、评分选择与多重性控制。第二部分研究高斯桥实现,包括时间归一化、终端锚定以及训练支持之外的行为。第三部分处理跨轨迹的重复出现、可辨识性与检测界限。每个结果都适用于所述建模假设之内,第 5.6 节对偏离这些假设给出了代价评估,而不是将设定视为精确无误。

### 1.1 相关工作  
Zhang et al. (2025) 提出了步骤级失败归因问题,并发布了 Who&When 基准,确立了该任务的难度:报告的最佳步骤级准确率为 14.2%。后续研究使用提示流水线或后训练的归因模型,并带有通过人工标注、反事实重放或程序化故障注入获得的步骤级失败标签。Feng et al. (2026) 应用共形预测来产生具有有限样本覆盖率的连续预测集。Zhang et al. (2026) 将在线审计形式化为检测最早的关键错误。这些方法假设每条轨迹只有一个关键错误,并且需要标注的失败样本。Yeh et al. (2026) 去除了标注要求。他们将每个操作嵌入为来自行动模型的隐藏状态向量,将序列视为从查询表示到终端目标状态的连续潜在路径的不规则观测,在平方重构损失下对成功轨迹拟合神经受控微分方程,并用 \(\|h_t-\hat{h}(u_t)\|_2^2\) 对每一步评分。通过选择 top-\(k\) 个分数或阈值设置为来自留出成功轨迹的合并逐步骤分数的 \((1-\alpha)\) 分位数来标记步骤。该工作采纳了四个要素:单类公式、初始查询状态与终端目标状态之间的连续潜在路径、在成功轨迹上校准的合并共形阈值,以及将结果表示为贡献步骤集合。在那一公式的基础上,本工作发展其理论的四个要素。第一个是可预测时间网格。顺序条件作用要求进入预测定律的时间索引相对于过去是可测的。按实现轨迹长度归一化的网格(当轨迹长度不等时是自然选择)是完整轨迹的函数,不具有这一性质;预算归一化本身也不具备,因为操作的成本是该操作的属性。第 6.1 节给出了一个确实具有该性质的构造,通过联合建模成本与嵌入,这还额外使执行成本成为第二个审计通道。第二个是评分规则的表征。针对由观测轨迹插值驱动的路径计算的重构分数,介于一步创新与自由运行展开之间。其有效预测视界是拟合向量场的属性,而非设计参数,因为控制路径允许动力学跟踪被审计轨迹;命题 1 表明这个定位窗口可以被测量。这类分数的两个属性会影响这里发展的保证。由于动力学跟踪观测轨迹,腐败部分地预测了自身,从而削弱自身的分数以及下游的分数。而当插值器是双向的(如平滑样条和自然三次样条),\(u_t\) 处的值依赖于 \(t\) 之后的结点,因此该步骤的分数是后续步骤的函数,并且在定理 1 所需的意义上不可预测。实现可以直接对照这两个条件进行检查。第三个是对报告集合的错误控制。合并校准分数的固定分位数控制分布内步骤的边际假阳性率。在实际报告的操作中虚假标记的比例是另一个量,两者不同,因为轨迹内的标记通过共享校准集和轨迹本身而相互依赖。第 5 节在这种依赖下提供后者,并附带针对轨迹被选入审计总体的敏感性分析。第四个是一组限制:第 4 节和第 11 节导出检测边界、最小可检测扰动以及该公式的可辨识性结果,这些结果限定了其中任何程序能够报告的内容。

Yeh et al. (2026) 的控制路径也解决了第 8 节的多模态终点问题,而且比这里发展的构造更直接。仅由初始条件决定的潜在路径是从查询到终点的确定性流,无法表示两个不同的有效结论,如命题 10 所形式化。将动力学以观测轨迹为条件可以表示多个终点,而无需命题 11 中可预测锚点所需的状态敏感性。然而,跟踪被审计轨迹也可能吸收部分异常。这些效应的相对重要性取决于拟合模型,应通过实证评估。

单类和基于重构的异常检测有大量文献。最接近的机器人工作从正常轨迹训练的模型检测失败的执行,但通常将失败定位在轨迹层面而非步骤层面,如 Yeh et al. (2026) 所指出的。相关的统计基础包括创新、基于模型的故障检测与隔离、共形推断以及多重检验;第 2.2 节和第 5 节总结了这些联系。

## 第一部分:可预测序列模型的创新审计

## 2 设定

### 2.1 轨迹、成本与滤流  
轨迹是一个操作序列 \(o_1,\ldots,o_T\),响应于嵌入为 \(x_0 \in \mathbb{R}^d\) 的研究问题而发出。每个操作携带一个嵌入 \(x_t=\phi(o_t) \in \mathbb{R}^d\) 和一个执行成本 \(c_t=\mathrm{cost}(o_t) > 0\),两者都是同一对象的函数。运行在执行前固定的成本预算 \(C_{\max}\) 下进行,且每个操作至少花费 \(c_{\min} > 0\),因此 \(T \leq T_{\max}:=\lfloor C_{\max}/c_{\min}\rfloor\) 是确定性的。这个界限在第 5.3 节中使用,并为按固定预算归一化提供动机。需要两个滤流。记  
\[
\mathcal{F}_t=\sigma(x_0,\ldots,x_t,c_1,\ldots,c_t),\qquad
\mathcal{G}_t=\mathcal{F}_{t-1}\vee\sigma(c_t),
\]  
因此 \(\mathcal{G}_t\) 是在操作 \(t\) 的嵌入实现之前已知的信息。归一化时间及其增量  
\[
s_t=\frac{1}{C_{\max}}\sum_{i\le t} c_i,\qquad
\Delta_t=\frac{c_t}{C_{\max}},
\]  
是 \(\mathcal{G}_t\)-可测的,但不是 \(\mathcal{F}_{t-1}\)-可测的,因为操作 \(t\) 的成本是该操作的属性。因此所有条件作用陈述都使用 \(\mathcal{G}_t\)。第 6.1 节指定了此条件作用所需的联合模型。终止时间 \(T\) 是 \(\{\mathcal{F}_t\}\) 的停时,且 \(I \subseteq \{1,\ldots,T\}\) 表示被污染操作的集合。两者都是随机的。我们要求 \(I\) 在以下意义上是可预测的:\(\{t\in I\}\in \mathcal{G}_t\):操作 \(t\) 是否违反机制由进入该操作时的状态决定,而非由其实现结果决定。结果并不以 \(T\) 或 \(I\) 的实现值为条件。当停止决策依赖于观测历史时,以 \(T\) 为条件可能使早期创新产生偏差。

### 2.2 预测族与广义残差  
模型 \(\mathcal{M}\) 是一个可预测的条件法则族:对每个 \(t\),一个概率测度 \(Q_t\) 在 \(\mathbb{R}^d\) 上,其参数是 \(\mathcal{G}_t\)-可测的,以及给定 \(\mathcal{F}_{t-1}\) 的 \(c_t\) 的条件法则 \(P_t\)。记 \(R_t\) 为 \(Q_t\) 的 Rosenblatt 变换,即逐次条件分布函数的向量(Rosenblatt, 1952),并定义广义残差  
\[
u_t=R_t(x_t)\in[0,1]^d,\qquad
\varrho_t=P_t\big((-\infty,c_t]\big)\in[0,1].
\]  
这些是 Cox 和 Snell (1968) 的广义残差的前序列形式(Dawid, 1984)。

相似文章

AgentForesight:多智能体系统中用于早期故障预测的在线审计

arXiv cs.CL

本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。