超越可疑步骤:长期代理中的本体信任

arXiv cs.AI 论文

摘要

本文介绍了本体信任和RGE,一种在线监控器,它沿角色、目标和证据分解信任,以检测长期代理中的任务漂移。RGE在跨域基准测试中表现优于基线,具有高漂移F1分数,同时保持良性覆盖。

arXiv:2608.17718v1 公告类型:新 摘要:长期代理越来越多地跨多个步骤、工具和观察运行。在这种情况下,相关的监督问题不仅是每个行动在局部是否有效,而且是演化中的轨迹是否仍然对应于用户授权的任务。漂移可以悄然累积:代理可能在每个步骤中以合理的参数调用正确的工具,而其前缀却向更广泛的角色、相邻的目标或用户从未提供的证据移动。现有的监控器大多检查局部合规性,给出最终轨迹判定,或评分通用风险;它们不直接估计这种前缀级别的关系。我们引入本体信任,这是一种轨迹前缀的任务条件属性,并将其实例化为RGE,一种在线监控器,沿角色、目标和证据分解信任。RGE仅使用LLMs来推导结构化的任务和步骤表示;信任状态更新、投影和干预决策是确定性的,因此输出是可重放和可审计的信任轨迹,而不是单一的端到端判定。我们从OSWorld、FinanceBench和EICU-AC构建了一个跨域轨迹语料库,涵盖良性执行、前缀配对漂移和伪一致性失败。在此语料库上,RGE在前缀配对漂移检测方面优于改编的规则型、判定型和屏蔽型基线。使用两个较大的估计器模型,它在每个基准测试上都超过93%的漂移F1,同时保持良性覆盖在95.8%或更高。伪一致性更难:检测取决于任务完成是否外部可见,这是一个我们通过经验表征的结构限制。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:13

# 超越可疑步骤:长期智能体的本体论信任  
来源:https://arxiv.org/html/2608.17718  

###### 摘要  
长期智能体正日益在多个步骤、工具和观测中运作。在此情境下,相关的监督问题不仅在于每个动作是否局部有效,还在于不断演化的轨迹是否仍对应于用户授权的任务。漂移可能悄然累积:智能体可能在每一步都使用正确的工具和看似合理的参数,但其前缀轨迹却逐渐偏离至更宽泛的角色、相邻目标或用户从未提供的证据。现有监控器大多仅检查局部合规性、给出最终轨迹判定或评估一般性风险;它们并未直接估算这种前缀级关系。我们提出本体论信任——一种轨迹前缀的任务条件属性,并将其具体化为RGE,一种在线监控器,将信任沿角色、目标和证据三个维度分解。RGE仅利用大语言模型推导结构化的任务与步骤表征;其信任状态更新、预测和干预决策均为确定性过程,因此输出的是可回放、可审计的信任轨迹,而非单一的端到端判定结果。我们基于OSWorld、FinanceBench和EICU-AC构建了跨领域轨迹语料库,涵盖良性执行、前缀配对漂移和伪一致性失败。在该语料库上,RGE在检测前缀配对漂移方面优于现有规则型、裁判型和屏蔽型基线方法。使用两个较大的估计模型时,其在所有基准测试中的漂移F1值均超过93%,同时将良性覆盖率保持在95.8%或更高。伪一致性检测更为困难:检测性能取决于任务完成是否具有外部可见性,我们通过实证分析指出了这一结构性限制。  

## 1 引言  
长期智能体可能在未执行任何孤立看似错误操作的情况下发生故障。当被要求完成一项委托任务时,它可能使用正确的工具、生成合理的最终交付物,却同时读取了从未被要求访问的文件、将其角色扩展以验证“相关”上下文,或在用户请求已被满足后仍继续行动。每一步在已发生的上下文中都保持合理,但整体轨迹却不再合理。此类故障未必属于传统意义上的安全违规,也非简单的任务完成失败。最终交付物可能正确,但问题在于演化中的前缀已偏离授权任务,即使每个单独步骤在局部仍有效。  

当前的监督工具很少直接检验这种关系。运行时监控器检查动作是否违反规则\[1 (https://arxiv.org/html/2608.17718#bib.bib1)\];任务与智能体基准测试评估最终结果或任务完成度\[2 (https://arxiv.org/html/2608.17718#bib.bib2), 3 (https://arxiv.org/html/2608.17718#bib.bib3), 4 (https://arxiv.org/html/2608.17718#bib.bib4)\];安全基准测试暴露显式提示注入模式\[5 (https://arxiv.org/html/2608.17718#bib.bib5), 6 (https://arxiv.org/html/2608.17718#bib.bib6), 7 (https://arxiv.org/html/2608.17718#bib.bib7)\];局部异常检测器标记异常步骤\[8 (https://arxiv.org/html/2608.17718#bib.bib8), 9 (https://arxiv.org/html/2608.17718#bib.bib9)\];全记录裁判或审计方法通常返回非结构化的风险判定\[10 (https://arxiv.org/html/2608.17718#bib.bib10), 11 (https://arxiv.org/html/2608.17718#bib.bib11)\]。这些检查均未触及长期委托的核心问题:它们未询问当前轨迹前缀是否仍是用户授权的任务。  

如图1所示:Living-off-the-land轨迹上的快照级AUC热图。人们可能期望更细粒度的步骤级诊断能填补这一空白,但事实并非如此。我们在Living-off-the-land轨迹语料库上评估了涵盖令牌级不确定性、语义一致性和因果基础的九种快照指标,并在三个评估模型上进行测试。该语料库中每一步均使用合法工具,但前缀偏离了用户授权的任务。最佳指标仅达73.49% AUC,而预测熵在所有评估器中均接近随机水平(图1)。步骤级信号可标记局部可疑动作,但无法单独恢复当前前缀与授权任务之间的关系。判断所需的信息分布在整个前缀中,而非包含于任何单一步骤内。  

我们将这种前缀级关系称为本体论信任。其中“本体论”指任务身份:一个局部合理的前缀可能演变为比用户委托更宽泛或不同的任务。当轨迹至今所产出仍对应于用户指令授权的任务时,本体论信任成立。它不是任何单一步骤的属性,可能沿三个可区分的维度退化。角色维度捕获智能体是否保持在其被授予的范围内;目标维度捕获智能体是否仍在追求委托目标;证据维度捕获其行为是否仍扎根于任务文本、用户提供的信息和观测环境中。当一个或多个维度偏差足够大,导致前缀不再对应授权任务时,轨迹即丧失本体论信任,产生信任漂移,即使每个步骤仍工具适用。  

我们将本体论信任具体化为RGE,一种在轨迹前缀上维护信任状态的在线监控器。RGE将基于LLM的语义解释与确定性状态演化分离。它首先从指令中推导结构化的任务参考,然后将每个步骤上下文解析为类型化字段。其余计算均为确定性过程。监控器将这些字段投影到角色、目标和证据三个轴上,随时间聚合偏差,并在不依赖进一步LLM输入的情况下发出干预标签。输出是一条信任轨迹——一个可回放的状态序列,其决策可通过解析字段和累积偏差的维度进行审计。  

我们的工作有三项贡献。第一,我们形式化了本体论信任作为轨迹前缀的任务条件属性,并将其分解为角色、目标和证据三个维度。第二,我们开发了RGE,一种在线监控器,其中LLM将每个步骤解析为类型化字段,而状态更新和干预决策保持确定性。第三,由于现有语料库未直接测试轨迹前缀是否仍对应授权任务,我们构建了跨OSWorld、FinanceBench和EICU-AC的跨领域轨迹语料库,包含良性执行、前缀配对漂移和伪一致性失败。这使我们能够评估轨迹是否已停止执行其被授权的任务。  

## 2 相关工作  
**轨迹语料库与监控关系**:现有智能体基准测试日益暴露完整的动作-观测轨迹,而非仅提供最终答案,这建立在将长期智能体扩展至多步设置的更广泛研究基础上\[12 (https://arxiv.org/html/2608.17718#bib.bib12), 13 (https://arxiv.org/html/2608.17718#bib.bib13)\]。OSWorld提供桌面与操作系统控制轨迹\[2 (https://arxiv.org/html/2608.17718#bib.bib2)\],FinanceBench提供基于文档的金融推理任务\[3 (https://arxiv.org/html/2608.17718#bib.bib3)\],EICU-AC提供基于电子健康记录模式的结构化临床查询\[4 (https://arxiv.org/html/2608.17718#bib.bib4)\]。其他语料库涵盖交互式Web任务、具身环境、软件工程及助手场景\[14 (https://arxiv.org/html/2608.17718#bib.bib14), 15 (https://arxiv.org/html/2608.17718#bib.bib15), 16 (https://arxiv.org/html/2608.17718#bib.bib16), 17 (https://arxiv.org/html/2608.17718#bib.bib17), 18 (https://arxiv.org/html/2608.17718#bib.bib18), 19 (https://arxiv.org/html/2608.17718#bib.bib19), 20 (https://arxiv.org/html/2608.17718#bib.bib20)\]。我们使用这三个领域来源进行评估,因为它们使角色、目标和证据约束在跨领域时具象化。然而,轨迹数据本身未标注局部合理的前缀何时改变任务身份;这些基准测试大多评估最终结果或领域特定正确性。  

**智能体安全与重定向**:另一类研究关注智能体行为如何被重定向。提示注入与间接提示注入基准测试考察通过用户输入、网页内容、工具或外部文档注入的指令\[21 (https://arxiv.org/html/2608.17718#bib.bib21), 5 (https://arxiv.org/html/2608.17718#bib.bib5), 7 (https://arxiv.org/html/2608.17718#bib.bib7), 6 (https://arxiv.org/html/2608.17718#bib.bib6)\]。相关威胁模型涵盖记忆与知识库投毒、高风险工具使用、模拟工具故障及有害多步请求\[22 (https://arxiv.org/html/2608.17718#bib.bib22), 23 (https://arxiv.org/html/2608.17718#bib.bib23), 24 (https://arxiv.org/html/2608.17718#bib.bib24), 25 (https://arxiv.org/html/2608.17718#bib.bib25)\]。这些工作描述了可通过外部内容、记忆、工具或多步请求结构重定向执行的机制。RGE研究一个互补的监控问题:一旦偏离开始,无论触发因素为何,它们如何在前缀层面呈现。  

**运行时监控与轨迹级判断**:现有监控器在运行时或执行后检查智能体轨迹。最直接的比较是LLM-as-judge评估,它要求模型给出非结构化判定\[26 (https://arxiv.org/html/2608.17718#bib.bib26), 27 (https://arxiv.org/html/2608.17718#bib.bib27), 28 (https://arxiv.org/html/2608.17718#bib.bib28)\]。RGE仅使用LLM推导结构化的任务和步骤表征,其信任状态和干预标签通过结构化信任轨迹上的确定性更新产生。在任务特定监控器中,AgentSpec强制执行用户指定规则\[1 (https://arxiv.org/html/2608.17718#bib.bib1)\],其监控量是规则满足度,而非前缀是否仍在授权任务上。R-Judge在通用安全框架下评估智能体交互记录的安全风险\[10 (https://arxiv.org/html/2608.17718#bib.bib10)\]。在我们的适配中,它判断单一步骤或短历史窗口。AgentAuditor是一个记忆增强评估框架,检索相关先验推理经验以指导LLM评估器处理完整交互记录\[11 (https://arxiv.org/html/2608.17718#bib.bib11)\]。在我们的使用中,这产生的是离线全记录判定,而非在线前缀级估计。MAS-Shield是针对LLM多智能体系统的粗到细防御框架\[29 (https://arxiv.org/html/2608.17718#bib.bib29)\],它通过关键智能体选择、轻量级审计和基于共识的升级分配审计努力,而非维护轨迹前缀上的任务条件信任状态。  

传统异常检测与屏蔽方法监控日志流、多变量时间序列或时序逻辑约束\[8 (https://arxiv.org/html/2608.17718#bib.bib8), 9 (https://arxiv.org/html/2608.17718#bib.bib9), 30 (https://arxiv.org/html/2608.17718#bib.bib30)\]。这些选择符合其原生目标,但均未维护估算委托任务关系是否仍成立所需的任务条件角色、目标和证据闭合状态。RGE直接通过前缀上的在线信任状态监控该关系,并沿角色、目标和证据三个维度分解。  

**目标误泛化、过程监督与依赖性**:两个相邻研究方向与RGE有共同关注点但运行环境不同。目标误泛化研究追求与其训练目标不同的智能体,通常在强化学习环境中,失对齐是训练策略的属性\[31 (https://arxiv.org/html/2608.17718#bib.bib31)\]。RGE在部署时解决相关关切:智能体已固定,问题在于特定轨迹前缀是否已偏离其委托目标。过程监督使用步骤级奖励信号训练模型遵循正确推理步骤,改善中间计算与最终目标的对齐性\[32 (https://arxiv.org/html/2608.17718#bib.bib32)\]。RGE同样将中间行为视为监控对象,但其在不修改智能体且无步骤级奖励访问权的情况下实现,仅依赖轨迹本身暴露的信息。关于适当依赖性的研究询问用户何时应信任模型输出\[33 (https://arxiv.org/html/2608.17718#bib.bib33), 34 (https://arxiv.org/html/2608.17718#bib.bib34)\]。在RGE中,信任是轨迹本身的属性,由执行前缀是否仍对应委托任务定义。  

## 3 问题设置与信任表述  
### 3.1 任务设置  
我们研究长期智能体任务,其中智能体在环境中重复行动以追求用户委托任务 \(x\)。执行产生轨迹 \(\tau=(y_1,...,y_T)\),其中 \(y_t=(a_t,o_t)\),我们用 \(h_{\leq t}=(y_1,...,y_t)\) 表示其到步骤 \(t\) 的前缀,用 \(\theta_j\) 表示阈值。信任分解沿三个维度 \(j \in \{r,g,e\}\) 进行,对应角色、目标和证据。对于轨迹前缀 \(h_{\leq t}\),其信任状态为:  
\[
\phi_t = \begin{cases} \displaystyle\left(\prod_{j\in\{r,g,e\}}\frac{\max(0,\,z_{j,t}-\vartheta_{j})}{1-\vartheta_{j}}\right)^{1/3} & \text{if } z_{j,t} > \vartheta_{j} \text{ for all } j, \\[4.0pt] 0 & \text{otherwise.} \end{cases}
\]  
其中 \(z_{r,t}=r_t\),\(z_{g,t}=g_t\),\(z_{e,t}=e_t\)。几何平均值使 \(\phi_t \in [0,1]\)。我们在所有领域和估计模型中使用固定默认值 \(\alpha_r+\alpha_g+\alpha_e=1\)、\(\lambda=0.25\) 和 \(\vartheta_r=\vartheta_g=\vartheta_e=0.40\),无领域特定调优。  

监控器随后维护从 \(u_t\) 推导的紧凑时序状态:  
\[
s_t = \gamma s_{t-1} + u_t, \qquad m_t = s_t - s_{t-1}, \qquad c_t = \beta c_{t-1} + (1-\beta) u_t,
\]  
其中 \(s_t\) 是持续累积偏差,\(m_t\) 跟踪该累积是否仍在增加,\(c_t\) 是近期偏差的短期指数移动平均。干预严重性规则(附录E.5.4)使用 \(m_t\) 和 \(c_t\) 区分持续性恶化与瞬态尖峰。  

**决策规则**:单个敏感度参数 \(\kappa\) 确定所有阈值;我们全文使用 \(\kappa=0.5\)(表27)。监控器在以下情况触发轨迹级警报:\(u_t\) 超过瞬时阈值、\(s_t\) 超过累积阈值,或步骤被标记为重锚定或包含;仅警告则为正当化。从时序状态和解析器触发到标签的确定性映射见附录E.5.4。  

## 6 实验  
第4节表明步骤级信号无法恢复前缀是否仍对应授权任务,且RGE的三个坐标可以回溯性地恢复该信号。主要实验测试这些坐标是否支持在覆盖第3.3节两种威胁机制的跨领域语料库上进行在线前缀级监控。我们提出两个问题:在线监控器在每种机制中的表现如何?现有监控器是否...

相似文章

面向企业AI智能体的部署前保障:基于本体论的仿真与信任认证

arXiv cs.AI

研究人员提出了一种基于本体论的企业AI智能体部署前验证框架,结合了智能体操作包络、自动化场景生成以及可机器验证的信任证书与分级部署判定。在四个受监管行业开展的试点研究共生成1,800个测试场景,结果显示基于本体论的生成方法在监管覆盖率上显著优于基于角色的基线方法。