长期智能体轨迹归因:统一基准与细粒度标注框架
摘要
本文介绍了面向长期智能体轨迹归因的统一基准与细粒度标注框架,支持在不同场景下评估主要归因定位和归因链恢复。它提供了来自现有智能体基准的超过1,300条标注轨迹,并发布了一个可复用的标注技能,用于规范未来的轨迹。
arXiv:2608.06909v1 公告类型:新
摘要:大型语言模型(LLM)智能体日益通过涉及用户指令、工具使用、外部观察和记忆的长期轨迹来运作。现有基准主要评估行为结果,但对细粒度归因分析的支持有限。我们引入了轨迹归因,并为此任务开发了一个基准和标注框架。该基准将异构轨迹统一组织在组件模式下,并提供主要归因组件的标注,以及适用的攻击链和执行链。通过使用 AgentDojo 以及 Agent3Sigma 的 Stage 和 Canary 设置中的轨迹实例化该基准,我们获得了超过 1,300 条标注轨迹,涵盖任务对齐行为、不安全行为和安全拒绝。该基准定义了两个评估任务:主要归因定位和归因链恢复,并提供了基于增量轨迹贡献和组件级留一扰动的参考基线。它捕获了不同的归因设置,包括局部和远程归因以及结构化归因链。参考基线结果在这些设置之间显示出显著的性能差异,初步刻画了基准的归因挑战。除了这一初步实例化之外,我们还发布了一个可复用的标注技能,使新智能体模型生成的轨迹能够在同一框架下进行标准化、标注和评估。项目资源和未来版本可在 https://github.com/chenjing-2024/agent-trajectory-attribution 获取。
查看缓存全文
缓存时间: 2026/08/10 07:59
# 一个统一的基准测试与细粒度标注框架
来源:https://arxiv.org/html/2608.06909
## 长时程智能体轨迹归因:一个统一的基准测试与细粒度标注框架
陈静 孙杨 张丽 徐林 石杰 华为技术有限公司
###### 摘要
大语言模型(LLM)智能体日益通过涉及用户指令、工具使用、外部观测和记忆的长时程轨迹来运行。现有基准测试主要评估行为结果,但对细粒度归因分析的支持有限。我们引入轨迹归因,并为此任务开发了一个基准测试和标注框架。该基准测试在一个统一的组件模式(component schema)下组织异构轨迹,并提供主归因组件(primary attribution component)的标注,以及在适用情况下的攻击链和执行链标注。使用来自AgentDojo以及Agent3Sigma的Stage和Canary设置中的轨迹来实例化该基准测试,可得到超过1,300条已标注轨迹,涵盖任务对齐行为、不安全行为和安全拒绝行为。该基准测试定义了两种评估任务——主归因定位(primary attribution localization)和归因链恢复(attribution-chain recovery)——并提供了基于增量轨迹贡献和组件级留一扰动的参考基线。它涵盖了多种归因设置,包括局部和长程归因以及结构化归因链。参考基线结果在这些设置之间表现出显著的性能差异,初步刻画了基准测试中的归因挑战。除这一初始实例化之外,我们还发布了一个可复用的标注技能,使新智能体模型生成的轨迹能够在同一框架下被标准化、标注和评估。项目资源和未来版本可在https://github.com/chenjing-2024/agent-trajectory-attribution获取。
## 1 引言
大语言模型(LLM)智能体正在从单轮助手迅速演变为能够进行长时程规划、多步推理、工具使用和记忆的自主系统(Wang等人,2024 (https://arxiv.org/html/2608.06909#bib.bib17))。这些能力使智能体能够与外部环境交互,并在扩展轨迹上做出决策(Liu等人,2024 (https://arxiv.org/html/2608.06909#bib.bib1);Debenedetti等人,2024 (https://arxiv.org/html/2608.06909#bib.bib3)),因此其行为不再由单个模型响应决定,而是源于整个轨迹中指令、观测、中间决策、工具交互和记忆的累积影响。因此,解释智能体行为需要对整个轨迹进行推理,而不仅仅是检查最终响应(Qian等人,2026 (https://arxiv.org/html/2608.06909#bib.bib7);Chen等人,2026 (https://arxiv.org/html/2608.06909#bib.bib9))。这类解释对于诊断失败、理解智能体决策以及评估安全关键行为日益重要。
尽管需求日益增长,现有的评估框架仍主要集中在行为结果上。当前的智能体基准测试衡量智能体是否完成任务、是否遵循安全约束,或是否受到对抗性攻击的影响。诸如AgentDojo(Debenedetti等人,2024 (https://arxiv.org/html/2608.06909#bib.bib3))和Agent3Sigma(Ma等人,2026 (https://arxiv.org/html/2608.06909#bib.bib18);Li等人,2026a (https://arxiv.org/html/2608.06909#bib.bib19))等基准测试提供了涉及多步交互、外部工具和对抗条件的真实环境,但它们主要用于评估任务成功率、鲁棒性和安全性。因此,它们能够确定行为是否发生,但对解释先前轨迹如何导致该行为的支持有限。这一局限性促使我们提出一个互补性的评估问题,重点是将观察到的行为归因于智能体轨迹中的各个组件。
我们将该问题称为*轨迹归因*(Qian等人,2026 (https://arxiv.org/html/2608.06909#bib.bib7))。给定一个观察到的智能体行为,轨迹归因旨在根据前序轨迹组件对该行为的贡献来识别并排序这些组件。相关组件可能是驱动成功完成任务的一条用户指令、诱发不安全行为的注入观测,或者触发拒绝行为的安全相关组件。通过区分用户指令、检索到的观测、工具输出、记忆内容以及其他轨迹组件的角色,轨迹归因为解释智能体行为提供了结构化基础。然而,现有工作缺乏具有统一归因目标、组件级真值标注和通用评估协议的标准化基准测试。因此,归因方法目前无法在不同智能体行为和轨迹结构之间进行一致性的评估或比较。
为了支持跨多样化智能体系统的轨迹归因,基准测试应满足若干关键设计需求。首先,它应为异构智能体轨迹提供统一的组件级模式,使来自不同智能体框架的用户指令、推理、工具交互、观测、记忆和其他执行记录能够在一个共同的归因接口下被标准化。其次,它应捕捉长程因果依赖,因为导致观察行为的组件可能与最终操作相隔许多中间交互步骤。第三,它应支持不同目标行为上的多样化归因结构。根据所解释的行为不同,归因可能需要识别单一主因,或恢复结构化的多步攻击链和执行链。最后,随着智能体系统的持续演进,它应保持可扩展性。由于不同模型和框架之间的轨迹格式、交互模式和执行环境差异很大,固定的基准数据集只能提供当前智能体行为的一个快照。因此,需要一种可复用的构建协议,以便在一致的归因框架下对新智能体系统生成的轨迹进行标准化、标注和评估。
基准测试 | 主要范围 | 执行派生轨迹 | 细粒度归因 | 结构化链 | 跨行为归因 | 模型自适应构建
--- | --- | --- | --- | --- | --- | ---
AgentBench | 通用智能体评估 | ✓ | ✗ | ✗ | ✗ | ✗
AgentDojo | 效用与安全评估 | ✓ | ✗ | ✗ | ✗ | ✗
Agent3Sigma | 智能体安全评估 | ✓ | ✗ | ✗ | ✗ | ✗
ATBench | 轨迹安全评估 | ✗ | ✗ | ✗ | ✗ | ✗
HINTBench | 轨迹风险定位 | ✗ | ✓ | ✗ | ✗ | ✗
Who&When | 失败归因 | ✓ | ✓ | ✗ | ✗ | ✗
TraceElephant | 失败归因 | ✓ | ✓ | ✗ | ✗ | ✗
Ours | 通用行为归因 | ✓ | ✓ | ✓ | ✓ | ✓
表1:与代表性智能体评估、轨迹安全和归因基准测试的比较。执行派生轨迹是通过在任务上运行智能体系统收集的,而非通过预定义的轨迹生成管道合成。跨行为归因指跨越任务对齐行为、不安全行为和安全拒绝行为的统一归因框架。模型自适应构建指一种可复用的协议,用于在相同归因框架下从新智能体模型生成、标准化和标注轨迹。
为了使轨迹归因在多样化的智能体系统间具有可复现性,我们围绕一个可复用的标注框架而非固定数据集来设计基准测试。该框架为异构智能体轨迹提供了通用的组件级模式、一种行为感知的标注方案(用于识别主归因组件以及在适用情况下的多步攻击链和执行链),以及涵盖任务对齐行为、不安全行为和安全拒绝行为的标准化评估协议。将该框架应用于代表性良性及对抗性智能体设置中的轨迹,可得到超过1,300条已标注轨迹。我们进一步评估了两种基于增量轨迹贡献和组件级留一扰动的代表性归因方法。为了支持未来扩展,我们发布了一个可复用的标注技能,使得新智能体模型生成的轨迹能够在同一框架下被标准化、标注和评估。
表1 (https://arxiv.org/html/2608.06909#S1.T1)展示了我们的工作与代表性智能体评估、轨迹安全和归因基准测试的相对位置。通用智能体基准测试(如AgentBench(Liu等人,2024 (https://arxiv.org/html/2608.06909#bib.bib1))、AgentDojo(Debenedetti等人,2024 (https://arxiv.org/html/2608.06909#bib.bib3))和Agent3Sigma(Ma等人,2026 (https://arxiv.org/html/2608.06909#bib.bib18);Li等人,2026a (https://arxiv.org/html/2608.06909#bib.bib19)))收集执行派生轨迹以评估任务性能、鲁棒性和安全性,但没有提供细粒度归因标注。ATBench(Li等人,2026b (https://arxiv.org/html/2608.06909#bib.bib6))和HINTBench(Wang等人,2026 (https://arxiv.org/html/2608.06909#bib.bib20))使用合成构建的轨迹资源支持轨迹级安全分析和风险定位,而Who&When(Zhang等人,2025 (https://arxiv.org/html/2608.06909#bib.bib8))和TraceElephant(Chen等人,2026 (https://arxiv.org/html/2608.06909#bib.bib9))则能够在执行轨迹上进行细粒度失败定位。然而,这些基准测试并未同时支持结构化归因链、跨不同行为类别的归因以及模型自适应的基准测试构建。相比之下,我们的框架将执行派生轨迹与组件级标注、结构化攻击链和执行链,以及涵盖任务对齐行为、不安全行为和安全拒绝行为的统一评估协议相结合。它进一步使新智能体模型生成的轨迹能够在同一协议下被标准化、标注和评估。
我们的贡献总结如下:
- •我们将*轨迹归因*定义为LLM智能体的一个独立评估问题,将智能体归因从失败定位扩展到任务对齐行为、不安全行为和安全拒绝行为。
- •我们提出了一个统一的组件级模式和行为感知标注框架,支持主归因以及适用情况下的多步攻击链和执行链。
- •我们将该框架实例化为一个大规模基准测试,包含来自代表性良性及对抗性智能体设置的超过1,300条轨迹,并带有经人工审核验证的LLM辅助标注。
- •我们建立了标准化的评估协议,并为增量式及组件级留一归因方法提供了参考结果。
- •我们发布了一个可复用的标注技能,使基准测试构建协议得以落地,从而使新智能体模型生成的轨迹能够在一致的归因框架下被标准化和标注。
## 2 相关工作
与我们工作最相关的研究分为两个方向:智能体评估基准测试和轨迹归因。前者为评估LLM智能体开发日益真实的执行环境和轨迹资源,后者则研究轨迹组件如何促成智能体行为。
### 2.1 智能体评估基准测试
AgentBench(Liu等人,2024 (https://arxiv.org/html/2608.06909#bib.bib1))和MultiAgentBench(Zhu等人,2025 (https://arxiv.org/html/2608.06909#bib.bib2))等交互式基准测试通过在单智能体和多智能体环境中的多步交互来评估LLM智能体。更近期的基准测试,包括AgentDojo(Debenedetti等人,2024 (https://arxiv.org/html/2608.06909#bib.bib3))和Agent3Sigma(Ma等人,2026 (https://arxiv.org/html/2608.06909#bib.bib18);Li等人,2026a (https://arxiv.org/html/2608.06909#bib.bib19)),进一步引入了工具使用、对抗性交互、持久化状态和长时程执行,以评估智能体的效用、鲁棒性和安全性。与此同时,ATBench(Li等人,2026b (https://arxiv.org/html/2608.06909#bib.bib6))等面向轨迹的基准测试整理了预先构建的执行轨迹,用于安全评估和风险分析。虽然这些基准测试提供了日益真实的环境和轨迹资源,但它们主要评估行为结果或安全属性,而非组件级因果归因。
### 2.2 轨迹归因
近期研究探讨了轨迹归因在行为理解、失败诊断和智能体安全中的应用。《行为背后的原因》(Qian等人,2026 (https://arxiv.org/html/2608.06909#bib.bib7))研究了历史轨迹组件如何影响智能体后续决策。Who&When(Zhang等人,2025 (https://arxiv.org/html/2608.06909#bib.bib8))、TraceElephant(Chen等人,2026 (https://arxiv.org/html/2608.06909#bib.bib9))、AgentRx(Bark等人,2026 (https://arxiv.org/html/2608.06909#bib.bib10))及相关工作(In等人,2026 (https://arxiv.org/html/2608.06909#bib.bib11);Shah,2026 (https://arxiv.org/html/2608.06909#bib.bib12))主要将归因形式化为失败定位,即识别责任智能体或关键失败步骤。其他方法,包括CausalArmor(Kim等人,2026 (https://arxiv.org/html/2608.06909#bib.bib13))和AttriGuard(He等人,2026 (https://arxiv.org/html/2608.06909#bib.bib14)),利用因果归因来提高针对对抗性行为的运行时安全性。相比之下,我们的工作通过引入统一的组件级标注和评估协议,将轨迹归因本身确立为一个标准化的评估问题,从而支持在多种智能体行为之间进行系统性比较。
## 3 智能体轨迹归因
轨迹归因旨在通过识别促成目标行为发生的轨迹组件,来解释LLM智能体为何产生该行为。与在单个模型输入上定义的常规归因问题不同,智能体轨迹归因作用于包含异构组件的多步执行轨迹,包括用户消息、智能体响应、工具交互、检索到的观测、记忆和系统指令。我们首先用一个简化示例说明标注结构,然后将轨迹归因形式化为一个组件级排序问题,接着介绍贯穿全文的参考归因结构和评估任务。
参考图注
图1:轨迹归因的示例。不安全的工具操作c4c_{4}是目标组件。被注入的工具观测c2c_{2}被标注为主归因,而c3c_{3}是额外的归因链组件。其余前序组件c1c_{1}属于候选集,但不包含在参考归因中。
图1 (https://arxiv.org/html/2608.06909#S3.F1)展示了基本标注格式。该轨迹由四个有序组件组成,其中c4c_{4}被视作目标行为,其前序组件构成候选集。参考归因将主组件c2c_{2}与额外的链组件c3c_{3}区分开来。这一简化示例捕捉了通用标注结构,而不引入后文所述的基准测试特有的攻击链和执行链类别。
### 3.1 轨迹归因问题
我们将轨迹归因形式化为一个在智能体执行轨迹上的组件级排序问题。一条智能体轨迹相似文章
StraTA:通过策略轨迹抽象激励智能体强化学习
StraTA 提出了面向长期任务 LLM 智能体的策略轨迹抽象方法,通过分层 GRPO 风格的 rollout、多样化策略采样和批判性自判断机制,在样本效率和最终性能上超越了前沿模型和先前 RL 基线。
TrajGenAgent:一种用于人类移动轨迹生成的分层LLM智能体
TrajGenAgent提出了一种分层LLM智能体框架,将宏观活动规划与微观时空实例化解耦,用于无需微调即可生成逼真的人类移动轨迹。它还引入了一种基于异常检测的评估方法,用于行为保真度。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
AgentAtlas:超越LLM代理的结果排行榜
本文介绍了AgentAtlas框架,该框架超越仅基于结果的LLM代理排行榜,通过提出六状态控制决策分类法和九类别轨迹故障分类法,更全面地评估代理行为。
保形智能体错误归因
本文提出了一种基于保形预测的多智能体系统错误归因框架,为识别智能体轨迹中的决定性错误提供统计保证。该方法通过在连续预测集中隔离错误,实现了自动恢复与调试。