TraceGraph:用于诊断和改进智能体轨迹的共享决策景观
摘要
TraceGraph是一个基于图的框架,它从多模型智能体轨迹中构建共享决策景观,从而能够诊断故障区域并通过陷阱感知恢复流水线进行改进。
arXiv:2605.31308v1 公告类型:新
摘要:智能体基准测试越来越多地记录丰富的交互轨迹,但评估往往将每次运行简化为通过率或奖励分数。我们引入了TraceGraph,这是一个基于图的框架,将发布的多模型智能体轨迹转化为共享决策景观。对于每个任务,TraceGraph在引入模型身份之前,从汇聚的运行中构建可观测的动作-观察状态图。然后,它叠加结果导向的生产核心和陷阱区域,并通过三个事件总结每次运行:访问、陷阱暴露和修复。跨五个基准测试分区的轨迹显示,TraceGraph的配置文件揭示了被聚合分数隐藏的导航差异,并显示不同分区在奖励避免陷阱还是从陷阱中恢复方面存在差异。同样的TraceGraph景观还为SWE-bench激发了一个陷阱感知恢复流水线:一个运行时检测器在与历史陷阱区域匹配的状态上触发,然后从相同前缀评估轻量级延续策略。在触发状态上,最佳汇聚的单因素策略将每个提供商标的触发子集上的官方解决率从40.4%提高到43.5%,在共同触发的实例上从41.0%提高到44.8%,并具有特定提供商的活跃组件。总体而言,TraceGraph提供了一个过程词汇,用于询问智能体基准测试测试了什么,模型在共享景观上在哪里分歧,以及故障区域如何指导下游改进。
查看缓存全文
缓存时间: 2026/06/01 09:27
# TraceGraph:用于诊断和改进智能体轨迹的共享决策景观 来源:https://arxiv.org/abs/2605.31308 查看 PDF(https://arxiv.org/pdf/2605.31308) > 摘要:智能体基准测试越来越频繁地记录丰富的交互轨迹,然而评估往往仅将每次运行简化为通过率或奖励分数。我们提出了 TraceGraph,这是一个基于图的框架,它将发布的多模型智能体轨迹转化为共享决策景观。对于每个任务,TraceGraph 在引入模型身份之前,利用收集到的多模型运行结果,构建一个包含可观察的动作-状态节点的图。然后,它在图上叠加基于结果信息的生产核心和陷阱区域,并用三个事件概括每条轨迹:进入(Access)、陷阱暴露(Trap exposure)和修复(Repair)。跨越五个基准测试分区的轨迹中,TraceGraph 的剖析图揭示了被聚合分数掩盖的导航差异,并表明不同分区在奖励避免陷阱还是从陷阱中恢复方面存在差异。同一个 TraceGraph 景观还启发了一种针对 SWE-bench 的陷阱感知恢复流水线:一个运行时检测器在状态匹配历史陷阱区域时触发,然后从相同前缀出发评估轻量级的延续策略。在触发状态下,针对每个提供者的触发子集,最佳的单一因子池化策略将官方解决率从 40.4% 提升到 43.5%;在共同触发实例上,从 41.0% 提升到 44.8%,并包含提供者特定的活跃组件。总体而言,TraceGraph 提供了一套过程词汇,用于询问智能体基准测试究竟在测试什么、模型在共享景观上的分歧点在哪里,以及故障区域如何指导后续改进。 ## 提交历史 来自:Junje Nian [查看电子邮件(https://arxiv.org/show-email/23d7ba74/2605.31308)] **[v1]** 2026年5月29日星期五 13:40:31 UTC(1,139 KB)
相似文章
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
TrajGenAgent:一种用于人类移动轨迹生成的分层LLM智能体
TrajGenAgent提出了一种分层LLM智能体框架,将宏观活动规划与微观时空实例化解耦,用于无需微调即可生成逼真的人类移动轨迹。它还引入了一种基于异常检测的评估方法,用于行为保真度。
SciTrace: 面向科学发现代理的轨迹感知安全推理
介绍SciTrace框架,该框架通过安全内禀推理循环和组合工具链验证器,将安全推理融入科学代理流程的每一个阶段,在保持输出质量的同时实现了最先进的安全性。
Trace2Policy:从专家行为痕迹到自我进化决策代理
Trace2Policy 从专家行为痕迹中提取人类可读的决策规则,并通过错误驱动的技能精炼进行迭代优化,在物流领域的合规敏感任务上优于纯LLM基线。