标签
本文介绍了AgenticRAG-FP,一个用于智能体RAG系统中因果故障归因的干预基准,分析了故障如何在检索跳数间传播,并评估了诊断性能。
该论文引入了自诊断模型,用于在分布漂移下归因模型失败原因,将不确定性估计与失败归因联系起来。
本文介绍了OAT,一种用于基于LLM的智能体系统的轻量级故障归因工具。它仅使用成功轨迹进行训练,并利用神经控制微分方程检测错误步骤,在速度和精度上以数量级优势超越昂贵基线。
提出Oat,一种轻量级无监督方法,用于识别基于LLM的代理失败轨迹中的错误步骤。该方法利用仅在成功轨迹上训练的神经控制微分方程,在域内和域外设置下实现200-5000倍于提示基线的加速,并显著提升F1分数。
本文介绍了Who&When Pro,一个用于AI智能体系统中自动故障归因的大规模基准,包含26个基准上的12,326条故障轨迹,并提供了关于大语言模型如何归因故障的见解。
StepFinder 是一个轻量级框架,仅在特征构建阶段使用LLM将执行日志编码为时间语义序列,然后应用参数高效的时间与注意力模块进行多智能体系统的故障归因。在Who&When基准测试中,与最快的基于LLM的方法相比,推理时间减少了79%。
SkillAdaptor是一种无需训练的步骤级技能自适应框架,具有显式的失败归因能力,适用于LLM智能体,在WebShop、PinchBench和Claw-Eval上提升了性能。
本综述论文对基于LLM的多智能体系统进行了统一回顾,聚焦于协作、故障归因和自我进化,通过LIFE框架识别开放挑战,并提出跨阶段的研究议程。