AgentAudit:一个用于 AI 代理全生命周期信任评估的开放、可扩展框架

arXiv cs.AI 论文

摘要

AgentAudit 是一个开放且可扩展的框架,用于评估 AI 代理在能力、基础、安全和行为维度的全生命周期,实现精确的故障归因并突出不同语言模型之间的可信度差异。

arXiv:2609.09875v1 Announce Type: new 摘要:现有的评估框架大多只评估 AI 代理的一部分,例如任务完成(AgentBench)或安全稳健性(AgentDojo、ASB),而不是规划、工具选择、工具执行、记忆和推理的完整流程。故障可能在任何阶段发生,但现有基准很少能识别其精确来源。AgentAudit 评估整个执行轨迹,涵盖十个能力、基础、安全和行为维度,即指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实度、安全和执行完整性,结合行为分类和故障归因,以精确确定观察到的故障所负责的具体阶段。AgentAudit 可以评估任何基于 LLM 的 AI 代理,因为它附加到代理而不是替换它。它只读取记录的执行轨迹,不干扰代理的运行方式,因此对代理的内部实现不施加任何限制。我们评估了五种语言模型(OpenAI GPT-5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B 和 Gemini 2.5 Flash)在九项能力和对抗任务上的表现。Claude Sonnet 5 和 GPT-5 获得了最高的平均综合信任分数(分别为 95.1 和 80.6,满分 100),而 Sarvam 105B、Llama 3.3 70B 和 Gemini 2.5 Flash 则大幅落后(分别为 57.6、45.7 和 22.6)。所有轨迹均由一个固定的评判模型评分,该模型本身也是被评估的模型之一,这一局限性在第七节 E 部分中讨论。更重要的是,具有相似任务完成行为的模型在可信度上可能差异显著,因为多个非前沿模型在对抗任务上被反复分类为 Unsafe_Compliance,而不仅仅是失败,这是通过/失败基准无法显现的区别。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:42

# AgentAudit:一个开放的、可扩展的AI智能体全生命周期信任评估框架
来源:https://arxiv.org/abs/2609.09875  
查看PDF(https://arxiv.org/pdf/2609.09875)

> **摘要**:现有的评估框架大多仅评估AI智能体的某一部分,例如任务完成(AgentBench)或安全稳健性(AgentDojo, ASB),而非完整的规划、工具选择、工具执行、记忆与推理流程。故障可能发生在任何阶段,但现有基准测试很少能精确定位故障的确切来源。AgentAudit通过十大能力、基础、安全与行为维度来评估整个执行轨迹,即指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实度、安全性和执行完整性,结合行为分类与故障归因,以精确定位导致观察到故障的确切阶段。AgentAudit可以评估任何基于LLM的AI智能体,因为它附加在智能体上而非取代它。它仅读取记录的执行轨迹,不干扰智能体的运行方式,因此不对智能体的内部实现施加任何限制。我们在九项能力与对抗任务上评估了五种语言模型(OpenAI GPT-5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B和Gemini 2.5 Flash)。Claude Sonnet 5和GPT-5获得了最高的平均复合信任评分(分别为95.1和80.6/100),而Sarvam 105B、Llama 3.3 70B和Gemini 2.5 Flash则明显落后(57.6、45.7和22.6)。所有轨迹均由一个固定的裁判模型评分,该模型本身是被评估的模型之一,这是一个在第七节E中讨论的局限性。更重要的是,具有相似任务完成行为的模型在可信度上可能差异显著,因为一些非前沿模型在对抗任务中被反复分类为“不安全的合规”,而不仅仅是失败——这种区别是通过/失败基准测试无法揭示的。

## 提交历史

来自:Shrey Nag [查看邮件 (https://arxiv.org/show-email/40d070e9/2609.09875)] **[v1]** 2026年9月9日 星期三 08:29:16 UTC (2,606 KB)

相似文章

审计自改进智能体中的框架篡改

arXiv cs.CL

该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。