AgentAudit:一个用于 AI 代理全生命周期信任评估的开放、可扩展框架
摘要
AgentAudit 是一个开放且可扩展的框架,用于评估 AI 代理在能力、基础、安全和行为维度的全生命周期,实现精确的故障归因并突出不同语言模型之间的可信度差异。
arXiv:2609.09875v1 Announce Type: new
摘要:现有的评估框架大多只评估 AI 代理的一部分,例如任务完成(AgentBench)或安全稳健性(AgentDojo、ASB),而不是规划、工具选择、工具执行、记忆和推理的完整流程。故障可能在任何阶段发生,但现有基准很少能识别其精确来源。AgentAudit 评估整个执行轨迹,涵盖十个能力、基础、安全和行为维度,即指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实度、安全和执行完整性,结合行为分类和故障归因,以精确确定观察到的故障所负责的具体阶段。AgentAudit 可以评估任何基于 LLM 的 AI 代理,因为它附加到代理而不是替换它。它只读取记录的执行轨迹,不干扰代理的运行方式,因此对代理的内部实现不施加任何限制。我们评估了五种语言模型(OpenAI GPT-5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B 和 Gemini 2.5 Flash)在九项能力和对抗任务上的表现。Claude Sonnet 5 和 GPT-5 获得了最高的平均综合信任分数(分别为 95.1 和 80.6,满分 100),而 Sarvam 105B、Llama 3.3 70B 和 Gemini 2.5 Flash 则大幅落后(分别为 57.6、45.7 和 22.6)。所有轨迹均由一个固定的评判模型评分,该模型本身也是被评估的模型之一,这一局限性在第七节 E 部分中讨论。更重要的是,具有相似任务完成行为的模型在可信度上可能差异显著,因为多个非前沿模型在对抗任务上被反复分类为 Unsafe_Compliance,而不仅仅是失败,这是通过/失败基准无法显现的区别。
查看缓存全文
缓存时间: 2026/09/11 08:42
# AgentAudit:一个开放的、可扩展的AI智能体全生命周期信任评估框架 来源:https://arxiv.org/abs/2609.09875 查看PDF(https://arxiv.org/pdf/2609.09875) > **摘要**:现有的评估框架大多仅评估AI智能体的某一部分,例如任务完成(AgentBench)或安全稳健性(AgentDojo, ASB),而非完整的规划、工具选择、工具执行、记忆与推理流程。故障可能发生在任何阶段,但现有基准测试很少能精确定位故障的确切来源。AgentAudit通过十大能力、基础、安全与行为维度来评估整个执行轨迹,即指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实度、安全性和执行完整性,结合行为分类与故障归因,以精确定位导致观察到故障的确切阶段。AgentAudit可以评估任何基于LLM的AI智能体,因为它附加在智能体上而非取代它。它仅读取记录的执行轨迹,不干扰智能体的运行方式,因此不对智能体的内部实现施加任何限制。我们在九项能力与对抗任务上评估了五种语言模型(OpenAI GPT-5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B和Gemini 2.5 Flash)。Claude Sonnet 5和GPT-5获得了最高的平均复合信任评分(分别为95.1和80.6/100),而Sarvam 105B、Llama 3.3 70B和Gemini 2.5 Flash则明显落后(57.6、45.7和22.6)。所有轨迹均由一个固定的裁判模型评分,该模型本身是被评估的模型之一,这是一个在第七节E中讨论的局限性。更重要的是,具有相似任务完成行为的模型在可信度上可能差异显著,因为一些非前沿模型在对抗任务中被反复分类为“不安全的合规”,而不仅仅是失败——这种区别是通过/失败基准测试无法揭示的。 ## 提交历史 来自:Shrey Nag [查看邮件 (https://arxiv.org/show-email/40d070e9/2609.09875)] **[v1]** 2026年9月9日 星期三 08:29:16 UTC (2,606 KB)
相似文章
构建了一个开源工具,用于检测 AI 智能体系统中缺失的验证、重试和错误处理
我们发布了 Trustabl Agent Analyzer,一款开源工具,可扫描 AI 智能体仓库,检测缺失的验证、重试和错误处理,并生成保护隐私的本地报告。
其他人在AI可审计性方面也遇到困难了吗?
作者描述了一个AI可审计性的挑战,其中代理的决策缺乏与活跃策略版本的可追溯性,并就为AI代理决策构建有效决策路径寻求建议。
审计金融智能体的自我进化:能力提升、安全漂移与执行接口不匹配
本文审计了金融AI代理中的自我进化机制,揭示了能力提升的同时也伴随着安全风险,如提示注入漂移和执行接口不匹配,强调了全面审计的必要性。
审计自改进智能体中的框架篡改
该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。
坦白说:在实际生产中,你们是如何处理AI代理可审计性问题的?
一位从业者探讨了在生产环境中为AI代理实施审计跟踪的挑战,提及了一项供应商解决方案,并征求社区关于实际部署情况的意见。