A^2E:端到端智能体审计引擎

Hugging Face Daily Papers 论文

摘要

介绍了 A2E,一个面向智能体框架(harness)的端到端评估引擎,利用标准化任务协议和执行轨迹来评估效率、工具使用、规划以及错误恢复等能力。

随着大型语言模型(LLMs)的快速发展,框架(harnesses)已成为在广泛领域部署智能体的关键基础设施。快速演进的框架生态系统也使得严格的能力评估变得越来越重要。然而,高效地构建一个端到端、系统化且全面的评估流程仍然是一个重大挑战。为了解决这一挑战,我们引入了 A^2E(Agent Auditing Engine),一个专为智能体框架设计的端到端评估引擎。A^2E 利用我们新提出的智能体任务协议(ATP),能够快速将评估任务与不同的框架集成。通过自动插桩的监控器(Monitor),它在实验过程中捕获并生成标准化的执行轨迹。在评估阶段,A^2E 使用一套多维指标体系系统性地评估框架能力。与仅看正确性相比,这些指标能够更细粒度地刻画不同框架在执行效率、工具使用、任务规划和错误恢复方面的差异。使用 A^2E 进行的实验进一步表明,模型-框架组合在不同类型任务上表现出显著的性能差异,并且没有任何一种组合能够始终在所有任务上优于其他组合。这些发现不仅证明了系统评估的必要性,也为模型和框架的协同演进提供了有益的指导。我们的代码可在 https://github.com/datamllab/A2E 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/11 10:21

论文页面 - A^2E : 端到端智能体审计引擎

Source: https://huggingface.co/papers/2608.07346

摘要

A2E 是一个用于智能体框架的端到端评估引擎,它使用标准化的任务协议和执行轨迹来评估效率、工具使用、规划以及错误恢复等方面的能力。

随着大型语言模型 (https://huggingface.co/papers?q=large%20language%20models)(LLMs) 的快速发展,智能体框架已成为在广泛领域中部署智能体的关键基础设施。快速演进的智能体框架生态系统也使得严格的能力评估变得越来越重要。然而,如何高效地构建一个端到端、系统性且全面的评估流水线仍然是一个重大挑战。为了解决这一挑战,我们提出了 A^2E (Agent Auditing Engine),一个专为智能体框架设计的端到端评估引擎。A^2E 利用我们新提出的智能体任务协议 (https://huggingface.co/papers?q=Agent%20Task%20Protocol)(ATP),能够快速将评估任务与不同的智能体框架进行集成。通过自动插桩的监控器 (https://huggingface.co/papers?q=Monitor),它可以捕获并生成实验过程中标准化的执行轨迹 (https://huggingface.co/papers?q=execution%20traces)。在评估阶段,A^2E 使用一组多维指标 (https://huggingface.co/papers?q=multidimensional%20metrics) 系统地评估智能体框架的能力。与仅看正确性相比,这些指标能更细粒度地刻画智能体框架在执行效率 (https://huggingface.co/papers?q=execution%20efficiency)、工具使用 (https://huggingface.co/papers?q=tool%20use)、任务规划 (https://huggingface.co/papers?q=task%20planning) 和错误恢复 (https://huggingface.co/papers?q=error%20recovery) 等方面的差异。使用 A^2E 进行的实验进一步表明,模型与智能体框架的组合在不同类型的任务上表现出显著的性能差异,并且没有任何一种组合能够在所有任务上持续优于其他组合。这些发现不仅证明了系统评估的必要性,也为模型与智能体框架的协同演进提供了有益的指导。我们的代码可在 https://github.com/datamllab/A2E 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.07346)查看 PDF (https://arxiv.org/pdf/2608.07346)GitHub20 (https://github.com/datamllab/A2E)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.07346)

在你的智能体中获取这篇论文:

hf papers read 2608\.07346

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无关联此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.07346 即可从此页面链接到它。

引用此论文的数据集 0

暂无关联此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.07346 即可从此页面链接到它。

引用此论文的 Space 0

暂无关联此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.07346 即可从此页面链接到它。

包含此论文的收藏集 0

暂无包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

智能体的最终考试

Hugging Face Daily Papers

介绍智能体的最终考试(ALE),这是一个基准测试,用于评估AI智能体在长期、具有经济价值的现实世界任务上的表现,涵盖13个行业集群的1000多项任务,揭示了基准性能与实际部署之间的巨大差距。

EVE-Agent: 可验证证据的自我进化智能体

arXiv cs.AI

EVE-Agent 提出了一个自我进化搜索智能体框架,通过生成问题、答案和证据片段,并基于证据的边际准确性增益进行训练,确保证据可验证性。这提高了基于依据的正确性,且无需人工标注。