超越组件测试:验证智能体AI系统

arXiv cs.AI 论文

摘要

本综述综合了257篇关于智能体AI系统验证的论文,提出了一个涵盖行为、安全、时间、监管和多智能体问题的五维分类法。它指出了时间有效性、运行时证据维护、监管可读性和开放式多智能体保障方面的空白,认为可信赖的部署需要在上下文中验证轨迹。

arXiv:2607.29405v1 Announce Type: new 摘要:智能体AI系统通过多步轨迹运行,这些轨迹结合了规划、工具使用、记忆、交互和适应。这种行为将验证实践从组件测试和一次性输入-输出评估中拓展出来,因为可接受的系统行为现在取决于决策如何随时间并在不断变化的环境条件下展开。本综述综合了257篇涵盖智能体评估、软件保障、信息物理系统、运行时监控和监管指南的论文,以刻画智能体系统的验证问题。综述围绕一个五维分类法展开,涵盖行为、安全、时间、监管和多智能体问题,并利用该分类法映射现有方法、揭示反复出现的覆盖空白。分析表明,行为评估相对成熟,而时间有效性、运行时证据维护、监管可读性和开放式多智能体系统保障仍不完善。三个跨领域案例研究(医疗护理、工业运营、智能出行系统)提供了操作性例证,说明五个分类维度如何在安全关键环境中反复出现,这些例证基于所综述文献中记录的故障模式。论文最后提出了一个面向生命周期的研究议程,重点包括有界自主规范、对抗性轨迹生成、运行时监控和可审计的证据结构。核心主张是,智能体AI的可信部署取决于在上下文中验证轨迹,而不是仅仅评估孤立的组件。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:31

# 超越组件测试:验证智能体 AI 系统 来源:https://arxiv.org/html/2607.29405 \[3\]\\fnmStefano\\surSilvestri \[1\]\\orgdiv生物医学、牙科、形态与功能影像科学系,\\orgname墨西拿大学,\\orgaddress\\streetA\.O\.U\. Policlinico “G\.Martino” \- Via Consolare Valeria,\\city墨西拿,\\postcode98125,\\country意大利 2\]\\orgdiv工程系,\\orgname墨西拿大学,\\orgaddress\\streetContrada di Dio, Sant’Agata,\\city墨西拿,\\postcode98158,\\country意大利 3\]\\orgdiv意大利国家研究委员会高性能计算与网络研究所,\\orgnameICAR\-CNR,\\orgaddress\\streetVia Pietro Castellino 111,\\city那不勒斯,\\postcode80131,\\country意大利 4\]\\orgdiv国家大学间信息学联合会,\\orgnameCINI,\\orgaddress\\streetVia Ariosto, 25,\\city罗马,\\postcode00185,\\country意大利 ###### 摘要 智能体 AI 系统通过多步骤轨迹运行,这些轨迹结合了规划、工具使用、记忆、交互和适应。这种行为将验证实践扩展到组件测试和一次性输入-输出评估之外,因为可接受的系统行为现在取决于决策如何随时间以及在不断变化的环境条件下展开。本综述综合了 257 篇涵盖智能体评估、软件保证、信息物理系统、运行时监控和监管指导的论文,旨在刻画智能体系统的验证问题。本综述围绕一个五维分类法组织,涵盖行为、安全、时间、监管和多智能体关注点,并利用该分类法映射当前方法,揭示反复出现的覆盖缺口。分析表明,行为评估相对成熟,而时间有效性、运行时证据维护、监管可读性和开放式多智能体系统保证仍不发达。三个跨领域案例研究(医疗护理、工业运营、智能出行系统)提供了操作性示例,说明五个分类维度如何在安全关键场景中反复出现,并基于所综述文献中记录的失败模式。本文最后提出了一个面向生命周期的研究议程,重点关注有界自主性规范、对抗性轨迹生成、运行时监控和审计就绪证据结构。核心主张是,智能体 AI 的可信部署取决于在上下文中验证轨迹,而非仅仅评估孤立的组件。 ###### 关键词:智能体 AI,智能体系统,运行时验证,行为评估,软件验证与确认,AI 保证 ## 1 引言 ### 1.1 智能体转向 智能体人工智能(AI)系统越来越多地被部署为通过多步推理、规划、记忆、工具使用以及在不断变化的背景下适应来追求目标的软件系统\[luo2025,zou2025\]。这种转变改变了验证目标。经典软件组件主要对输入、状态和接口实现有界函数,而智能体系统必须作为在动态环境中作用于轨迹的策略来评估。因此,问题不再仅仅是组件是否返回正确的输出,而是整体系统是否随时间、跨交互以及在不断变化的操作条件下表现出可接受的行为。最近的智能体架构使这种转变变得具体。当代框架围绕感知、规划、工具调用、反思、记忆更新以及可能委派给其他智能体或服务的循环来组织执行\[autogen2025,luo2025\]。即使由熟悉的软件部分构建,如模型、应用程序接口(API)、检索模块、调度器和用户界面,其系统级行为也是从这些部分在轨迹中如何编排而涌现的,而非来自任何单个模块的孤立行为。结果是一种比主流测试抽象最初设计的系统更加开放式、历史依赖和环境耦合的软件架构。 ### 1.2 五种测试错配 软件工程已经为单元测试和回归测试\[myers2004,beizer1990\]以及集成测试和基于规范的验证\[ammann2016\]提供了成熟的基础。这些基础仍然是必要的。然而,它们主要是为那些相关行为在组件和接口层面相对可复现、可分解和可规范的系统开发的。智能体系统至少以五种反复出现的方式对这些假设提出挑战。 表 1:经典测试假设与智能体系统验证目标之间的五种抽象错配。表1 (https://arxiv.org/html/2607.29405#S1.T1)表明,单元测试、回归测试、集成测试和基于规范的测试仅覆盖了保证空间的一部分。验证问题从“组件是否返回了正确的输出?”扩展到“什么证据能够证明对该系统在现实轨迹和操作条件下行为的信任?”因此,既定的软件工程实践仍然必不可少,但需要针对智能体自主性进行扩展。第5节 (https://arxiv.org/html/2607.29405#S5)通过检查经典测试方法,回到这五种相同的抽象错配。在该比较中,故障注入被单独列出,因为它在表1 (https://arxiv.org/html/2607.29405#S1.T1)的五种错配中具体化了分解和环境关注点。 ### 1.3 为何现在进行以验证为中心的综述 三个发展使得以验证为中心的综述恰逢其时。第一个是综述版图中的空白。2024–2026年的智能体综述以越来越高的精度描绘了架构、能力、基准和评估实践\[yehudai2025,luo2025\],但它们按智能体*能做什么*来组织领域,而不是按在结果性部署之前和期间必须*证明*什么。正如表3 (https://arxiv.org/html/2607.29405#S3.T3)所明确指出的,在最近的相邻综述中,时间有效性和监管可读性很少被视为一等轴,而且几乎没有一篇基于系统筛选的文献库。现有文献的读者可以了解智能体是如何构建的以及它们的得分如何;而什么样的证据包能证明在部署中信任它们是合理的,这个问题文献尚未围绕其组织起来。第二个发展是治理时钟已经在运转。FDA 关于 AI 赋能设备软件和预定变更控制的指导,以及 MDCG 关于自适应 AI 的立场,已将生命周期证据、可追溯性和变更控制从愿望转变为操作期望。FDA 指导涉及 AI 赋能设备和预定变更控制\[fda\-aiedsflm2025,fda\-pccp2025\];MDCG 指导提供了补充性的欧洲期望\[mdcg2025\-6,mdcg2025\-10\]。这些文件说明了必须证明什么;而本应提供证明方法的工程文献仍然分散在本文综述的五个流中。这种碎片化的代价现在正由在临床、工业和出行环境中部署智能体系统的团队承担,他们面临着技术文献尚未操作化的证据期望。第三个发展是实证基础的快速整合:257 篇纳入论文中有 209 篇发表于 2025–2026 年(图2 (https://arxiv.org/html/2607.29405#S2.F2))。这种集中使得在评估规范仍在发展时综合智能体特定的验证工作成为可能。 ### 1.4 贡献 本综述做出四项贡献: 1. 1. 系统性文献综述。我们通过 PRISMA 启发的筛选,从 7,197 条检索记录中筛选出 257 篇纳入论文,综合了五个部分脱节的文献体系:经典软件工程(SE)测试、智能体框架评估、信息物理系统(CPS)验证、运行时保证和监管指导。 2. 2. 五维分类法。我们引入了一个独立的智能体系统验证挑战分类法,涵盖行为、安全、时间、监管和多智能体维度,每个维度都有明确的验证对象、特征失效模式和可度量指标。其独特选择是将时间有效性和监管可读性视为一等轴,而不是作为能力评估的附注——而这两个轴正是相邻综述最薄弱的方面(第6节 (https://arxiv.org/html/2607.29405#S6))。 3. 3. 量化缺口分析。我们从编码语料库中得出缺口:一个覆盖方法族和验证维度的矩阵识别出哪些配对是成熟的,哪些在结构上仍未得到充分解决,并带有对抗性敏感性边界,表明方向性主张在边界论文的最坏情况重新分配下仍然成立(第7节 (https://arxiv.org/html/2607.29405#S7))。 4. 4. 研究议程。我们将识别出的缺口转化为一个包含候选指标和软件工程目标的四方向验证栈,从对更好评估的通用呼吁转向具体的研究计划(第9节 (https://arxiv.org/html/2607.29405#S9))。 本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.29405#S2)描述综述方法。第3节 (https://arxiv.org/html/2607.29405#S3)沿五个验证轴组织先前文献。第4节 (https://arxiv.org/html/2607.29405#S4)定义智能体系统和扩展后的保证目标,而第5节 (https://arxiv.org/html/2607.29405#S5)分析哪些经典软件测试假设被打破,哪些仍然适用。第6节 (https://arxiv.org/html/2607.29405#S6)提出五维分类法,第7节 (https://arxiv.org/html/2607.29405#S7)将现有方法映射到其上以识别方向性缺口。第8节 (https://arxiv.org/html/2607.29405#S8)在三个关键领域中落地分类法,第9节 (https://arxiv.org/html/2607.29405#S9)发展研究议程,第10节 (https://arxiv.org/html/2607.29405#S10)讨论开放挑战,第11节 (https://arxiv.org/html/2607.29405#S11)总结。 ## 2 综述方法 ### 2.1 研究问题 本综述由四个研究问题组织:哪些经典软件测试假设对智能体系统失效(RQ1),一个全面的框架必须覆盖哪些验证维度(RQ2),现有方法如何在这些维度上分布(RQ3),以及从剩余缺口出发应遵循哪些研究方向(RQ4)。这些 RQ 直接映射到第5节 (https://arxiv.org/html/2607.29405#S5)、第6节 (https://arxiv.org/html/2607.29405#S6)、第7节 (https://arxiv.org/html/2607.29405#S7) 和第9节 (https://arxiv.org/html/2607.29405#S9)。 ### 2.2 检索策略 我们检索了五个主要数据库:ACM 数字图书馆、IEEE Xplore、Scopus、arXiv(cs\.SE、cs\.AI、cs\.MA、cs\.RO)和 Semantic Scholar。初始检索于 2025 年 1 月至 4 月进行,随后在 2026 年 1 月至 3 月之间进行了一次刷新,重新查询相同的五个来源以捕获新索引的 2025–2026 年出版物。本综述覆盖 2019 年 1 月至 2026 年 3 月的出版物,并有选择地纳入较早的基础性工作,这些工作定义了正在被挑战的经典基线。除非另有说明,下文报告的计数指两次检索后的合并集合。每个数据库都使用一个核心字符串查询,该字符串结合了智能体身份术语(“agentic,” “LLM agent,” “language model agent,” “autonomous agent”)、验证术语(“validation,” “assurance,” “verification,” “testing,” “evaluation”)和轨迹级术语(“trajectory,” “tool use,” “multi-step,” “stateful,”),并根据每个数据库的字段搜索语法进行调整。维度特定扩展添加了行为术语(例如“benchmark,” “trajectory consistency”)、安全术语(例如“runtime assurance,” “safe autonomy”)、时间术语(例如“concept drift,” “evidence freshness”)、监管术语(例如“assurance case,” “post-market surveillance”)和多智能体术语(例如“coordination,” “emergent behavior”)。我们还从智能体评估锚点论文\[luo2025,yehudai2025\]和 CPS 验证锚点论文\[collaco2026,zhao2026\]进行了前向和后向引文检索,并纳入了学术数据库中未索引的美国食品药品监督管理局(FDA)和医疗器械协调小组(MDCG)的监管文件。所有检索记录均附带书目元数据(包括标题、摘要、发表地点、年份和 DOI(如可用))导出,并整合到一个统一数据集中进行筛选和分析。综述过程遵循 PRISMA 启发的结构\[PRISMA\],明确报告去重、筛选和纳入阶段。两次检索后用于筛选的合并检索集合包含 7,197 条唯一记录。其中,7,125 条带有单一来源标签:4,575 条来自 IEEE Xplore,1,194 条来自 arXiv,709 条来自 ACM 数字图书馆,364 条来自 Semantic Scholar,283 条来自 Scopus。另有 72 条唯一记录来自上述两个或更多来源,作为单独的多来源来源类别保留,以便进行审计可追溯性。来自 FDA 和 MDCG 的监管和标准文件作为背景参考资料保留,但不计入筛选的论文语料库。仅 IEEE Xplore 就提供了单一来源记录的 64%(4,575/7,125),远高于 arXiv(1,194);第2.8节 (https://arxiv.org/html/2607.29405#S2.SS8)将回到这种偏差作为有效性的威胁。去重使用了标题和来源规范化,随后对模糊案例和跨来源匹配进行人工检查。 ### 2.3 纳入和排除标准 以下标准适用于所有三个筛选阶段。它们在筛选开始前定义并冻结,并一致应用于所有记录。纳入标准。如果一篇论文满足以下所有条件,则被纳入: - •I1:验证相关性。主要贡献必须涉及软件行为的验证、测试、确认、运行时监控、保证、基准测试、安全执行或可审计监督。 - •I2:智能体执行特征。被评估的系统必须在一个轨迹上执行,而不是单次推理步骤。为纳入语料库的目的,这要求*至少一个智能体执行特征*:跨步骤的显式规划、带反馈的工具调用、持久记忆/状态承接、与外部环境的闭环交互,或多个自主组件之间的协调。这些析取标准确保了以任何形式处理轨迹级验证的论文都可以进入语料库,即使它们没有强调所有三个典型的智能体属性。 - •I3:软件级范围。论文必须包含与智能体 AI、CPS、运行时保证或 AI 赋能软件工程相关的实质性软件或系统贡献。 - •I4:足够的技术内容。实证研究、基准论文、框架、形式化方法论文和技术报告只有在提供足够的方法论细节以支持分析性编码时才被纳入。 - •I5:时间和语言窗口。来源必须以英文发表,并在 2019 年 1 月至 2026 年 3 月的检索窗口内,除非是特意保留的基础基线来源。排除标准。如果一篇论文符合以下任一条件,则被排除:如果任何

相似文章

AI Agent 验证器

Reddit r/AI_Agents

一位开发者讨论了为AI智能体生成的图构建执行验证器的问题,图中节点通过输入和引用进行交互,并寻求关于使用测试账户还是图遍历进行验证的建议。