负责任的代理AI需要显式溯源
摘要
本文认为,在整个代理AI生命周期的显式溯源是使责任可计算和可操作的结构性必要条件,解决了自主组合中涌现危害的责任缺口。
arXiv:2605.17169v1 Announce Type: new
摘要:代理AI正在迅速渗透到软件工程等各种现实领域,但公众信任却未能跟上。核心原因是,尽管责任被广泛讨论,但它仍然是一个主观且未强制实施的概念,因为当前的代理框架都无法产生可量化、可追踪且可干预的溯源信息,以便在非单一设计方导致的组合中出现伤害时进行责任分配。我们认为,缺失的不是更好的基准级评估,而是整个代理生命周期的$\textbf{显式溯源}$,这是使责任可计算和可操作的唯一可行基础。我们从四个方向推进这一议程:通过识别社会技术维度的责任缺口,确立$\textit{为什么}$这种溯源是结构性必要;通过因果归因函数和责任张量形式化$\textit{什么}$必须被编码;通过初步实验表明在不可逆伤害累积之前,溯源可以在线估计和干预,从而讨论$\textit{如何}$在四个生命周期层中使其可计算;并通过一个具体的代理事件审视$\textit{谁}$承担的责任。显式溯源不是一种可选的改进,而是负责任代理AI的必要条件,其生态系统中的任何利益相关者都不能将其视为可选。
查看缓存全文
缓存时间: 2026/05/19 06:39
# 负责任的智能体AI需要显式溯源 来源:https://arxiv.org/html/2605.17169 胡金伟¹,黄新苗¹,何其松¹,孙有成²,董毅¹,黄晓薇¹ ¹英国利物浦大学计算机科学与信息学院 ²阿联酋穆罕默德·本·扎耶德人工智能大学计算机科学系 ###### 摘要 智能体AI正在软件工程等多个真实领域迅速普及,但公众信任却未能同步提升。核心原因在于,尽管责任被广泛讨论,它仍然是一个主观且无法强制执行的概念——当伤害源于任何单一参与方都未曾设计的组合行为时,当前没有任何智能体框架能够产生分配责任所需的可量化、可追踪且可干预的溯源信息。我们认为,缺乏的并非更好的基准评估,而是在整个智能体生命周期中的**显式溯源**,这是使责任变得可计算和可操作的唯一可行基础。我们从四个维度推进这一议程:通过识别社会技术维度上的责任鸿沟,确立**为何**这种溯源是结构性必然;通过因果归责函数和责任张量,形式化**溯源必须编码什么**;讨论**如何**使其在四个生命周期层上可计算,并通过初步实验表明,在不可逆伤害累积之前,溯源是可在线估计和可干预的;以及通过一个具体的智能体事故案例,审视**谁**应承担责任。显式溯源不是可选的改进,而是负责任的智能体AI的必要条件,其生态系统中的任何利益相关方都不能将其视为可选项。 ## 1 引言 参考图1 **图1:** 基于组件的可信AI独立审核各组件(1),但智能体AI将其嵌入长期行为循环中,产生涌现性伤害、意料之外的组合后果和弥散的责任(2)。弥补这一鸿沟需要在负责任的智能体AI的整个生命周期中提供显式溯源,我们通过四个维度(3)进行论证。 人工智能(AI)近期在其行动范围上经历了三次转变。早期的AI系统主要是反应式的:输入进,输出出。第二代系统,基于大语言模型(LLM)¹ ² ³,将关注点从预测转向了开放式文本生成。第三次转变正在进行:**智能体AI**,其中模型被嵌入自主行动循环,配备工具和持久记忆,集成到多智能体流水线中,并被授权在长期范围内规划、执行和修订决策⁴ ⁵ ⁶。这一转变改变了关注对象:一个智能体系统不仅仅是回答问题,而是在现实世界中行动——预订航班、执行代码、发送邮件,并与其他自主系统协作,通常很少或没有人工干预⁷ ⁸ ⁹ ¹⁰ ¹¹。 然而,尽管普及迅速,企业调查报告显示,实际采用率远低于发展速度,组织扩大能力的速度快于其愿意委托权限的速度²⁷ ²⁹。实际后果是源于信任赤字的采用瓶颈。用户、组织和监管机构不愿将重要权限授予那些行为无法留下决策如何达成、由谁达成以及通过何种因果链条的可追溯记录的系统。这并非非理性的谨慎,而是对结构性问责缺失的可预见反应:当伤害发生时,各方相互推诿,责任在可被分配之前就已消散。责任已在可信AI文献中被广泛讨论¹² ¹³,但从未在整个智能体生命周期中变得可计算或可操作——并非因为缺乏规范性词汇,而是因为缺乏显式溯源。考虑一个案例:单独审计的技能均通过安全审查,但它们在基于LLM的智能体中的组合却导致了任何技能级审计都无法发现的监管违规行为:没有任何一方可以被追责,恰恰因为在部署前未指定责任边界来界定各方的义务,并且没有记录有害轨迹是如何共同产生的。 这种失败并非偶然,而是结构性的,因为智能体系统中的伤害并不存在于任何单一组件,而是源于系统级的轨迹、组合和分布式因果链,任何个体审计都无法检查¹⁵。现有记录围绕单组件故障设计,因此过于粗糙,无法支持跨参与方的因果责任归因或其可追溯性;并且其事后性质意味着,只有在伤害已经发生之后才能进行干预⁴³。**因此,我们认为,负责任的智能体AI必须在整个生命周期中是可量化、可追踪和可干预的,而显式溯源是使责任可计算和可操作的必要基础设施。** 没有它,责任仍是一个无法分配或强制执行的主观概念;而基准驱动的评估,虽然对组件级能力是必要的,但既无法触及组合行为,也无法产生责任所需的因果归因。 因此,本文沿着四个维度推进一个基于溯源的可计算和可操作的责任议程,用于智能体AI。我们首先确立**为何**显式溯源是结构性必然而非可选改进,识别社会技术责任鸿沟(第3节)。然后,通过因果归责函数和责任张量,形式化智能体语境中**溯源必须编码什么**(第4节)。我们讨论**如何**使责任在四个生命周期层上可计算,并通过初步实验验证,在不可逆伤害累积之前,因果贡献是在线可估计的(第5节)。最后,通过将责任张量应用于一个具体的智能体事故案例,审视**谁**应承担责任,展示溯源如何分配义务(第6节)。 ## 2 背景 智能体AI现已出现在从软件自动化到专业决策支持的多个领域¹⁶ ¹⁷ ¹⁸ ¹⁹ ²⁰。因此,我们采用一个通用的功能定义,聚焦于使这些系统具有影响力的能力。 ###### 定义 2.1 (智能体AI系统) 一个智能体AI系统将一个或多个基于LLM的智能体置于一个感知-行动循环中,该循环包含:(i) **工具访问**,(ii) **持久记忆**,(iii) **多步骤规划**,以及 (iv) **自我修正**,并可选择性地与其他智能体协调。 **智能体的采用速度已超过责任结构的发展速度。** 前沿提供商正在将使用工具、操作计算机和完成多步骤任务的智能体产品化,而像OpenClaw和ClawHub这样的开放生态系统则展示了第三方技能市场的兴起,智能体可以通过外部编写的能力进行扩展²¹ ²² ²³ ²⁴ ²⁵。企业调查证实,采用已具规模:麦肯锡报告称,23%的受访者正在扩展智能体AI系统,另有39%在进行试验;普华永道报告称,79%的高管表示AI智能体已在公司内部得到采用²⁶ ²⁸。然而,责任结构仍不成熟,麦肯锡指出了治理和风险管理方面的持续差距,德勤则形容智能体AI的发展速度快于其防护栏的建设²⁷ ²⁹。因此,智能体AI不仅仅是能力的前沿,也是责任的前沿。 **与可信AI及相关工作的关系。** 可信AI范式已围绕模型级属性、基准评估和红队测试组织了安全措施³⁰ ³¹ ³²,但智能体部署暴露了三个结构性限制。风险是**组合性的**:已验证的独立组件属性在交互后可能不复存在¹¹。评估是**脆弱的**:任务完成可能与安全性、合规性和危害性控制产生分歧³³ ³⁴ ³⁵。问责是**弥散的**:有害结果源于跨开发者、平台和部署者的多步骤轨迹,任何单一组件的审计都无法重构³⁶。现有的问责工作为审计和机构监督提供了基础³⁷ ³⁸,但假设了有界决策和可检查系统——而智能体AI已使这些假设过时:伤害可能源于长期轨迹、持久记忆和任何单一行动者都未曾端到端设计或控制的第三方技能。道德哲学、法律理论和AI治理中的责任论述是广泛的⁴⁰ ⁴¹ ⁴²,然而当伤害源于组合性的智能体行为而非任何可识别的单一决策时,这些工作均未能产生使责任可计算的显式溯源。 ## 3 为何负责任的智能体AI需要显式溯源 纵观第2节中识别出的限制,由于没有任何参与方能够产生在伤害源于各自合规的组件时分配责任所需的显式溯源,责任仍然是不可计算的。因此,我们刻画任何负责任的智能体系统必须满足的条件。 ###### 命题 3.1 (负责任智能体AI的结构性要求) 一个负责任的智能体系统需要满足三个属性的显式溯源。第一,**可量化性**,即为每个组件及相应参与方产生可测量的因果归因。第二,**可追踪性**,即基于经过因果验证的执行记录和认识论立场来落实责任归属。第三,**可干预性**,即持续产生溯源,使得智能体系统在整个生命周期中保持可拦截和可恢复的状态。 以下分析针对每个属性,展示了其缺失为何会导致相应的社会技术维度无法解决。这八个维度是代表性的而非详尽无遗的,综合自负责任AI的相关文献⁴⁰ ⁴⁵ ⁴⁶ ⁵⁰ ⁵⁷ ⁶¹ ⁴¹。 ### 3.1 责任鸿沟的社会技术证明 #### 可量化性 **法律**和**道德**都需要一个可识别的因果主体,其对伤害的贡献可以被确立。没有参与方“制造”了智能体的组合,因此当伤害是组件交互而非任何单个组件的属性时,欧盟AI责任指令的过错推定就无法适用⁴⁶ ⁴⁷ ⁴⁸ ⁴⁹ ⁵⁰。在道德上,智能体的因果关系分布在开发者、技能维护者和平台运营者之间,其比例是任何参与方都未曾设计或预期的,因此没有一方能达到可谴责性的门槛,受害者也无法找到追责对象⁴⁵ ⁵¹ ⁵²。在技术层面,**标准**只有在规定了系统必须产生何种因果归因以证明其负责任部署时,才能使责任变得可操作;否则,每一方都按自己的方式定义负责任部署,不存在客观标准来判断任何义务是否被履行或违反⁶¹ ⁶²。**监管**面临同样的依赖。强制性要求只有规定了各方作为市场准入前提条件必须产生何种可量化的归因时,才能弥合问责鸿沟,因为在开放的智能体市场中,组合安全测试产生集体效益但带来私人成本,在缺乏此类要求的情况下,零投入是理性的个体选择⁵⁷ ²⁷ ²⁹。没有可量化性,任何法律、道德、基于标准或监管的框架都无法识别哪个
相似文章
智能体需要身份标识
文章认为,当AI智能体在共享工作空间中自主执行操作时,必须为每个操作明确归属到智能体及其负责的人类,以确保监督和信任。没有适当的身份和审计追踪,团队无法安全地将更复杂的任务委托给智能体。
你的AI代理刚刚生成了另一个代理,那么谁该为发生的事情负责?
本文讨论了在多代理AI编码工作流中维护审计跟踪的挑战,强调了代理身份、委托和溯源对于管理责任和控制的必要性。
AI代理即将制造一个无人愿意承担的责任问题
随着AI代理从提供答案转向在实际工作流程中采取行动——例如处理付款、客户数据和审批——其错误缺乏明确问责制成为了一个关键问题。
正确不等于受治理:智能体工作流中的溯源完整性
本文介绍了Matrix,一个用于智能体工作流的确定性因果状态层,它记录权威与事实依赖、验证完成证据,并选择性地使过期工作失效,以确保受治理的执行和可审计性。
重绘AI地图:智能体生态系统中的责任边界理论
本文引入了责任资产和规则债务,提出了一种关于智能体AI编排器如何影响组织边界的理论,论证了责任约束限制了技术可分解性带来的模块化效应。