面向代理基础设施的代理分析:基于LLM的DAO与企业AI协议比较治理流水线
摘要
本文介绍了一个基于LLM的比较流水线,用于分析AI代理协议中的治理话语,并将其应用于ERC-8004和Google A2A,以考察制度设计如何塑造主题优先级和社区结构。
arXiv:2606.26203v1 Announce Type: new
摘要:随着AI代理协议的激增,塑造其互操作性标准的治理结构在实证上仍未得到充分研究。我们引入了一个基于LLM的大规模治理话语分析比较流水线,整合了自动标注、神经主题建模和多层网络分析,以大规模研究社会技术权力结构。我们将其应用于两种对比鲜明的代理互操作性标准:ERC-8004(无许可、链上)和Google A2A(企业主导)。通过分析4,323条治理参与记录,我们结合LLM辅助编码、主题建模和多层网络分析,考察制度设计如何塑造主题优先级和社区结构。我们发现,尽管治理形式影响实质焦点,但两种体制在参与不平等性和社区碎片化程度上表现相似。无许可环境中的话语对齐更为紧密,这表明开放治理可能在去中心化参与的情况下促进更大的主题趋同。这些发现展示了LLM辅助方法如何推进技术治理的实证研究,并为设计更公平的代理AI标准提供了启示。所有数据和代码均已公开可用。
查看缓存全文
缓存时间: 2026/06/26 05:11
# 面向智能体基础设施的代理式分析:一个由大语言模型驱动的 DAO 与企业 AI 协议比较治理流程 来源:https://arxiv.org/html/2606.26203 张璐娅(Luyao Zhang) 昆山杜克大学 中国昆山 \(2026\) ###### 摘要。 随着 AI 智能体协议的激增,塑造其互操作性标准的治理结构在实证层面仍未被充分研究。我们引入了一个由大语言模型(LLM)驱动的比较分析流程,用于大规模治理话语分析,该流程整合了自动标注、神经主题建模和多层网络分析,以研究社会技术权力结构。我们通过对两个对比鲜明的智能体互操作性标准进行验证:ERC-8004(无许可、链上)和 Google A2A(企业主导)。在分析了 4,323 条治理参与记录后,我们结合了 LLM 辅助编码、主题建模和多层网络分析,以考察制度设计如何塑造主题优先级和社区结构。我们发现,虽然治理形式影响实质焦点,但两种制度在参与不平等和社区碎片化程度上表现出相似的水平。在无许可环境下,话语对齐更为密集,这表明开放治理可能促进了更大的主题趋同,尽管参与是去中心化的。这些发现说明了 LLM 辅助方法如何推动技术治理的实证研究,并为设计更公平的智能体 AI 标准提供了启示。所有数据和代码均已公开提供。 DAO 治理,联盟治理,AI 智能体,LLM 研究流程,区块链 ††会议:ACM 会议名称;日期,地点††期刊年:2026††ISBN:978-x-xxxx-xxxx-x/YY/MM††DOI:10.1145/nnnnnnn.nnnnnnn ## 1. 引言 互操作性是去中心化应用的内在特征(Harvey and Rabetti, 2024 (https://arxiv.org/html/2606.26203#bib.bib46))。随着 AI 智能体协议的激增,其互操作性标准的治理在实证上仍未被充分研究。谁控制着自主智能体跨组织边界发现、协商和协调的规则?这个问题处于人工智能和制度设计的交汇点(Evans et al., 2026 (https://arxiv.org/html/2606.26203#bib.bib2);World Economic Forum and Accenture, 2026 (https://arxiv.org/html/2606.26203#bib.bib5)),然而,用于协商此类标准的公共话语一直难以大规模研究。先前的工作主要依赖于使用固定类别的手动编码,这限制了对大型文本语料库的主题发现和结构分析。 我们通过一个由 LLM 驱动的比较分析流程来解决这一空白,该流程用于大规模治理话语分析,整合了自动标注、神经主题建模和多层网络分析。我们通过两个标准对该流程进行了验证:ERC-8004 和 Google A2A。这两个协议解决了跨系统 AI 智能体通信的相同技术问题,并且它们的治理过程在 GitHub 或论坛上公开。因此,对它们进行比较可以隔离治理形式对参与者以及讨论内容的影响。 ERC-8004 属于以太坊改进提案(EIP),定义了一个链上 AI 智能体身份的智能合约接口标准。它“提议使用区块链来发现、选择并与跨组织边界的智能体进行交互,而无需预先存在的信任”(Ethereum Magicians, 2025 (https://arxiv.org/html/2606.26203#bib.bib12))。其生命周期遵循 EIP-1 中定义的阶段,并通过论坛参与者和 EIP 编辑之间的粗略共识推进,没有正式投票,实现无许可(Ethereum Foundation, 2015 (https://arxiv.org/html/2606.26203#bib.bib13))。Google A2A 引入了“一个开放协议,支持不透明智能体应用程序之间的通信和互操作性”(A2A Authors, 2025a (https://arxiv.org/html/2606.26203#bib.bib14))。它由 Google 发起,并于 2025 年 6 月捐赠给 Linux 基金会,目前由一个完全由企业代表组成的八人技术指导委员会(TSC)管理(A2A Authors, 2025b (https://arxiv.org/html/2606.26203#bib.bib15);Google Cloud, 2025 (https://arxiv.org/html/2606.26203#bib.bib16))。 比较这两个案例,我们提出如下问题: 研究问题(RQ):与层级制的企业结构相比,无许可的 DAO 治理结构是否真正实现了更高程度的去中心化? 我们将此分解为三个子问题: - •RQ1(决策架构):两种制度的正式决策程序、进入权利和权力结构有何不同? - •RQ2(话语构成):治理形式如何塑造参与话语的主题和论证构成? - •RQ3(关系网络):治理形式如何塑造共同参与关系、话语层面的共识与冲突结构,以及行动者-主题之间的协作分工? 为了回答这些问题,我们首先从其官方文件中重构了这两种治理机制,并将其可视化为决策流程图。然后,我们从它们的公共存储库中收集了 4,323 条治理参与记录,并应用 LLM 辅助标注流程,对每条记录的论证功能、立场和利益相关者归属进行标注(Carlson and Burbano, 2026 (https://arxiv.org/html/2606.26203#bib.bib17))。在此标注基础上,我们运行了两种主题发现方法:无监督的 BERTopic(Grootendorst, 2022 (https://arxiv.org/html/2606.26203#bib.bib18))和 LLM 归纳式 Thematic-LM(Qiao et al., 2025 (https://arxiv.org/html/2606.26203#bib.bib19))。此外,我们运行了三种网络分析:共同参与的社会网络分析(SNA)(Ao et al., 2023 (https://arxiv.org/html/2606.26203#bib.bib20))、话语网络分析(Leifeld, 2013 (https://arxiv.org/html/2606.26203#bib.bib21))以及社会语义二分网络(Roth and Cointet, 2010 (https://arxiv.org/html/2606.26203#bib.bib22))。这三种方法对应于三个子问题。 出现了三项发现。首先,这两个案例体现了结构上相反的决策架构:ERC-8004 通过粗略共识推进,无许可部署,而 A2A 则将约束性权力赋予一个企业技术指导委员会。其次,治理形式塑造了讨论的主题焦点:DAO 治理将话语集中在安全机制和协议原则上,而企业治理则将讨论分散到工程执行工作流中。第三,两种网络在参与不平等和社区碎片化程度上表现出相似水平;然而,ERC-8004 中的话语一致性更高,反映了更紧密的社区内部共识形成。 本文做出三项贡献。在方法论上,该架构可推广到任何大规模治理话语分析,为公共文本协商、沟通和协调的黑箱提供一个计算视角。在实证上,它提供了第一个匹配案例、多方法的 DAO 与企业治理智能化标准的大规模文本语料库比较。在理论上,它开创了关于谁控制未来 AI 智能体基础设施这一基本问题的研究,具有制度设计与 AI 的跨学科地位。 ## 2. 相关工作 三条研究线索汇聚于本研究。更具体的比较,请参见附录 H (https://arxiv.org/html/2606.26203#A8)。 ### 通过区块链实现去中心化治理。 首先,Harvey 对去中心化金融(DeFi)和区块链技术固有的技术、理论和实践进行了全面概述(Harvey et al., 2021 (https://arxiv.org/html/2606.26203#bib.bib29))。Beck 等人(Beck et al., 2018 (https://arxiv.org/html/2606.26203#bib.bib30))提供了基础的信息系统框架,沿决策权、责任和激励维度映射区块链治理。Ziolkowski 等人(Ziolkowski et al., 2020 (https://arxiv.org/html/2606.26203#bib.bib31))确定了区块链系统特有的六个主要治理挑战,其中一半是该技术独有的。Kiayias 和 Lazos(Kiayias and Lazos, 2023 (https://arxiv.org/html/2606.26203#bib.bib32))通过区块链治理机制的 SoK 综述系统化了该领域。最近,Ellinger 等人(Ellinger et al., 2024 (https://arxiv.org/html/2606.26203#bib.bib8))探索了数字公地的平衡多中心治理。Reineke 等人(Reineke et al., 2025 (https://arxiv.org/html/2606.26203#bib.bib9))开发了一个综合性的理论框架,展示了去中心化概念的演变。Sunyaev 等人(Sunyaev et al., 2026 (https://arxiv.org/html/2606.26203#bib.bib28))呼吁有目的、面向设计的去中心化,而不是止步于意识形态。Motea 和 Oba(Motea and Oba, 2026 (https://arxiv.org/html/2606.26203#bib.bib33))质疑了区块链治理结构的民主合法性。 ### 去中心化与企业结构的治理。 Murray 等人(Murray et al., 2021 (https://arxiv.org/html/2606.26203#bib.bib34))检验了智能合约和 DAO 如何改变企业合约中的代理成本,提供了领先观点。Lumineau 等人(Lumineau et al., 2021 (https://arxiv.org/html/2606.26203#bib.bib35))强调了交易的默示性和该技术的社会影响。Rahman 等人(Rahman et al., 2024 (https://arxiv.org/html/2606.26203#bib.bib36))和 Hunt 等人(Hunt et al., 2024 (https://arxiv.org/html/2606.26203#bib.bib37))分析了平台的动态和权力积累。Hui 和 Tucker(Hui and Tucker, 2025 (https://arxiv.org/html/2606.26203#bib.bib38))将 AI 与去中心化生态系统相结合,提出了一个创新的治理框架。然而,这些研究依赖于理论或访谈方法;没有一项使用治理参与数据或计算方法来检验 DAO 与企业治理在同一领域内的结构性差异。 ### 合作工作的计算研究。 研究人员长期以来一直研究开放、在线社区中的协调。Mockus 等人(Mockus et al., 2002 (https://arxiv.org/html/2606.26203#bib.bib39))记录了 Apache 和 Mozilla 中的参与不平等。Im 等人(Im et al., 2018 (https://arxiv.org/html/2606.26203#bib.bib23))分析了 Wikipedia 的征求意见(RfC),这是一种结构上类似于 EIP 粗略共识的审议机制,揭示了审议与解决之间持续存在的不平衡。Germonprez 等人(Germonprez et al., 2018 (https://arxiv.org/html/2606.26203#bib.bib26))编录了当代开源项目的结构现实,包括普遍存在的企业参与;Li 等人(Li et al., 2021 (https://arxiv.org/html/2606.26203#bib.bib25))研究了 GitHub 上的行为准则对话,将其视为开源仓库中非正式治理规范的一个窗口。Kulakowski 和 Frasincar(Kulakowski and Frasincar, 2023 (https://arxiv.org/html/2606.26203#bib.bib41))引入了 CryptoBERT,这是一个领域适应的 BERT 变体,在 320 万条加密货币社交媒体帖子上预训练,为区块链原生语料库建立了专门的嵌入支柱。最近,Wu 等人(Quan et al., 2024 (https://arxiv.org/html/2606.26203#bib.bib42))将情感和话语分析应用于六个 DAO 论坛;Stine 和 Agarwal(Stine and Agarwal, 2020 (https://arxiv.org/html/2606.26203#bib.bib24))提出了通过主题模型进行比较话语分析;Qiao 等人(Qiao et al., 2025 (https://arxiv.org/html/2606.26203#bib.bib19))引入了 Thematic-LM,用于 LLM 辅助的大型语料库归纳式主题分析;Ao 等人(Ao et al., 2023 (https://arxiv.org/html/2606.26203#bib.bib20))使用链上 Aave 数据的社会网络分析,展示了投票权集中;Leifeld(Leifeld, 2013 (https://arxiv.org/html/2606.26203#bib.bib21))提出了话语网络分析,聚焦于参与者的立场;Roth 和 Cointet(Roth and Cointet, 2010 (https://arxiv.org/html/2606.26203#bib.bib22))将语义分析与社会拓扑联系起来。Wang 等人(Wang et al., 2025 (https://arxiv.org/html/2606.26203#bib.bib43))通过对规模化的 SnapShot 数据进行分析,发现了权力集中的威胁。Özdemir Sönmez 等人(Jungnickel et al., 2025 (https://arxiv.org/html/2606.26203#bib.bib10))量化了 DAO 治理模型中的投票权集中和参与冷漠,特别是在基于代币的组织中。Chen 等人(Chen et al., 2025 (https://arxiv.org/html/2606.26203#bib.bib44))将准实验性 PSM-DID 设计应用于 98,000 名 Steemit 用户,发现治理代币持有增加了策展努力,但降低了创作新颖性。 ## 3. 方法论 我们选择了 MiniMax-M2.5 (MiniMax, 2026 (https://arxiv.org/html/2606.26203#bib.bib48)) 作为 LLM 骨干,因其推理能力和低成本。该模型在复杂的真实世界环境中训练,并在 SWE-Bench Verified 上达到了 80.2% 的准确率;此能力级别的尖端模型已被证明能够高度可靠地完成复杂的多轮分析任务 (Ma et al., 2024 (https://arxiv.org/html/2606.26203#bib.bib1)),使其适合于分配诸如“论证类型”和“共识信号”等微妙的治理过程标签。关于比较案例的设计,请参见附录 B (https://arxiv.org/html/2606.26203#A2)。 ### 3.1. 数据收集与 LLM 标注 我们从公共存储库收集治理参与记录。对于 ERC-8004,数据来源于两个来源:(1) 来自 Ethereum Magician 论坛主题的 113 篇帖子 (Ethereum Magicians, 2025 (https://arxiv.org/html/2606.26203#bib.bib12));(2) 来自直接修改 `ERCS/erc-8004.md` 的九个拉取请求的 36 条 GitHub 记录 (ERC-8004 Authors, 2026 (https://arxiv.org/html/2606.26203#bib.bib47))。对于 Google A2A,数据来源于 `a2aproject/A2A` 存储库中的三个流 (A2A Authors, 2025a (https://arxiv.org/html/2606.26203#bib.bib14)):(1) 3,104 条议题和议题评论记录,(2) 1,955 条拉取请求和审查评论记录,以及 (3) 822 条 GitHub 讨论记录。 原始记录总计 6,030 条。我们移除了以下数据:正文少于 20 个字符的记录(主要是 CI 通知、合并冲突标记和机器人生成的状态消息);以及归属于已验证机器人账户的记录。经过此类过滤后,保留了 4,323 条记录(ERC-8004:142 条;Google A2A:4,181 条)。所有原始数据字段的 SHA-256 校验和已在作者的 GitHub 仓库中提供 [1](https://github.com/kl41r3/erc8004-a2a-case-study)。另请参见附录 C (https://arxiv.org/html/2606.26203#A3)。 保留的记录按四个分类字段进行了标注: - **利益相关者机构**:Google / MetaMask / Ethereum Foundation / Coinbase / Independent / Unknown - **论证类型**:Technical / Governance-Principle / Economic / Process / Off-topic - **立场**:Support / Oppose / Modify / Neutral / Off-topic - **共识信号**:Adopted / Rejected / Pending / N/A 还对前 109 位贡献者的机构隶属关系进行了人工审核。级联过程详见附录 F (https://arxiv.org/html/2606.26203#A6)。 ### 3.2. 话语构成分析 为了描述两种治理话语的主题和论证构成,我们应用了三种归纳深度递增的方法。 #### 3.2.1. 有监督的论证类型划分 将 LLM 分配的 `argument_type` 视为记录的交际功能,我们使用卡方检验 [Coh
相似文章
AI治理的警醒之谈
这篇Reddit帖子讨论了一篇研究论文,该论文揭示了AI治理中的根本性挑战,包括社会攻击面、基于LLM的代理在社会一致性上的失败,以及当前治理工具对代理系统的不充分性。
代理型AI系统运行时治理的道义政策
本文提出了AgenticRei框架,该框架使用OWL表达的道义政策对由LLM驱动的代理型AI系统进行运行时治理,实现了义务、豁免和冲突解决,超越了传统策略引擎。
设计治理:构建面向组织学习与可扩展自主性的代理型人工智能
本文通过对一家大型IT服务公司2025年开发和部署代理型AI系统的定性案例研究,提炼出七条经验,旨在将治理嵌入系统架构与运营中,以平衡自主性与问责制。
重绘AI地图:智能体生态系统中的责任边界理论
本文引入了责任资产和规则债务,提出了一种关于智能体AI编排器如何影响组织边界的理论,论证了责任约束限制了技术可分解性带来的模块化效应。
面向受监管行业的智能体AI的不同方法 - 问题探讨
总结了一种确定性的、基于约束的方法,用于在受监管金融领域构建AI智能体,其中LLM仅生成散文,数字通过加密方式密封,并通过分层结构确保可审计性。