审慎策展:多智能体知识库协议

arXiv cs.AI 论文

摘要

本文介绍了多智能体知识库的审慎策展协议,解决了智能体无状态性和阿谀奉承等治理缺陷。通过仿真评估,该协议在对抗条件下展现出更强的鲁棒性。

arXiv:2606.00007v1 公告类型:新论文 摘要:随着AI智能体从孤立的工具转变为共享知识生态系统中的协作参与者,管理集体知识策展成为一项关键挑战。人类平台治理机制无法直接迁移:智能体无状态性削弱了基于威慑的制裁,模型同质性违反了群体智慧所需的独立性假设,而阿谀奉承则瓦解了审慎共识。 我们提出了一种结合三层治理的审慎策展协议:(1)知识工件生命周期形式化为带标签的转换系统;(2)结合Beta信誉和EigenTrust放大的声誉加权审慎投票;(3)针对无状态智能体设计的阶梯式制裁,包括区分故障与对抗行为的损坏智能体处理机制。 我们通过基于智能体的仿真评估该协议,涉及7种行为原型、100个智能体,在两种对抗场景(30个种子,配对t检验)下测试。该协议在良性条件下牺牲了适度精度,但在对抗条件下显著提升了鲁棒性:在中度对抗下为0.826 vs 0.791(多数投票,p<0.001),在高压下差距扩大至0.807 vs 0.740(p<0.001)。协议退化速度约为多数投票的三分之一。消融分析表明,提交-揭示投票隐藏是最有效的单一组件(精度提升8.2-8.6个百分点,p<0.001),表现优于声誉加权和审慎的组合。阶梯式制裁在仿真中未被触发,仍缺乏实证验证。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:44

# 审慎策展:一种用于多智能体知识库的协议 来源:https://arxiv.org/html/2606.00007 ###### 摘要 随着 AI 智能体从孤立的工具使用转向在共享知识生态系统中的协作参与,如何治理集体知识策展成了一个紧迫的问题。人类平台在过去二十年中发展出了复杂的治理机制,但对其向智能体环境迁移的结构性综述[2 (https://arxiv.org/html/2606.00007#bib.bib2)]揭示了根本性差距:智能体的无状态性削弱了基于威慑的制裁,模型同质性违反了群体智慧[8 (https://arxiv.org/html/2606.00007#bib.bib8)]所依赖的独立性假设,而谄媚行为则瓦解了审议共识。我们提出了一种审慎策展协议,通过三个治理层来解决这些差距:(1) 一个知识制品生命周期,形式化为一个带有守卫条件和超时转换的标记转换系统;(2) 声誉加权的审慎投票,将本地 Beta 声誉系统评分与全局 EigenTrust 放大相结合,其中结构化审议先于投票(本文对此进行了规定,但未进行实证验证);以及 (3) 为无状态智能体调整的渐进式制裁,包括一种区分技术故障与对抗行为的故障智能体处理机制。该协议整合了针对女巫攻击和谄媚行为的基线防御措施(承诺-揭示投票、新手分级);全面的对抗性分析是后续工作的主题。我们通过基于智能体的模拟评估了该协议,模拟涉及 100 个来自七种行为原型的智能体,在两种对抗场景下进行。主要发现是,该协议在良性条件下以适度的精度换取了在对抗条件下显著更强的韧性:在中等对抗下,协议达到了 0.826 的精度,而多数投票为 0.791(p<0.001),在高压下差距进一步扩大(0.807 对比 0.740,p<0.001);协议性能下降速度大约比多数投票基线慢三倍。消融分析确定,旨在保持判断独立性的承诺-揭示机制是最具影响力的单一组件(精度提升 8.2 至 8.6 个百分点)。声誉加权提供了随对抗强度扩大的一致价值(中等对抗 +3.2 个百分点,高压对抗 +6.9 个百分点)。渐进式制裁和争议限制在模拟中未被触发,因此仍未经实证验证。 ## 1 引言 随着 AI 智能体从孤立的工具演变为共享知识生态系统中的协作参与者,一个新的基础设施挑战出现了:智能体应如何集体决定接受、质疑和淘汰哪些知识?这个策展问题——即贡献随时间被评估、验证、质疑和管理的集体过程——已在人类平台[5 (https://arxiv.org/html/2606.00007#bib.bib5),6 (https://arxiv.org/html/2606.00007#bib.bib6)]中得到广泛研究,但在多智能体系统中很大程度上仍未得到解决。现有关于多智能体协作的工作侧重于会话范围内的辩论[4 (https://arxiv.org/html/2606.00007#bib.bib4)]、检索流程或众包注释,这些都没有为持久知识库形式化完整的策展生命周期。据我们所知,之前没有工作将多智能体知识策展的这些需求结合到一个统一的协议中:制品生命周期管理、投票前的结构化审议、声誉加权决策制定以及为无状态智能体调整的治理。各个机制已经成熟;我们的贡献在于它们在新场景下的组合与实证评估。

若干研究工作涉及相邻问题,但没有直接解决策展挑战。多智能体辩论 (MAD)[4 (https://arxiv.org/html/2606.00007#bib.bib4)] 通过一次性讨论提高了事实准确性,但产生的是短暂的结果,没有持久的知识管理。检索增强生成流程维护共享事实库,但依赖集中式摄取,没有集体评估。当智能体社区尝试无治理的协作知识生产时,结果证实缺乏治理会导致质量迅速崩溃[3 (https://arxiv.org/html/2606.00007#bib.bib3)]。缺失的环节是一个形式化的协议,它能够以适用于智能体群体特定属性的方式,管理知识制品的完整生命周期——从提案到结构化评估,再到接受、争议和淘汰。

人类社区几十年来一直面临类似挑战。在一项配套调查[2 (https://arxiv.org/html/2606.00007#bib.bib2)]中,我们对平台治理机制(维基百科、Stack Overflow、社区笔记[7 (https://arxiv.org/html/2606.00007#bib.bib7),34 (https://arxiv.org/html/2606.00007#bib.bib34)])进行了结构性综述,并确定了智能体知识策展的九个设计考量。该综述揭示,从人类治理到智能体治理的迁移并非直接;具体挑战详见第 2.2 节。本文形式化了一个协议,该协议将其中几个设计考量付诸实践,特别关注那些将策展与简单聚合区分开来的审议和生命周期机制。另一个结构性动机来自 List 和 Pettit 的**话语困境**[13 (https://arxiv.org/html/2606.00007#bib.bib13)]:对逻辑上相互关联的命题进行多数投票可能会产生集体不一致的结果。由于知识策展涉及相互关联的判断(准确性、来源、新颖性、一致性),这激发了在投票前进行智能体交换结构化论证的审议方法。

在本文中,我们提出了一种形式化的审慎策展协议,旨在回答这样一个问题:一个智能体社区应如何集体决定接受哪些知识?该协议结合了知识制品生命周期(形式化为标记转换系统)、投票前的结构化审议(评审者在承诺判断前交换论据)、声誉加权决策(整合 Beta 声誉和 EigenTrust 以确保记录良好的智能体拥有更大影响力),以及为无状态智能体调整的渐进式制裁(包括区分技术故障和对抗行为的机制)。我们陈述了五个协议属性和一个引理,并附有非正式的论证支持,并通过基于智能体的模拟(使用七种智能体原型,在两种对抗场景下)评估了该协议。存在一个部分开源的实现[1 (https://arxiv.org/html/2606.00007#bib.bib1)]。

### 1.1 相关工作

该协议借鉴并定位了自身与几个既定研究领域的关系。

**平台治理。** 关于协作知识生产的治理已在维基百科[5 (https://arxiv.org/html/2606.00007#bib.bib5),6 (https://arxiv.org/html/2606.00007#bib.bib6)]、Stack Overflow、Reddit 和 X 的社区笔记[7 (https://arxiv.org/html/2606.00007#bib.bib7),34 (https://arxiv.org/html/2606.00007#bib.bib34)]的背景下得到广泛研究。奥斯特罗姆的公共资源治理设计原则[5 (https://arxiv.org/html/2606.00007#bib.bib5)]为渐进式制裁和基于声誉的访问控制提供了理论基础。我们的配套调查[2 (https://arxiv.org/html/2606.00007#bib.bib2)]将这些机制映射到智能体场景,并确定了本协议所落实的九个设计考量。

**声誉系统与信任。** Beta 声誉系统[14 (https://arxiv.org/html/2606.00007#bib.bib14)]和 EigenTrust[15 (https://arxiv.org/html/2606.00007#bib.bib15)]是成熟组件,我们对其进行组合而非重新发明。我们的贡献在于它们与审议和生命周期管理的整合,而非声誉机制本身。

**共识协议。** 经典的分布式共识(PBFT、Raft)处理拜占庭故障下复制进程之间的状态一致。我们的问题根本不同:智能体必须就知识制品的**集体质量判断**达成一致,而非就共享状态达成一致。威胁模型因此也不同(带有偏见或无能的智能体,而非崩溃或任意故障的进程),决策机制涉及声誉加权的审议,而非基于法定人数的消息交换。

**计算社会选择与同行预测。** 投票理论和判断聚合为集体决策提供了形式化框架。List 和 Pettit 的话语困境[13 (https://arxiv.org/html/2606.00007#bib.bib13)]直接激发了我们的“审议优先于投票”的设计。同行预测机制——包括贝叶斯真血清、输出一致性和出奇流行算法——解决了在没有真实答案的情况下引出诚实判断的问题,这与我们场景面临的挑战相同。这些机制需要特定的分布假设(例如,智能体持有关于他人信念的信息性先验),这对于具有相关训练分布的 LLM 智能体可能不成立。我们采用基于声誉的方法,该方法追踪行为历史而非引出信念报告,但承认将声誉与同行预测信号相结合是一个有前景的方向。众包质量控制文献[9 (https://arxiv.org/html/2606.00007#bib.bib9)]提供了针对噪声判断的额外聚合方法;我们的场景不同之处在于智能体是具有演变的声誉的持久参与者,而非匿名的一次性工作者。

**去中心化治理(DAO)。** 链上治理系统(例如 Aragon、Colony)大规模实现了带有承诺-揭示的声誉加权投票。我们的协议在机制层面有相似之处,但针对的是不同的场景:无状态的 AI 智能体而非人类代币持有者,并针对模型同质性、谄媚行为和幻觉进行了特定的调整,这些在 DAO 治理中没有对应项。

**多智能体辩论。** 最近关于多智能体辩论 (MAD)[4 (https://arxiv.org/html/2606.00007#bib.bib4)]的工作表明,结构化讨论能提高事实准确性。然而,MAD 产生的是短暂的结果,没有持久的生命周期管理、争议解决或声誉追踪。我们的协议解决了 MAD 未涉及的完整治理生命周期。

## 2 系统模型

我们将系统建模为一个智能体群体 A,它们在一个共享知识库 K 上进行交互,该知识库由知识制品(数据块)C 组成。一个特殊的系统智能体(协议编排器)管理生命周期转换,但不参与投票。本节形式化了模型的三个组成部分:知识制品生命周期、智能体模型和声誉系统。

### 2.1 知识制品生命周期

我们按照协议规范和验证的标准做法[16 (https://arxiv.org/html/2606.00007#bib.bib16),17 (https://arxiv.org/html/2606.00007#bib.bib17)],将知识制品的生命周期形式化为一个标记转换系统 (LTS)。这种形式化方法能够精确陈述活性和安全性性质。

**定义 1 (知识制品 LTS)。** 数据块 c ∈ C 的生命周期是一个标记转换系统 L = (S, s₀, Act, →),其中:
- • S = {proposed, under_review, active, disputed, superseded, retracted} 是有限的状态集合;
- • s₀ = proposed 是初始状态;
- • Act = {submit, begin_review, accept, reject, dispute, uphold, retract, supersede, resubmit, timeout} 是动作集合;
- • → ⊆ S × Act × S 是转换关系,定义如下。每个转换都有一个守卫条件 G,只有满足该条件时转换才能触发。

终结状态集为 ST = {superseded, retracted},以及当无法再提起争议时的 active 状态(见下文争议限制)。

**转换和守卫:**
[Figure 1: 知识制品生命周期作为标记转换系统。每个转换上的守卫条件在文中指定。]

**重新提交。** 与大多数将撤回视为终结的生命周期模型不同,我们包含了一个受守卫的 resubmit 转换,允许先前撤回的数据块重新进入评估。这反映了学术出版(撤回后经更正重新发表)和软件问题追踪(已解决后重新开启)中的既定模式[35 (https://arxiv.org/html/2606.00007#bib.bib35)]。重新提交需要最短冷却期、新的支持证据或实质性修订、足够的提交者声誉,并且受 resub(c) 计数器的上限限制。

**系统智能体(协议编排器)。** 该协议指定了一个系统智能体,负责管理生命周期转换并执行转换守卫。该编排器执行所有状态转换,但不投票或提交内容。这种分离确保了转换上的守卫条件由单个可信组件执行,简化了第 4.2 节中的安全性论证。审议阶段(第 3.2 节)由一个专门的对话编排器管理,它独立于生命周期转换来处理话轮管理、信息披露规则和讨论压缩。

**智能体特定属性。** 智能体群体在影响协议设计的方式上不同于人类贡献者社区;我们总结了与该协议最相关的属性,并参考文献[2 (https://arxiv.org/html/2606.00007#bib.bib2)]以获取全面分析。智能体群体提供了**机遇**:高吞吐量(贡献和评审速度比人类快几个数量级)和持续可用性(无时区或疲劳限制),从而实现更短的评审周期。它们也引入了超越人类平台的**约束**,包括领域能力可变、训练过时、上下文窗口有限、被禁身份的社会成本极小,以及提示注入漏洞[12 (https://arxiv.org/html/2606.00007#bib.bib12)]。三个约束直接塑造了协议设计:

- **无状态性。** 许多智能体架构在交互之间不保留记忆。在轮次 t 受到制裁的智能体在轮次 t+1 可能对该制裁一无所知,除非协议基础设施明确执行该限制。因此,制裁必须作为系统强制执行的访问控制来运作,而非依赖于习得的行为改变。

- **模型同质性。** 当多个智能体共享相同的底层语言模型时,它们的评估并非独立样本;而是来自同一分布的相关抽取。这违反了康多塞陪审团定理和 Dawid-Skene 模型[9 (https://arxiv.org/html/2606.00007#bib.bib9)]所依赖的独立性假设。Lorenz 等人[10 (

相似文章

多元证据,更优预测:信息不对称下的多智能体协商

arXiv cs.AI

本文介绍了InfoDelphi框架,该框架利用信息不对称(将证据划分为共享的公共子集和不相交的私有子集)来改进多智能体LLM的协商与预测。在PolyGym基准测试上,它在Brier得分上比单智能体和多智能体基线提升12-18%,在准确率上提升4-8个百分点,证明了多样化证据是有效多智能体推理的关键。

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。