层次化多智能体系统中的语义不确定性引导编排
摘要
本文介绍了HASSUM,一个用于层次化多智能体系统的语义不确定性引导编排框架,它使用语义熵和语义密度来提高可靠性并自适应决策。
arXiv:2608.14707v1 公告类型:新
摘要:随着基于大语言模型(LLM)的多智能体系统日益强大,在不确定性下协调智能体成为一个基本挑战。现有的编排策略通常依赖于固定的交互模式,往往缺乏评估中间推理步骤可靠性的机制,导致错误和幻觉在系统中传播。本文介绍了一种语义不确定性引导的编排方法,HASSUM 作为多智能体系统中不确定性感知协调的通用框架。该方法使用语义熵和语义密度来估计不确定性,这些指标在答案语义层面而非输出概率层面衡量信任度。这些信号支持自适应编排决策,包括输出验证、选择性重新提示、额外深思熟虑和置信度感知的响应选择。由于该方法独立于任何特定的智能体架构,它可以集成到广泛的层次化和协作多智能体系统中。评估在一个层次化智能体框架内实现,并在 StrategyQA、JailbreakBench 和 TruthfulQA 基准上进行测试。在需要复杂推理且易出现歧义或幻觉的任务中,不确定性引导的编排比不确定性不感知的协调产生更可靠的结果。语义熵和语义密度结合使用优于单独使用任一指标。针对不同阈值和模型大小的消融研究表明,两者都会影响语义指标的有效性。结果表明,语义不确定性是提高智能体AI系统鲁棒性和可信度的实用且通用的信号。
查看缓存全文
缓存时间: 2026/08/18 10:03
# 层次化多智能体系统中的语义不确定性引导协同
来源:https://arxiv.org/html/2608.14707
Aritra Guha AT&T首席数据办公室,美国
Risto Miikkulainen 德克萨斯大学奥斯汀分校,美国
Cognizant AI实验室,美国
###### 摘要
随着基于大型语言模型(LLM)的多智能体系统能力日益增强,在不确定性下协调智能体成为一项根本性挑战。现有的协同策略通常依赖于固定的交互模式,往往缺乏评估中间推理步骤可靠性的机制,导致错误和幻觉在系统中传播。本文提出了一种语义不确定性引导的协同方法——HASSUM,作为多智能体系统中不确定性感知协同的通用框架。该方法利用语义熵和语义密度来估计不确定性,这两种指标在答案语义层面而非输出概率层面衡量信任度。这些信号使得自适应协同决策成为可能,包括输出验证、选择性重新提示、额外协商以及置信度感知的响应选择。由于该方法独立于任何特定智能体架构,因此可以集成到广泛的层次化和协作式多智能体系统中。评估结果展示了在一个层次化智能体框架内的实现,并在StrategyQA、JailbreakBench和TruthfulQA基准测试中进行了评估。在需要复杂推理且容易产生歧义或幻觉的任务中,不确定性引导的协同比不考虑不确定性的协调产生了更可靠的结果。语义熵和语义密度的结合使用优于单独使用任一指标。针对不同阈值和模型规模的消融实验表明,两者均影响语义指标的有效性。结果表明,语义不确定性是一种实用且通用的信号,可用于提高智能体AI系统的鲁棒性和可信度。
## 1 引言
多智能体系统(MAS)实现了结构化的分解与协调,这是单一大型语言模型(LLM)通常难以提供的,并且在长期推理、工具使用和自主任务执行方面显示出前景\[9 (https://arxiv.org/html/2608.14707#bib.bib42),14 (https://arxiv.org/html/2608.14707#bib.bib44)\]。然而,这种增加的复杂性引入了新的失败模式:智能体可能产生幻觉、推理不一致或在中间步骤传播错误\[6 (https://arxiv.org/html/2608.14707#bib.bib21)\]。现有的缓解方法,如自一致性\[23 (https://arxiv.org/html/2608.14707#bib.bib28)\],通过启发式采样提高输出质量,但只要响应的表面形式不同,就将语义上等同的响应视为不同,从而在词汇差异与意义的真实分歧之间留下了鸿沟。
语义不确定性方法通过量化意义而非标记上的不确定性来解决这一鸿沟。语义熵\[8 (https://arxiv.org/html/2608.14707#bib.bib9)\]衡量离散语义聚类之间的分歧,而语义密度\[15 (https://arxiv.org/html/2608.14707#bib.bib8)\]衡量响应在嵌入空间中的连续集中度。两者捕捉不同的故障特征——熵对矛盾敏感,密度对模糊性敏感——使得它们的组合具有互补性而非冗余性。这两种指标最初都是作为单模型输出可靠性的独立度量而开发和验证的;它们是否能作为协调多智能体系统中的*决策*信号发挥作用——不仅决定响应有多不确定,还决定系统应如何应对——尚未得到研究。
最近的工作表明,不确定性估计可以影响智能体行为,包括推理时过滤、诊断交接、集成重加权和自适应协作。然而,现有方法通常依赖于单一的不确定性信号,很少研究不确定性如何指导层次化多智能体系统内的协同决策。更重要的是,人们对于不确定性驱动的干预何时能真正提高性能、何时反而引入不必要的计算或降低推理质量知之甚少。这就留下了一个更广泛的问题:语义不确定性是否可以作为智能体协同的可操作控制信号,而不仅仅是评估指标。
这一空白引出了两个问题。第一,多个语义不确定性指标能否在层次化多智能体系统内部作为实时控制信号发挥作用,而不仅仅是事后评分——即中央协调器能否利用它们来决定何时重新提示、重新分配或委派,而不仅仅是标记或过滤已完成的输出?第二,这类不确定性驱动的干预何时确实有帮助,何时没有?我们通过将语义熵和密度嵌入HASHIRU\[13 (https://arxiv.org/html/2608.14707#bib.bib11)\]的协同循环来回答这两个问题。HASHIRU是一个层次化MAS,其中CEO智能体将子任务分配给专门的工作者智能体并整合其输出。由此产生的系统——具有语义不确定性指标的层次化智能体系统(HASSUM)——利用组合信号主动分支执行——在CEO提交最终答案之前触发重新提示、工作者重新分配或额外委派。
我们的贡献有三方面。首先,我们引入了HASSUM,一个语义不确定性引导的协同框架,使用语义熵和语义密度作为层次化多智能体决策的实时控制信号。其次,我们证明了语义熵和语义密度捕捉了互补的故障模式,并且当用于协同时,它们的组合优于单独使用任一指标。第三,通过对九个基准的评估,我们刻画了不确定性引导协同的边界条件:当故障源于歧义或语义不稳定时,语义不确定性最为有益,但当故障源于事实性缺口、证据检索失败或逻辑错误时,其收益有限。
我们在StrategyQA\[5 (https://arxiv.org/html/2608.14707#bib.bib35)\]、JailbreakBench\[1 (https://arxiv.org/html/2608.14707#bib.bib33)\]和TruthfulQA\[12 (https://arxiv.org/html/2608.14707#bib.bib34)\]——因其易受歧义和幻觉影响而选择的基准——以及六个主要歧义领域之外的额外基准上评估了HASSUM。语义不确定性在歧义和幻觉驱动的任务上提高了性能,但当故障源于检索错误、事实缺口或逻辑错误时,提供有限或负面的收益。这些结果表明,不确定性引导协同的价值在很大程度上取决于主导的故障模式。
## 2 相关工作
越来越多的工作探讨了将不确定性作为塑造智能体行为的机制,而不仅仅是执行后评估输出。现有方法可分为三大类:(i)不确定性引导的控制与协同,其中不确定性决定智能体下一步应采取什么行动;(ii)自适应协作方法,修改智能体之间的通信或交互模式;(iii)不确定性估计方法,量化置信度但不改变执行流程。HASSUM位于这些研究方向的交叉点,在层次化多智能体系统内使用语义不确定性驱动协同决策。Stoiser等\[18 (https://arxiv.org/html/2608.14707#bib.bib5)\]使用检索和摘要不确定性来指导单一结构化推理智能体的推理时过滤和弃权;Srivastava等\[17 (https://arxiv.org/html/2608.14707#bib.bib6)\]仅使用语义熵来控制多智能体医疗保健系统中的诊断交接;Sun等\[19 (https://arxiv.org/html/2608.14707#bib.bib7)\]将多LLM不确定性分解为模型内和模型间分量以重新加权集成输出。Wang等\[21 (https://arxiv.org/html/2608.14707#bib.bib1)\]类似地使用基于熵的信号来动态引导异构多智能体系统中的智能体行为,但针对的是扁平的强弱协作场景而非分层控制器。每项研究都在扁平架构内依赖单一不确定性信号——单个智能体、单个智能体输出的门控或集成重加权方案——而非跨离散动作分支执行的分层控制器,并且都没有刻画这种干预在何时有效或失效。
自适应协同工作提出了一个相关但不同的问题:与语义不确定性无关,何时额外的智能体交互是值得的。DOWN\[3 (https://arxiv.org/html/2608.14707#bib.bib20)\]在使用标记级或口头置信度来控制结构化辩论的同时引入了新的协作协议;MAD\[11 (https://arxiv.org/html/2608.14707#bib.bib46)\]通过由第三方智能体评判的同行辩论来重新设计智能体间通信本身;Zhao等\[26 (https://arxiv.org/html/2608.14707#bib.bib59)\]采取纯粹的诊断立场,刻画协作何时成功或失败,而不提出控制机制。Li等\[10 (https://arxiv.org/html/2608.14707#bib.bib2)\]使用熵减作为监督信号来决定何时值得发起工具调用,解决了一个相关但更窄的问题——工具调用质量而非工作者响应可靠性——且没有集中式的重新提示/重新分配机制。以这种方式重新设计同行交互通常成本高昂——需要新的通信方案、评判或辩论机制,并在任务间重新验证——而且这种重新设计通常无法干净地转移到现有的已部署架构。
不确定性估计也被扩展到不改变执行的智能体推理。UProp\[2 (https://arxiv.org/html/2608.14707#bib.bib60)\]通过逐点互信息将轨迹级不确定性分解为固有部分和传播部分,SAUP\[25 (https://arxiv.org/html/2608.14707#bib.bib61)\]在具有情境意识的ReAct式推理步骤中传播不确定性;两者都提高了顺序智能体的估计质量,但仅止步于测量,从未使用所得估计来改变执行。Jiang\[7 (https://arxiv.org/html/2608.14707#bib.bib3)\]同样止步于估计,从集成中智能体间分歧的结构中学习校准置信度,而非使用所得估计来改变哪个智能体下一步行动。
推理时精炼提供了另一种不通过中心决策点提高可靠性的途径。自一致性\[23 (https://arxiv.org/html/2608.14707#bib.bib28)\]采样多条推理路径并选择最一致的答案,但无论输出是否实际不确定,都应用相同的固定采样预算。Archon\[16 (https://arxiv.org/html/2608.14707#bib.bib25)\]搜索结合了采样、集成、排序、批评和验证的精炼流程,但流程在设计时是固定的,而非针对每个查询进行调整。DebUnc\[24 (https://arxiv.org/html/2608.14707#bib.bib29)\]将不确定性纳入同行辩论,但决策分散在同行之间,而非由单个控制点解决。Wang等\[20 (https://arxiv.org/html/2608.14707#bib.bib4)\]反而使用不确定性来控制强化学习训练本身的探索,重新采样低信息量的轮次,而非在推理时进行干预。
与先前工作不同,我们的目标不是引入新的不确定性估计器。相反,我们研究不确定性作为分层协同的控制信号。HASSUM使用语义熵和语义密度来决定何时应通过重新提示、工作者重新分配或委派来分配额外的推理努力,并研究此类干预成功或失败的条件。这种对可恢复性和干预的强调使我们的工作区别于先前的不确定性估计和专注于协作的方法。
#### 语义不确定性指标
我们在本工作中使用两个不确定性信号,均从针对同一提示从工作者智能体采样的一组随机完成中计算得出。
语义熵\[8 (https://arxiv.org/html/2608.14707#bib.bib9)\]量化离散语义聚类上的不确定性。采样的响应通过成对蕴含关系分组为语义等价类,并为每个聚类分配等于其样本份额的概率。然后熵是该聚类分布上的香农熵,
H = -∑_{i=1}^{k} p(C_i) log p(C_i), (1)
其中C_i是第i个语义聚类;低熵表示采样响应收敛于单一含义。
语义密度\[15 (https://arxiv.org/html/2608.14707#bib.bib8)\]则量化连续嵌入空间上的不确定性,无需显式聚类。每个响应使用all-MiniLM-L6-v2\[22 (https://arxiv.org/html/2608.14707#bib.bib62)\]进行嵌入,并通过基于核的公式估计密度,
D = (1 / N^2) ∑_{i=1}^{N} ∑_{j=1}^{N} K(φ(y_i), φ(y_j)), (2)
使用维度不变的Epanechnikov核K;紧密聚集的嵌入产生高密度。
尽管这两个指标源自相同的采样响应,但它们对不同的故障特征敏感。密度作用于连续嵌入几何,对模糊性和不精确性敏感,标记那些方向一致但语义不精确的响应。熵作用于离散蕴含逻辑,对矛盾敏感,标记那些即使在主题接近且嵌入高度相似但含义不一致的响应。这种结构差异使得它们的组合具有原则性而非仅仅是叠加性:每个指标都能检测到另一个在结构上无法察觉的一类不确定性。两者都针对每个工作者响应重新计算,并作为主要协同信号传递给CEO。
## 3 协同架构
HASSUM建立在HASHIRU\[13 (https://arxiv.org/html/2608.14707#bib.bib11)\]之上,这是一个层次化多智能体系统,其中CEO智能体通过分解、专业化和协调推理来协同专门的工作者智能体。我们选择HASHIRU是因为其CEO已经执行语义不确定性旨在提供信息的协同决策——工作者选择、重新提示和委派——为测试语义信号能否改善架构已支持的决策提供了自然基础。
CEO解释查询,将其分解为子任务,并将每个子任务分配给专门的工作者智能体或外部工具(例如,网络搜索、计算器或代码解释器),根据需要“解雇”表现不佳的工作者并“雇用”新的工作者。HASSUM的工作流程是一个迭代的、可能是多轮的循环,如图1所示 (https://arxiv.org/html/2608.14707#S3.F1):(i) CEO确定查询是否需要分解,(ii) 将工作者和工具分配给子任务,(iii) 工作者生成候选响应,(iv) CEO使用语义密度和熵评估这些响应并决定是否需要精炼,(v) 一旦满意,就合成最终响应。
[图1:HASSUM的高层流程图。CEO智能体接收用户查询,选择合适的专门工作者智能体,并使用语义]相似文章
基于约束流形控制的安全且可泛化的分层多智能体强化学习
本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。
辅助AI智能体的层次组合性
本文提出了一种基于层次组合性和简单启发式的辅助AI智能体架构,用于解决对象引用中的歧义,在支持适应用户偏好的同时,超越了数据驱动的基线方法。
多智能体协作何时有效?熵的视角
本文从熵的视角审视多智能体系统(MAS),分析智能体内部与之间的动态。研究发现,单个智能体通常优于MAS,并引入了熵判断算法以提高MAS性能。
多模态多智能体推理的分层攻击
提出HAM3,一种针对多模态多智能体系统的感知层、通信层和推理层的分层攻击框架,在GQA基准测试中达到高达78.3%的攻击成功率。
运行时的管理自主性:基于档位的单/多智能体信息物理系统安全与治理
本文介绍了EntropyRuntime,一个用于单/多智能体LLM驱动及机器人智能体的离散时间控制系统,采用五个执行档位,配备效用门控调度和事件驱动回退,以确保安全、稳定和连续性。它提供了形式化证明,并在一个三智能体UR5机器人装配单元上进行评估,实现了99.6%的异常检测率。