BoardroomAI:通过演进决策图实现依赖感知、人类可引导的多智能体审议

arXiv cs.AI 论文

摘要

介绍了BoardroomAI,一个通过依赖感知的演进决策图实现人类可引导的多智能体审议框架,能够在人类干预后选择性修复受影响的工件。在合成干预上进行了评估,显示了效率,同时保留了未受影响的节点。

arXiv:2608.13046v1 公告类型:新 摘要:组织决策是共同创造的,而证据、约束和人类优先级持续演变。在传统的基于转录的多智能体系统中,人类通常提供初始问题,智能体内部进行审议,系统返回最终响应。BoardroomAI 则将人类视为持续参与者,可以通过质疑假设、修改约束、改变优先级、引入证据或重新引导决策过程来进行干预。我们通过四个组成部分来操作这种人与智能体的共存:(i)一个类型化决策图,表示证据、假设、约束、主张、异议、替代方案、风险、决策、语义依赖和专家责任;(ii)一个干预编译器,将确认的人类行动转换为显式的图更新;(iii)依赖感知传播,识别受影响的子图、保留未受影响的工件,并选择性地重新激活相关专家;以及(iv)一个评估框架,衡量干预影响、修复覆盖率、保留、重计算和决策有效性。在600个生成的决策DAG干预中,传播在仅检查14.59%的节点的情况下匹配了详尽的影响计算。在一个12例探索性试点中,选择性修复重新计算了62.11%的规范节点,保留了所有黄金标准未受影响的节点,并在六个案例中产生有效的更新决策,而在其余六个案例中放弃。这些放弃表明,正确的干预路由可能仍不足以提供综合上下文,从而促使人类引导的多智能体审议需要\emph{决策充分的上下文闭合}。所有结果均为合成且原型级别。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:29

# BoardroomAI:基于演化决策图的依赖感知、人类可引导的多智能体协商
来源:https://arxiv.org/html/2608.13046

###### 摘要

组织决策是在证据、约束和人类优先级不断变化的过程中共同创造的。在传统的基于转录的多智能体系统中,人类通常提供初始问题,智能体在内部协商,系统返回最终响应。BoardroomAI 则将人类视为持续参与者,可以在讨论期间通过挑战假设、修改约束、改变优先级、引入证据或重新引导决策过程进行干预。我们通过四个组件实现这种人机共存:(i) 类型化决策图,其节点代表证据、假设、约束、主张、异议、备选方案、风险和决策,其边代表语义依赖和专家责任;(ii) 干预编译器,将每个已确认的人类操作转换为显式的节点级和边级图更新;(iii) 依赖感知传播机制,测量干预的结构影响,识别受影响的决策子图,保留未受影响的工件,并选择性地重新激活相关领域专家;以及 (iv) 一个评估框架,用于衡量干预影响、修复覆盖率、保留、重算和最终决策有效性。在 600 个生成的决策 DAG 干预中,所提出的传播机制在仅检查 14.59% 节点的情况下匹配了穷举影响计算。在一个 12 例探索性智能体试点中,选择性修复重算了 62.11% 的规范节点,保留了所有金标准未受影响节点,并在六个案例中产生了有效的更新决策,同时在其他六个案例中保守弃权。这些弃权表明,正确的干预路由不一定为决策综合提供足够的上下文。因此,我们为人类引导的多智能体协商形式化了一个决策充分上下文闭包。所有报告的结果均为合成且原型级别。

###### 关键词:

人机共创、多智能体协商、人类可引导性、知识表示、决策图、选择性修复

## 1 引言

LLM 智能体能够扮演角色、交换评论并汇总答案[6 (https://arxiv.org/html/2608.13046#bib.bib1),14 (https://arxiv.org/html/2608.13046#bib.bib2)]。这些能力本身并不能产生可问责的会议过程。在真实决策过程中,首席执行官可能在若干方案制定后削减预算;法律证据可能被撤回;或者一个伦理异议可能在数字多数下仍未解决。重启会浪费工作,并可能因随机漂移改变无关结论。将变更追加到转录中并不能保证每个依赖工件都会被重新审视。

核心研究问题是*修订路由*:在人类干预之后,系统必须确定 (i) 哪些主张、假设、约束或决策的语义状态发生了变化;(ii) 哪些生成的工件必须被修订、重算或失效;(iii) 哪些未受影响的工件应被保留,而不进行不必要的重新生成;以及 (iv) 哪些专家智能体必须被重新激活以修复协商中受影响的部分。这并不暴露私有思维链。相反,它维护了简洁的、外部生成的协商工件,包括主张、证据、假设、约束、异议、备选方案、依赖关系、置信度估计和溯源,人类参与者可以检查、挑战、修订和审计这些工件。

BoardroomAI 将建议、其备选方案及其支持理由视为*共享的共同创建工件*。人类既不是仅限于开始时的提示提供者,也不是仅限于结束时的批准者,而是可以在智能体继续细化工件时重新引导过程、修订约束、挑战推理、改变优先级、保留少数派异议或做出可问责的覆盖决定。依赖感知的对话式修订和基于图的上下文选择已经存在[10 (https://arxiv.org/html/2608.13046#bib.bib3),24 (https://arxiv.org/html/2608.13046#bib.bib4)]。因此,BoardroomAI 声称以下更聚焦的系统贡献:

1. 1\.决策图表示。我们定义了一种形式化的决策图语义,带有用于保留独立支持主张的替代最小证成环境。
2. 2\.类型化人类干预。我们将人类干预形式化为类型化图操作,包括失效、弱化、质疑、取代和偏好变更。
3. 3\.选择性专家修复。我们通过决策图传播干预影响,仅选择性地重新激活受影响的专家,并在修复不足时指定保守回退到完全重新协商。
4. 4\.DynaBoard 评估。我们引入了 DynaBoard,一个 12 例合成试点,用于评估独立于最终决策质量的路由。

当前原型基于语言和图,而非多模态。其共创贡献在于,当人类意图在协商过程中演化时,维护和修订一个显式的共享决策状态。当前评估考察 (i) 干预影响路由和未受影响工件的保留;(ii) 在完整和损坏依赖图上的决策充分选择性修复;以及 (iii) 通过程序化控制器应用的受控人类干预。无限制的自然语言干预解析、人类理解、校准依赖以及对模糊或错误干预的鲁棒性仍是更大规模智能体评估和人类受试者研究的主题。

### 1\.1 动机

让我们看一个现实世界中的董事会场景,以理解我们智能体框架背后的动机。

*假设一家公司正在评估发布一款新产品。财务、市场、法律和运营专家在多个备选方案上进行协商,最终建议在 1 亿美元预算下分阶段发布产品。当讨论达成共识后,决策者将预算削减至 4000 万美元。虽然这一变更使一些早期结论失效,但其他结论仍然完全合理。基于转录的多智能体系统要么重启整个讨论,要么继续而不明确确定哪些先前决策仍然有效,导致不必要的重算或推理不一致。*

BoardroomAI 则将协商表示为依赖感知的决策图。干预仅通过受影响的依赖传播,使付费获取发布策略失效,同时保留独立的区域合作理由和无关的法律结论。只有相关专家被重新激活,系统产生一个可审计的变更日志,解释发生了什么变化、为什么变化,以及哪些决策仍然有效。

## 2 相关工作

#### 人机共创与混合主动。

共创系统研究人类和 AI 如何通过共享责任和交互共同贡献于一个演化工件[12 (https://arxiv.org/html/2608.13046#bib.bib13),20 (https://arxiv.org/html/2608.13046#bib.bib12),15 (https://arxiv.org/html/2608.13046#bib.bib14),13 (https://arxiv.org/html/2608.13046#bib.bib15)]。BoardroomAI 通过将人类干预视为对共享决策图的显式操作,将这一视角扩展到组织协商。

#### 多智能体推理。

多智能体辩论和基于角色的协作可改善跨多样任务的推理、协调和决策[6 (https://arxiv.org/html/2608.13046#bib.bib1),14 (https://arxiv.org/html/2608.13046#bib.bib2),25 (https://arxiv.org/html/2608.13046#bib.bib5),26 (https://arxiv.org/html/2608.13046#bib.bib6),23 (https://arxiv.org/html/2608.13046#bib.bib7),19 (https://arxiv.org/html/2608.13046#bib.bib8),17 (https://arxiv.org/html/2608.13046#bib.bib9),3 (https://arxiv.org/html/2608.13046#bib.bib10),18 (https://arxiv.org/html/2608.13046#bib.bib11)]。与先前工作不同,我们研究类型化人类干预,随后进行依赖感知的选择性专家修复。

#### 修订、论证与溯源。

真值维护系统、计算论证和溯源模型为表示依赖、替代证成和解释提供了形式化机制[5 (https://arxiv.org/html/2608.13046#bib.bib16),7 (https://arxiv.org/html/2608.13046#bib.bib17),4 (https://arxiv.org/html/2608.13046#bib.bib18),8 (https://arxiv.org/html/2608.13046#bib.bib19)]。BoardroomAI 将这些思想加以调整,以维护动态演化的人机协商决策图。

#### 人类控制与群体决策支持。

混合主动系统强调适当的人类监督,而决策支持研究则强调校准信任、多样观点和保留异议的重要性[11 (https://arxiv.org/html/2608.13046#bib.bib20),1 (https://arxiv.org/html/2608.13046#bib.bib21),2 (https://arxiv.org/html/2608.13046#bib.bib22),22 (https://arxiv.org/html/2608.13046#bib.bib23),16 (https://arxiv.org/html/2608.13046#bib.bib24)]。因此,BoardroomAI 将异议和人类干预视为协商过程中的一等、可审计组件。

## 3 问题形式化

在时刻 tt,协商状态为

St=\(Gt,Lt,Mt,Π,Ht,Et,Bt\)。\mathcal{S}_{t}=\(G_{t},\mathcal{L}_{t},\mathcal{M}_{t},\Pi,\mathcal{H}_{t},\mathcal{E}_{t},\mathcal{B}_{t}\)。Gt=\(Vt,Et\)G_{t}=\(V_{t},E_{t}\)是一个类型化有向多重图;Lt\mathcal{L}_{t}存储证成标签;Mt\mathcal{M}_{t}是简洁的共享内存;Π\Pi包含智能体、工具和策略;Ht\mathcal{H}_{t}是干预台账;Et\mathcal{E}_{t}是不可变证据/溯源台账;Bt\mathcal{B}_{t}记录令牌、延迟和货币预算。

我们使用*决策图*指代完整的类型化结构。600 实例机制基准使用无环依赖图,因此在该实验中使用术语*决策 DAG*。实际部署的协商可能包含通过相互反驳、递归需求或版本关系形成的环。因此传播引擎将每个强连通分量凝聚为一个超级节点,并在所得凝聚 DAG 上运行。这一区别至关重要:原始工作空间并不假定为无环。

节点为v=⟨id,τ,x,s,o,c,p,t⟩v=\langle id,\tau,x,s,o,c,p,t\rangle:类型、内容、状态、负责人、置信度、溯源和时间戳。类型包括证据/事实、假设、硬约束或软约束、主张、异议、备选方案、风险、问题、中间结论和决策。状态为活跃、弱化、受质疑、过时、被取代、已拒绝、未解决或已接受。边类型包括requires\mathsf{requires}、supports\mathsf{supports}、derives\mathsf{derives}、rebuts\mathsf{rebuts}、undercuts\mathsf{undercuts}、supersedes\mathsf{supersedes}、answers\mathsf{answers}和requiresHuman\mathsf{requiresHuman}。证据节点需要源定位符、检索时间和内容哈希;模型生成的主张不会仅仅因为重复而成为证据。

表 1:类型化边及其修订语义。#### 最小证成环境。

对于每个派生节点vv,标签Lt\(v\)=\{Jv1,...,Jvm\}\mathcal{L}_{t}(v)=\{J_{v}^{1},\ldots,J_{v}^{m}\}包含子集最小替代环境。每个JJ是支持文字和规则标识符的合取;标签是它们的析取。令

okt\(J\)=⋀l∈Jactivet\(l\)∧¬undercutt\(J\)。\mathrm{ok}_{t}(J)=\bigwedge_{\ell\in J}\mathrm{active}_{t}(\ell)\ \land\ \neg\mathrm{undercut}_{t}(J)。然后vv仍然是可支持的,当且仅当⋁J∈Lt\(v\)okt\(J\)\bigvee_{J\in\mathcal{L}_{t}(v)}\mathrm{ok}_{t}(J)。失去部分而非全部环境会弱化vv;失去全部则使其过时。反驳使主张受质疑,除非显式规则或权威证据使其证成无效。这防止多数一致静默删除少数派异议。

参见说明图 1:BoardroomAI 概述。类型化工作空间取代了仅转录的聚合;已确认的人类编辑通过依赖传播,并仅重新激活相关专家。暴露的对象是决策支持工件和溯源,而非私有思维链。

## 4 BoardroomAI 框架

### 4\.1 架构与协商协议

人类可以在任意轮次添加、撤回、替换、质疑、确认、优先化或解决工件(图1 (https://arxiv.org/html/2608.13046#S3.F1))。协调者将话语编译为候选类型化操作,并在范围或权限模糊时请求确认。专家智能体仅接收其角色、任务包、相关活跃子图、未决异议、证据摘录和输出模式。检索器返回受源限定的证据节点;它不能投票。溯源验证器检查源定位符和引文蕴含。质疑者必须搜索共享假设、缺失证据和反例。

每个专家发出原子图操作,而非无限制的文章:提出/限定主张、附加证据、声明假设、添加证成、异议/削弱/反驳、提出备选方案、量化风险或提问。确定性图服务检查节点类型、源可用性、环、环境最小性和所有权。协调者的轮次评分结合了未决修复义务的覆盖率、预期信息增益、决策风险、成本和冗余。它会在以下情况请求人类判断:冲突的硬约束、不可约的价值权衡、高敏感性的接近平局、未解决的源冲突、模糊干预或不可靠的依赖覆盖率。

#### 分歧与不确定性。

分歧是关系性的:两个工件相互反驳,或者异议削弱了一个已陈述的环境。不确定性是认知性的:节点的概率或区间反映了对可检验命题的置信度。二者不可互换。每个概率性主张声明其事件、时间范围和引出方法;系统仅聚合可通约的预测,并保留个体预测。协调者不能通过平均置信度来解决规范性冲突。异议具有处置{open, answered, accepted\-residual, rejected\-with\-basis, deferred\-by\-human};只有人类可以推迟强制性价值判断。少数派报告从未决或已接受残余异议中生成,并包括改变建议所需的证据和条件。

停止条件包括:决策的活跃证成上没有过时工件;所有硬约束已解决;每个异议已被回答、接受为残余或显式推迟;证据和预算阈值已满足;没有正在等待的强制性人类问题。可问责包包含建议、备选方案、约束、来源、假设、残余异议和少数派报告、校准后的不确定性、干预/变更日志以及重新开启条件。否则系统弃权或返回未解决的决策包。

### 4\.2 人类干预作为决策图演化

干预解析器返回已确认的图增量Δh\Delta_{h}。其组件D+D^{+}、D−D^{-}、D↔D^{\leftrightarrow}、D?D^{?}和ρ\rho编码添加、撤回、替换、质

相似文章

用于人机协作决策的以人为中心的反思架构

arXiv cs.AI

本文介绍了一种用于人机协作决策的以人为中心的反思架构(HCRA),将任务建模为随机博弈,并利用带有语言反馈的强化学习。该框架显著提升了决策效能和推荐质量。

面向协作对话结果的多LLM智能体系统动态治理

arXiv cs.AI

该论文提出了一种基于控制理论的多LLM智能体系统治理层,利用上下文赌博机、PID控制器和POMDP引导智能体达成合作性结果,在模拟金融服务交互中展示了+32个百分点的提升。

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。