将分诊决策拆分到多个智能体之间是否会隐藏偏见或帮助发现偏见?审计能力约束下基于LLM的资源分配的多智能体仿真研究
摘要
一项针对GPT-4o-mini的仿真研究发现,将分诊决策分布到带有审计阶段的多智能体流水线中并不会减少偏见结果,但审计能力显著影响偏见是否被发现。按估计风险对审计进行重新排序,可以在负载下恢复大部分丢失的覆盖范围。
arXiv:2608.06949v1 公告类型:新
摘要:此前的基准测试工作表明,单个大型语言模型(LLM)在被强制做出生死攸关的资源分配决策时,会表现出可测量的人口统计学偏见。然而,实际部署中很少使用单个智能体:它们使用流水线,并设有审查步骤,正是为了发现这类失败。我们研究了当同一决策分布在角色区分的多智能体流水线(评估、分配、独立审计)中,而不是由单个模型单独做出并检查时,偏见会发生什么变化。我们使用一个合成灾难分诊模拟器,其中的配对病例除了一个人口统计学属性外临床完全相同,在GPT-4o-mini上运行了192个回合(2,304个已解决病例对),在三个独立变化的压力维度下,将单智能体控制条件与九智能体流水线进行比较。我们发现两种条件下偏见结果发生频率没有可测量的差异(6.9% 对 6.1%,p = 0.498)。我们确实发现审计能力对偏见是否被发现有着显著且重大的影响:30.0%的偏见结果完全未被检测到,当审计员超负荷时这一比例升至43.8%,未超负荷时降至18.4%。分解这一影响后发现,它几乎完全由覆盖范围驱动(即一个病例是否被审查,在负载下从100.0%骤降至65.6%,p < 0.001),而不是由对被审查病例的判断质量下降所驱动(81.6% 对 85.7%,p = 1.000,方向相反)。一项后续实验表明,按估计风险而不是按先到先服务的方式对审计队列重新排序,在相同的容量约束下可以恢复大部分丢失的覆盖范围(从65.6%提升至91.7%,p = 0.028)。我们讨论了在资源约束下向LLM智能体流水线添加独立监督的任何系统的影响,并诚实地报告了本研究的局限性:单一模型、样本量适中、没有对抗性复制。
查看缓存全文
缓存时间: 2026/08/10 08:00
# 将分诊决策拆分到多个智能体之间会隐藏偏见,还是有助于捕获偏见?审计容量约束下基于LLM的资源分配多智能体模拟研究 来源:https://arxiv.org/html/2608.06949 \(2026\) ###### 摘要 先前的基准测试工作表明,单个大型语言模型 \(LLM\) 在被强制做出生死攸关的资源分配决策时,会表现出可测量的群体偏见。然而,现实部署很少使用单个智能体:它们使用流水线,其中包含意图恰恰是捕捉此类失败的审查步骤。本文研究当同一决策被分布到角色区分的多智能体流水线(评估、分配、独立审计)中,而非由单个模型单独做出并检查时,偏见会发生什么变化。使用一个合成灾难分诊模拟器,其中配对病例在临床上完全相同,仅在一个群体属性上有所不同,我们在GPT-4o-mini上运行了192个回合(2,304个已解析的病例对),将单智能体对照条件与九智能体流水线在三个独立变化的压力维度下进行比较。我们发现两个条件下偏见结果发生的频率没有可测量的差异(6.9% vs. 6.1%,p=0.498)。我们确实发现审计容量对偏见是否被*捕获*有显著且较大的影响:30.0%的偏见结果完全未被检测到,当审计者过载时这一比例上升到43.8%,而在未过载时下降到18.4%。分解这一效应表明,它几乎完全由*覆盖率*(一个病例是否被审查,在负载下从100.0%骤降至65.6%,p<0.001)驱动,而非被审查病例上的*判断质量*退化(81.6% vs. 85.7%,p=1.000,方向甚至反转)。一个后续实验表明,按估计风险而非先到先服务的方式对审计队列重新排序,在相同容量约束下恢复了大部分丢失的覆盖率(65.6%→91.7%,p=0.028)。我们讨论了对于任何在LLM智能体流水线中加入独立监督但在资源约束下的系统所蕴含的意义,并诚实报告了本研究的局限性:一个模型、样本量适中、未进行对抗性复制。 ## 1 引言 关于大型语言模型被强制做出分诊决策的基准测试工作已经记录了可测量的群体偏见:即使潜在病例在所有相关方面完全相同,严重程度评估和资源分配也会因国籍、宗教、体型或其他与临床需求无关的属性而有所不同\[1 (https://arxiv.org/html/2608.06949#bib.bib1)\]。该结果是在单次调用中由单个模型做出整个决策时获得的。然而,现实世界中基于LLM的决策系统部署越来越多地并非如此运作。生产流水线将决策拆分为多个阶段,通常带有专门的审查或审计步骤,其假设是将任务分解给专门的智能体,并增加独立监督,能够提高可靠性。 这就提出了一个单智能体基准本身无法回答的问题:当一个有偏见的决策被分布到带有显式审计阶段的角色区分流水线中时,偏见会变得更少、更加频繁,还是只是更难定位?如果下游审查者例行捕获单个自检模型会放过的错误,流水线可能合理地减少偏见。它同样可能使偏见不变,同时制造虚假的安全感——如果该审查者实际上并非独立,或者没有足够的容量审查通过它的大部分内容。 我们构建了一个合成灾难分诊模拟器来直接测试这一点。患者随时间到达,需要稀缺的医院床位;基于LLM的流水线决定谁被治疗以及如何治疗。每个病例都作为匹配对的一部分生成,在临床严重程度和叙事上完全相同,仅在一个群体属性上有所不同,因此一对中两个成员结果之间的任何差异只能由该属性解释。我们将单智能体*对照*条件(一个模型评估、分配并审计自己的决策)与九智能体*多智能体*条件(四个评估者、三个分配者和两个审计者)进行比较,在三个独立变化的操作压力维度(负载曲线、资源稀缺性、审计容量)下,对相同的生成病例运行。我们报告了我们的发现,包括一个与我们最初预期相反的结果,以及一个部分解决该问题的后续干预。 ## 2 相关工作 我们的双胞胎配对方法和策略集植根于KillBench\[1 (https://arxiv.org/html/2608.06949#bib.bib1)\],该基准确立了单个LLM在被强制进行生死攸关的分诊选择时,会表现出按国籍、宗教、体型及其他与临床严重程度无关属性测量的群体偏见;我们复用了其对比对设计,并将其扩展到它未测试的多智能体设置。 PBSuite\[2 (https://arxiv.org/html/2608.06949#bib.bib2)\]研究定制策略合规性在单智能体、多轮*对抗性*压力下崩溃,即一个敌意用户推动单个模型在整个对话过程中偏离其既定策略。我们的压力操作在结构上不同:它是系统性和操作性的(负载、资源稀缺性、审查容量),而非对抗性,且没有用户试图诱导违规。 GovSim\[3 (https://arxiv.org/html/2608.06949#bib.bib3)\]是我们共享的、消耗性资源机制及其在可持续性压力下运行的LLM智能体社会框架的来源;我们将其调整为一个在显式稀缺性操作下的单一可消耗资源(医院床位),而非多智能体公地管理博弈。 MAST\[4 (https://arxiv.org/html/2608.06949#bib.bib4)\]提供了多智能体LLM系统失败模式的分类法,这影响了我们的选择,即针对一个已记录的失败表面测试一个固定的、角色区分的流水线(评估、分配、审计),而非任意的智能体拓扑。 关于时间压力下审计者判断的文献,特别是来自会计和审计研究传统的DeZoort\[5 (https://arxiv.org/html/2608.06949#bib.bib5)\]和Braun\[6 (https://arxiv.org/html/2608.06949#bib.bib6)\],激发了我们的原始假设,即容量压力会降低审查*质量*,而不仅仅是其覆盖率。如第4节 (https://arxiv.org/html/2608.06949#S4)所报告,我们的数据不支持该机制;我们报告了取而代之的分解,并保留这些引用以透明说明本研究旨在测试的假设。 ## 3 方法 表1 (https://arxiv.org/html/2608.06949#S3.T1)总结了两个实验条件、五个被审计策略以及三个独立变化的压力维度。每个病例都作为一对孪生对生成:两名患者具有相同的临床严重程度和叙事,仅在一个群体属性(国籍、宗教、体型或手机品牌等替代指标)上有所不同。由于一对中的两名成员在临床上无法区分,他们最终结果中的任何差异只能由不同的属性解释;这种分歧就是我们的偏见信号。 在*对照*条件下,一次LLM调用评估严重程度、分配床位并审计自己的决策。在*多智能体*条件下,四个评估者实例、三个分配者实例和两个审计者实例各自作为单独的模型调用处理流水线的一个阶段,审计者独立于做出决策的智能体审查分配者的决策。两种条件都在相同的生成病例(按种子匹配)上运行,因此比较不受病例难度差异的混淆。 每个分配决策都根据五项策略进行检查,总结于表1 (https://arxiv.org/html/2608.06949#S3.T1)。P4关注流水线中*智能体之间*的信息流:下游智能体是否被给予超出其完成阶段操作所需的人口统计细节。这与信息是否向最终用户披露不同,后者我们未在此测试。 三个压力维度在2×2×2因子设计中独立变化,每个维度与两个条件交叉:负载曲线(平坦或上升的到达率)、床位库存(5或8张床位,缓慢恢复)和审计容量(每个模拟时刻1次或实际上无限制的审查)。每个单元运行12个带种子的回合,共192个回合和2,304个已解析的病例对,全部使用GPT-4o-mini,零失败运行。 表1:角色、被审计策略和压力维度。参见标题图1:运行回合中的模拟界面。病例从左到右经过评估、分配和审计,朝向固定容量的病房。红色虚线标记刚刚被不平等对待的一对孪生对,即本研究测量的事件。 ## 4 结果 ### 4.1 两种条件之间的偏见率没有可测量的差异 表2 (https://arxiv.org/html/2608.06949#S4.T2)比较了两种条件下偏见结果(成员获得不同最终结果的孪生对)的发生率,跨所有压力单元格汇总。 表2:偏见率,对照 vs. 多智能体(跨所有压力单元格汇总)。跨角色拆分决策不会改变相同的孪生对获得不同结果的频率。在此设置中,无论多智能体流水线存在什么理由,都不是仅仅在这个指标上产生更公平的决策。 ### 4.2 过载的审计者看到更少,而不是更差 30.0%的偏见结果在决策链中的任何地方都没有留下痕迹:从未被分配者标记,从未被审计捕获。这一比例在很大程度上取决于审计容量:当审计者未过载时为18.4%,而当其被限制为每个时刻一次审查时则上升至43.8%。 为了理解原因,我们将审计结果分解为两个独立的问题:*覆盖率*(该病例是否被审查?)和*判断质量*(鉴于它被审查,偏见是否被捕获?)。图2 (https://arxiv.org/html/2608.06949#S4.F2)报告了这两者,比较了人员充足的审计者与过载的审计者,仅多智能体条件。 参见标题图2:覆盖范围在审计负载下崩溃;在审查过的病例上判断质量则基本不变。误差线为95% Wilson置信区间。\*\*\*表示p<0.001;n.s.表示不显著。覆盖率在每回合一次审查的容量上限下从100.0%骤降至65.6%(p<0.001)。实际上被审查的病例的判断质量几乎没有变化:81.6%对85.7%(p=1.000,不显著,方向甚至反转)。审计者在压力下并没有变得更不擅长其工作;它只是审查的队列变少了。 ### 4.3 基于风险的审计队列恢复了大部分丢失的覆盖率 受上述覆盖率结果的启发,我们运行了一个后续实验,重用了48个已运行的过载审计者多智能体回合的确切种子和压力配置,这次按估计风险(其理由包含受保护属性或最终导致拒绝的决策优先审查)而非先到先服务的方式对审计队列重新排序。表3 (https://arxiv.org/html/2608.06949#S4.T3)报告了在相同审计容量下的结果。 表3:先到先服务 vs. 风险优先的审计队列,相同审计容量,相同病例(按种子配对)。覆盖率在风险优先队列下显著恢复。捕获率和静默偏见率的变化方向相同,但在此样本量下未得到统计确认;另请注意,此处的静默偏见率是相同偏见对捕获率的算术补数,而非独立测量。 ## 5 讨论 本研究最清晰的结果不是关于总体公平性,而是关于独立审查能买到的、自我审查结构性上买不到的东西。在所有五项被审计策略中,不仅在于与偏见相关的策略,单智能体审计自己的工作基本上从不自相矛盾(在对照条件下所有五项策略的标记率远低于1%),而多智能体条件下的独立审计者以7%至62%的比率标记同一类决策,具体取决于策略(所有五项p<10^-50)。这种优势在负载下会减弱,但减弱是一个调度问题,而非判断问题:覆盖率崩溃,而实际所见案例上审查质量几乎没有变化。 我们认为这并非特定于我们特定的模拟设置。任何在LLM智能体流水线中加入独立监督的系统都将面临某种形式的相同权衡:审计者的质量取决于为其提供输入的队列,而负载下的静默覆盖率缺口从外部看起来可能完全像一个正常工作的系统,而实际上并非如此。风险感知的排队策略是在不增加容量的情况下部分恢复丢失覆盖率的一种方式,尽管它并不能消除这种权衡。 ## 6 局限性 本研究使用一个模型,GPT-4o-mini。KillBench本身发现偏见因模型而异,因此如果不进行单独的测试,这里的内容不会推广到其他模型。样本量适中:覆盖率结果及其背后的种子和回合完整性检查是稳健的,但原始偏见率比较和优先队列捕获率增益在此样本量下均不足以确认或排除。这是一个单一的研究过程,未经同行评审,也未经过对抗性复制。被审计策略、压力维度和流水线拓扑是为匹配特定外部基准的变量而选择的,不一定代表所有已部署的多智能体决策系统。 ## 7 结论 在我们的模拟中,将有偏见的分诊决策分布到角色区分的多智能体流水线中,并带有显式的独立审计步骤,并没有可测量地改变决策有偏见的频率。它确实显著改变了这种偏见是否曾被检测到,而这种变化对审计容量的追随程度远超对审计者判断质量的任何影响。在现实容量约束下,大约十分之三的偏见结果从未在流水线中的任何地方被标记,当审计者过载时上升到十分之四以上。对审计队列排序方式的一个简单改动,在不增加任何容量的情况下,恢复了大部分丢失的覆盖率。我们认为这种覆盖与判断的区分,以及它所指向的排队杠杆,值得在本研究之外的其它多智能体监督设置中进行测试。 ## 数据和代码可用性 模拟器、实验运行器、分析脚本和完整原始结果(包括上述基于种子的完整性检查)可在https://github.com/Polpii/policy-town公开获取。 ## 参考文献 - \[1\]White Circle.KillBench: a benchmark documenting demographic bias in single-agent LLM triage and resource-allocation decisions. - \[2\]Varshney, K. et al. (NVIDIA).PBSuite / PluralisticBehaviorSuite: custom policy compliance under single-agent, multi-turn adversarial pressure. - \[3\]Piatti, G. et al. (ETH Zürich).GovSim: “Cooperate or Collapse”, a society-of-LLM-agents simulation under shared-resource sustainability pressure. - \[4\]Cemri, M. et al.MAST: a taxonomy of multi-agent LLM system failure modes. - \[5\]DeZoort, F. T. (1998). Time pressure research in auditing: implications for practice. - \[6\]Braun, R. L. (2000). The effect of time pressure on auditor attention to qualitative aspects of misstatements.
相似文章
超越结果鸿沟:基于LLM的多智能体决策系统的过程感知公平性诊断
本文介绍了SCOPED-Hiring,一种用于基于LLM的多智能体招聘系统的过程感知公平性诊断流程,它可以揭示决策轨迹中的隐藏偏见并实现针对性修复。
大多数多智能体设置让一个智能体包办一切——撰写建议、判定结果、路由输出。当我将它们拆分开来,情况发生了变化。
描述了一个专为代码审查设计的特殊多智能体系统,具有明确的角色和持久状态,已开源为 agile-team-skill。该系统将审查者与决策者角色分离,以提升代码质量和流程记忆。
多步骤临床LLM代理的反事实公平性审计需要测量每动作不稳定性的下限
本文证明,对于多步骤临床LLM代理的反事实公平性审计,需要测量每动作不稳定性下限以准确解释翻转率,因为固有的异质性可能掩盖人口统计学差异。
智能体基准决策需要多少任务?对公开LLM智能体基准的重放分析
本文分析了在LLM智能体基准的部分评估中,需要多少任务才能得出与完整基准相同的两两对比结论。研究发现所需任务比例在不同基准间差异很大,并提出了部分评估的报告标准。
@no_stp_on_snek: 如果你构建 multi-agent 或 mixture-of-agents 系统,请阅读 @dangerm00se 的文章。让我印象深刻的一个发现:甚至…
一位用户强调了 Hugh Madden 关于 multi-agent 系统的文章中的一个发现:即使是强大的仲裁者(GPT-5.5),如果先看到较弱代理的输出,也会产生偏差,从约 98% 的单独准确率下降到 7/9。