L-MAD:法律推理中多智能体辩论结构的系统性评估

arXiv cs.AI 论文

摘要

本文介绍了L-MAD,一个用于系统性评估法律文本蕴含中多智能体辩论结构的框架。研究发现,增加智能体数量可提升准确率,但延长辩论轮次会导致有害的过度 deliberation 漂移,使得智能体互相强化错误,相较于单智能体基线最高提升8%。

arXiv:2607.09099v1 Announce Type: new \n摘要:尽管多智能体辩论(MAD)框架在通用推理中展现出显著潜力,但其在高结构化的、知识密集型法律领域中的有效性仍待探索。在本工作中,我们提出了法律多智能体辩论(L-MAD)框架,以系统性评估法律文本蕴含中不同的辩论结构和聚合方法。通过为多个智能体分配不同的专家角色,L-MAD相较于强单智能体基线提升了高达8\%。此外,分析辩论规模的扩展揭示了明确的权衡:增加智能体数量可降低不一致性并提升准确率,而延长讨论轮次则会导致有害的\textit{over-deliberation drift},即智能体互相强化彼此的错误。最终,我们的发现勾勒出了在高风险法律推理环境中部署协作多智能体系统的实际边界和安全边际。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:52

# 多智能体辩论结构在法律推理中的系统性评估
来源:https://arxiv.org/html/2607.09099
Hoang\-Trung NguyenHuu\-Dong NguyenTruong Dinh DoThi\-Hai\-Yen VuongLe\-Minh Nguyen

###### 摘要

尽管多智能体辩论(MAD)框架在通用推理中展现出巨大潜力,但在高度结构化、知识密集的法律领域中,其有效性仍未被充分探索。在本工作中,我们提出了法律多智能体辩论(L-MAD)框架,系统性地评估了法律文本蕴含任务中不同的辩论结构和聚合方法。通过为多个智能体分配不同的专家角色,L-MAD 在强单智能体基线上提升了最多 8%。此外,分析辩论规模的扩展揭示了清晰的权衡:增加智能体数量可降低不一致性并提高准确率,而延长讨论轮次则会导致有害的过度商议漂移现象,即智能体相互强化各自的错误。最终,我们的发现勾勒出在高风险法律推理环境中部署协作式多智能体系统的实际边界与安全裕度。

机器学习,ICML

## 1 引言

大型语言模型(LLM)在通用推理中展现出卓越能力,但在要求严格逻辑的高风险、知识密集型领域中往往表现不佳。法律文本蕴含(LTE)(Aoki 等,2022(https://arxiv.org/html/2607.09099#bib.bib29);Bilgin 等,2024(https://arxiv.org/html/2607.09099#bib.bib41))是对这些模型的一项具有挑战性的测试,要求模型判断特定法律条文是否适用于给定事实场景(Aletras 等,2016(https://arxiv.org/html/2607.09099#bib.bib39);Zhong 等,2020(https://arxiv.org/html/2607.09099#bib.bib40))。尽管像 LegalBERT(Chalkidis 等,2020(https://arxiv.org/html/2607.09099#bib.bib44))和 Lawformer(Xiao 等,2021(https://arxiv.org/html/2607.09099#bib.bib45))这样的专精模型优于通用基线,但标准的单模型推理仍然受限于模型的基本推理能力及其产生事实性或逻辑性错误的倾向。

参见图注

图 1:本研究所用决策协议示意图。多智能体辩论(MAD)框架通过允许模型在推理时投入更多算力,提供了一种有前景的解决途径(Nie 等,2020(https://arxiv.org/html/2607.09099#bib.bib47);Choi 等,2026(https://arxiv.org/html/2607.09099#bib.bib34))。通过为多个 LLM 智能体分配不同的专家角色,这些框架使模型能够迭代并完善其论证,从而得出更优的最终答案(Kaesberg 等,2025b(https://arxiv.org/html/2607.09099#bib.bib48))。然而,这些辩论框架在高度结构化、规则约束的领域(如法律)中的表现仍未得到充分探索。虽然开放式辩论在通用任务中通常有帮助,但在法律推理中会引入独特挑战。强迫智能体达成一致与允许它们独立投票之间的权衡,以及错误在多轮讨论中倍增的风险,尚未得到系统性的分析。

为弥补这一空白,我们提出了法律多智能体辩论(L-MAD)框架,旨在严格法律规则下系统分析不同的多智能体辩论结构(图1(https://arxiv.org/html/2607.09099#S1.F1))。与先前主要关注将 LLM 与外部工具连接的工作不同,L-MAD 提供了一个受控环境来评估核心聚合方法。具体而言,我们比较了强制共识策略(智能体相互辩论直至达成一致)与投票方法(智能体保持独立推理路径)。

我们的实证结果表明,L-MAD 显著提升了性能,在某些设置下比强单智能体基线高出最多 8%。关键的是,我们发现最佳辩论策略高度依赖于基础模型的能力。对于高能力模型(例如 300 亿参数以上),强制共识通过鼓励建设性辩论效果良好;而独立投票则保护较小的模型(例如 80 亿参数)免受表面共识的影响。此外,探索辩论规模的扩展揭示了清晰的权衡:增加智能体数量可降低不一致性并提高准确率,但增加讨论轮次会导致过度商议漂移——一种智能体互相附和并强化彼此错误的行为,最终损害性能。

总结而言,我们的核心贡献如下:

- • 系统性地评估了多智能体辩论框架在高风险、知识密集型法律领域决策中的应用。
- • 清晰分析了增加参与智能体数量与延长辩论轮次之间的扩展权衡。
- • 提供了关于在协作式法律推理环境中部署多智能体 LLM 系统的边界和安全裕度的可操作见解。

## 2 预备知识

### 2.1 法律文本蕴含

我们采用法律文本蕴含任务来评估 LLM 从事实描述和法规规则中准确推断法律结论的能力。通过强调微妙的语言和法理区分,该任务严格检验模型是否真正理解法律理论。下文是一个任务示例(原文为日文的官方翻译):

> 前提:(成年被监护人法律行为)第9条 成年被监护人所实施的法律行为可撤销;但购买日常必需品及其他日常生活相关行为不在此限。假设:若成年被监护人未经成年监护人同意购买日常必需品,成年监护人可撤销涉及该购买的合同。蕴含:否

更形式化地,设 S = {S₁, S₂, ..., Sₙ} 表示一组相关法律条文,Q 表示一个法律假设。法律文本蕴含任务可视为一个二元分类问题,将元组 (S, Q) 映射到标签 y ∈ {1, 0},分别对应 Entails(S, Q) 和 Entails(S, ¬Q)。

该任务的主要评价指标是分类准确率。由于基准数据集在正反例之间严格平衡,随机猜测基线或朴素均匀预测启发式方法的期望准确率约为 0.50。

### 2.2 提示技术

##### 标准提示与上下文学习。

标准提示从参数化为 θ 的模型中,针对查询 q 生成答案 a,形式化建模条件分布 P_θ(a|q)。上下文学习(Brown 等,2020(https://arxiv.org/html/2607.09099#bib.bib21))通过将语言模型条件化在一小样本集 D = {d₁, d₂, ..., dₙ} 上来增强生成过程,有效建模 P_θ(a|D, q),无需更新参数。

##### 法律推理思维链 (IRAC)。

激发中间推理步骤能显著提升 LLM 在复杂认知任务上的能力(Wei 等,2022(https://arxiv.org/html/2607.09099#bib.bib25))。标准 CoT 通过为每个样本添加理由 rᵢ(使得 dᵢ = (qᵢ, rᵢ, aᵢ))来扩展上下文学习范式。rᵢ 的复杂性和结构严谨性与下游性能直接相关(Fu 等,2022(https://arxiv.org/html/2607.09099#bib.bib37))。在法律领域,Yu 等人(2022(https://arxiv.org/html/2607.09099#bib.bib9))通过 IRAC 框架对该方法进行了特化——这是一种经典的法律推理结构,包含四个独立阶段:问题(识别法律争议)、规则(检索适用法规)、应用(将规则映射到事实矩阵)和结论(得出最终法律裁决)。

##### 自一致性。

为缓解单路径解码的随机性,自一致性(Wang 等,2022(https://arxiv.org/html/2607.09099#bib.bib10))采样一组多样的推理路径,并对其执行边际化操作以找到最稳健的答案。通过从模型中抽取多个独立生成结果,最终预测 a* 通过多数投票获得,定义为 a* = argmaxₐ ∑ᵢ I(aᵢ = a)。虽然这种类似集成的方法有效增加了找到正确推理路径的可能性,但其性能仍受限于基础模型自身的推理能力上限。

### 2.3 面向决策的多智能体辩论

多智能体辩论是一种协作框架,其中多个语言模型智能体进行结构化的交互(通常以迭代交换或讨论的形式)来解决问答或文本生成等任务。在典型的 MAD 协议中,每个智能体独立生成初始回复,然后参与一系列辩论轮次。在第 t 轮,每个智能体接收原始问题以及其同伴在第 t-1 轮的回复,从而促使模型相应更新其回复。这种迭代过程旨在利用多样化的推理路径和同伴智慧,可能提升整体决策质量。在所有辩论轮次结束后,最终答案通常通过一种聚合机制(如多数投票)得出。

## 3 方法论

在本节中,我们将形式化我们的多智能体框架架构,详细描述商议拓扑结构、基于提示的响应条件化以及决策聚合协议。

### 3.1 框架配置与拓扑

我们的多智能体辩论框架由三个基础元素参数化:商议拓扑、决策协议和智能体特定响应生成器。我们采用 Kim 等人(2024(https://arxiv.org/html/2607.09099#bib.bib20))的方法,为每个辩论会话初始化三个不同的、自动生成的专家角色。来自 Yin 等人(2023(https://arxiv.org/html/2607.09099#bib.bib14))的实证证据表明,三方配置在视角多样性和计算开销之间提供了最优的理论权衡。通过实例化不同角色,我们有效地向推理过程中注入了领域特定的归纳偏置,确保了对解空间的稳健探索。

在商议过程中,智能体在离散的通信轮次中交换信息。在每轮中,智能体异步运行,基于一个滑动上下文窗口(限制为最近两轮)关注其同伴在先前轮次广播的消息。这个截断上下文作为一种注意力正则化机制,旨在限制上下文稀释,防止与原始假设发生灾难性漂移。辩论的精确终止条件严格由所选的决策协议决定。对于共识协议,智能体每轮明确表示同意或不同意,迭代调整立场直至达到阈值。对于投票协议,智能体在固定轮次(例如三轮)内进行通信,然后进行最终投票。

### 3.2 响应生成与决策协议

智能体提示的语义结构对多智能体商议的轨迹有很大影响。我们采用简单响应生成器作为默认模板,该模板使智能体能够中立地评估前序论点,不带对抗性偏倚,在维持建设性对话的同时容纳角色设定。

为将异质推理路径聚合为最终输出,我们实现并评估两类不同的决策协议:

基于共识的协议。这类协议强制进行主动协商,驱使智能体在数学上收敛于一个统一的假设。仅在满足预定义的智能体间一致同意阈值时,才形式化最终决策。我们定义了三个递进阈值:多数(>50%同意)、超级多数(>66%同意)和全体一致(100%同意)。基于 Yin 等人(2023(https://arxiv.org/html/2607.09099#bib.bib14))的标准多数投票机制,我们采用一种混合共识方法,要求初始收敛时全体一致,同时默认采用超级多数阈值以防止在轮次限制时陷入僵局。

基于投票的协议。与强制共识不同,投票协议将商议阶段与最终聚合步骤解耦,允许智能体在整个辩论过程中保持隔离、并行的推理轨迹。在通信轮次结束后,协议停止论证并触发离散投票机制。出现平局时,框架触发一轮补充商议,随后进行打破平局的投票。受 Yang 等人(2024(https://arxiv.org/html/2607.09099#bib.bib19))启发,我们采用一种排序选择方案,其中每个智能体对候选解(例如等同于 Borda 计数)给出严格的偏好排序。聚合排序分数最高的假设被确立为最终的法律蕴含判断。

## 4 实验

### 4.1 基准

表 1:三年 COLIEE 基准的数据统计。实验使用了 COLIEE 2026 任务 4 提供的训练和测试数据集。虽然本研究未进行模型微调,但训练数据被用于选择少样本提示的示例。

为分析逐年性能变化,我们使用了从 2024 年到 2026 年共三年的评估数据。COLIEE 2026 正式运行使用 2025 年测试子集,而我们的方法比较则报告为对 2024-2025 年的事后控制比较。数据集中的问题 ID 遵循日本年号命名惯例,例如 R05 对应 2023 年,依此类推至 R07 对应 2025 年。训练和测试数据集中的每个样本包含以下信息:相关条文、查询、答案(Y:正确 / N:错误)。基准统计数据见表1(https://arxiv.org/html/2607.09099#S4.T1)。

### 4.2 指标

我们使用准确率作为评价指标来评估各方法的性能。模型输出从固定输出标签中解析:“Answer:Y”(正确/真)和“Answer:N”(错误/假)。准确率通过将解析出的标签与真实标签进行比较来计算。

### 4.3 基线与实现细节

我们将 L-MAD 与多种提示基线进行比较,包括零样本、法律理论思维链(IRAC)(Yu 等,2022(https://arxiv.org/html/2607.09099#bib.bib9))、少样本和自一致性(Wang 等,2022(https://arxiv.org/html/2607.09099#bib.bib10))。

实验使用的 LLM 包括 Qwen3-8/32B、Qwen3-30B-A3B(Yang 等,2025(https://arxiv.org/html/2607.09099#bib.bib11))、Llama3.1-8B(Dubey 等,2024(https://arxiv.org/html/2607.09099#bib.bib12)),均为指令微调版本。所有实验均在单个 A6000 GPU(49GB 内存)上进行。实现中将温度设为 0.1 以生成多样化的推理路径。所有模型以 bfloat16 全精度加载。自一致性方法在三个独立样本上聚合。少样本示例通过 BM25 从训练集中检索,示例个数设为 6。

相似文章

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。

潜在智能体:一种内化多智能体辩论的后训练方法

Hacker News Top

波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。