Legora Agentic Reasoning 基准评测(4分钟阅读)

TLDR AI 工具

摘要

Legora 推出了 Legora BAR 基准,用于评估法律工作流中 AI 的 agentic reasoning,利用真实案例和 Legora harness 来衡量系统级性能。

Legora BAR 在实际环境中评估 AI 模型在真实法律案例上的表现,这与采用合成设置的传统基准不同。
查看原文
查看缓存全文

缓存时间: 2026/07/27 13:40

# Legora 代理推理基准测试 来源:https://legora.com/bar ## 为何构建此基准测试 每天,成千上万的律师事务所凭借 Legora 完成他们最重要的工作。这份信任意味着我们有责任部署最佳模型,并集中精力使 Legora 产品持续得到可衡量的改进。要做到这一点,我们需要以可重复、可靠的方式衡量自身表现。Legora BAR 正是我们实现此目标的方式。 为了提升产品质量,我们必须按照客户实际使用的方式来进行衡量。许多法律基准测试被设计为技术评估,它们在合成环境中运行,使用专为基准测试简化过的框架。这些环境虽然功能可用,但无法完全反映律师团队在实践中的体验。此外,开源案例使实验室可以在其模型上进行训练,这可能导致公开基准测试中出现人为拔高的分数。 我们采取了不同的方法。法律 AI 产品的质量不仅仅是底层模型的问题,而是模型、框架、可访问的工具以及运行系统的组合。我们的基准测试在不同实践领域的真实法律案例上评估模型,所有评估均在 Legora 框架和 Legora aOSTM 内部完成。这正是客户每天使用的同一框架和系统。环境是真实的,因此结果代表了客户的真实体验。这是我们承诺坚持的衡量标准。 我们发布 Legora BAR 的目的不仅在于衡量进展,更在于加速进展。我们持续运行此基准测试:每次评估都能帮助团队确定下一步改进方向,而每项改进都直接推送至 Legora 平台。这就形成了一个持续的评估、识别和改善循环,最终带来得到可衡量改进的产品,并随着时间的推移为客户创造更多价值。 ## 基准测试基础 当律师团队评估 AI 时,他们只关心一件事:产出工作的质量。这种质量来源于整个系统的协同运作,这就是为什么我们要对整个系统进行基准测试。这是衡量律师团队真实体验的唯一方法。 1. **Legora 框架**为模型配备了完成法律工作所需的工具、技能、法律来源和工作流程。 2. **输入提示**是您交给 Legora 的任务。目标明确、范围清晰,并带有真实律师的多样性。 3. **案件环境**是代理处理的事务。它包含律师所依赖的文件、操作手册、先例、模板以及其他材料。 4. **模型**是推理引擎。它提供核心 AI 能力,我们运行来自领先实验室的最佳模型。 ## Legora BAR 我们维护着一个不断增长的评估语料库,涵盖超过 5,000 个案例,涉及 28 个实践领域(见下文),每个案例均由法律专业人士审阅。Legora BAR 是一个经过精心挑选的子集,包含数百个由我们律所合作伙伴和内部法律工程师起草的案例。它反映了完整套件中实践领域、任务类型和难度级别的相同组合,因此基准测试能够代表 Legora 在实际法律工作中的表现。 ### 实践领域 #### 28 涵盖每个主要领域,从大规模审查到端到端起草和咨询工作。 ### 来源文件 #### 11,075 构成案例的文件,包括原始材料、先例和早期草稿。 每个评估案例(简称 eval)包含四个要素,这些要素反映了法律工作的创建和执行方式: 1. **案件描述**——输入提示:律师可能在 Legora 中运行的端到端工作流程。每个案例按短、中、长分类(见下文)。 2. **案件文件室**——文件夹结构及相应文件,包含所有与案件相关的文档。这包括但不限于事务所特定模板、操作手册、先例以及案件特定文档。 3. **Legora 答案**——Legora 的输出。可以是单个文档,也可以是协调产生的 PDF、Word 文档、电子表格、修订稿或聊天中的答案。 4. **评分标准**——我们用于对比 Legora 答案的标准。它们由专家编写,采用二进制、可逐一验证的准则,涵盖事实、分析、引用和建议。代表黄金标准输出。 每个案例根据多个类别进行分类,包括难度级别。Legora 需要在简单和复杂的提示上都有良好表现。因此,我们在基准测试中增加了难度维度,其定义基于法律专业人士非常熟悉的一个因素:**完成该工作需要法律专家花费多少时间**。这是事务所进行范围界定和计费的单位,并且跨实践领域通用。相关提示示例如下。 **短** 数小时,最多约半天 一项范围明确、指定清晰的工作:一个离散的问题,针对几个要点检查单个文档。 **中** 一到三天 一份完整的法律工作成果,如同事会被指派完成的任务:一份备忘录、针对操作手册的修订稿、一份诉状部分、一份披露附表。 **长** 一周或更长时间,可达数百小时 推动整个事务前进的端到端交付:一份完整的立场文件、一份完整的诉状、一笔交易的整套文件。需要资深判断力,处理大量庞杂的记录。 ## 为什么案例保持非公开 基准测试运行在实际律所使用案例上,由认可的合作伙伴提供,使用合成和/或匿名化数据。由于我们使用了参与者的实际知识和知识产权,因此不会将它们开源。这一限制也是优势。当基准测试案例公开后,它们最终会进入下一代模型的训练数据。这意味着高分可能反映出模型对测试内容的熟悉程度,而不仅仅是能力。我们的案例保持非公开。每个分数反映代理第一次接触该项工作时的表现,就像律师面对新案件一样。 为了透明起见,我们与 AfterQuery 合作,开源了其中一个案例。这是一个完全合成的案例,模仿了 BAR 内部的非公开案例,并准确展示了我们如何构建和评分一个案例。AfterQuery 对其进行了审查,确认我们的数据整理方法符合行业标准。 ## 定义质量——如何评分 每项任务附带一份定义明确的准则列表:即评分标准,涵盖优秀答案必须正确的项目,由法律专业人士编写。我们根据答案实际正确完成清单项的比例进行评分。该百分比即为质量评分(Quality Rubric Score)。我们在 Legora 平台内部的隔离沙盒环境中运行评估。这种环境在功能上与客户体验完全相同,且操作在隔离状态下进行,仅限访问可用的数据。每个案例连续运行三次以确保统计相关性,输出由 LLM 作为评判者进行评分,然后与相应的评分标准进行对比。此过程对所有模型重复执行。关于我们评估平台技术设置的更详细博客文章将稍后发布。 ### 01 律师编写检查清单 优秀答案的必备要素:事实、分析、结论和来源。 ### 02 系统执行任务 它处理事务并产出交付成果,就像律师被要求做的那样。 ### 03 我们勾选正确项 它满足清单的比例即为分数。重要项目的权重高于次要项目。 ✓ 识别每一项重大控制权变更条款 高 ✓ 正确标记终止权利 高 ✓ 解释关键风险的商业影响 中 ✓ 提出适当的修订措辞 低 ✕ 注明次要申报截止日期 低 **该答案在高重要性要点上全部正确,仅遗漏了一个低重要性项目,因此得分较高。若错过了高重要性项目,则分数下降幅度远大于遗漏低重要性项目。** 有些代理基准测试采用全有或全无评分:交付成果要么满足所有标准,要么完全失败。全有或全无评分将所有结果简化为单一通过/失败,从而隐藏了系统在真正重要的工作上——即差异最为关键的地方——的实际表现。 我们转而采用加权评分。加权评分反映了合伙人审查工作的方式:遗漏一个定义术语与遗漏一项重大控制权变更条款同为起草错误,但没有合伙人会认为它们严重程度相同。加权过程是法律工程师在审查案例时工作的重要组成部分。他们运用专业知识,根据未满足标准时交付成果给利益相关者带来的风险程度,将评分标准标记为高/中/低重要性。由于高重要性遗漏会受到严厉惩罚,因此一个实质上不完整的交付成果仍然会像不完整的成果一样得分。 ## 主要发现 基准测试最引人注目的对比在于模型本身:每个模型都在 Legora 框架中针对相同的案例和任务运行,并使用我们的质量评判者进行评分。我们的评估涵盖多个维度,包括整体输出质量、成本、延迟和引用覆盖率。虽然输出质量是我们衡量的关键组成部分,但模型在质量上得分高并不一定代表其性能的全貌。对于重复性短任务或表格审查中的批量操作,速度和成本可能是律师团队优化的关键指标。 Legora 与模型无关。我们有意识地评估一系列模型,有些已经在 Legora 平台中上线,有些尚未上线。我们与前沿实验室密切合作,评估新模型,并提供反馈以优化其在 Legora 框架和法律垂直领域中的表现。这使我们能够始终站在 AI 技术前沿,并将表现最佳的模型实时部署给客户。在此基准测试中,我们针对来自 Anthropic、OpenAI 和 SpaceXAI 的一系列模型进行了评估。 下图展示了不同模型和难度级别下的相对输出质量得分,黑色水平线代表平均值。模型在较短的法律工作上表现相似,但随着工作变长、复杂度提高,差异开始显现,此时在整个事务中保持判断力至关重要。在最长的任务中,Fable 5、Grok 4.5、Opus 4.8 和 Sonnet 5 均显著优于整个套件的平均值。 ### 按难度划分的质量 每个难度面板均已归一化至该难度下七个显示模型的平均值。 [图表说明:各模型按难度(短/中/长)显示相对质量得分,标注模型包括 5.6 Luna、5.6 Sol、5.6 Terra、Grok 4.5、Opus 5、Fable 5、Opus 4.8、Sonnet 5 等。] ### 质量与延迟及成本 当我们考察质量与速度之间的权衡时,各模型呈现出差异,其中 Grok 4.5 在保持高质量输出的同时,每个案例的耗时最低。 **质量与每案例中位延迟** 整体质量相对于七模型平均值,与每案例中位数分钟数的对比。 [图表说明:横轴为中位延迟(越靠右越慢),纵轴为相对质量,显示 Grok 4.5 最优(快速且高质量),其他模型如 Opus 4.8、Fable 5、GPT-5.6 Sol、Sonnet 5、GPT-5.6 Luna、GPT-5.6 Terra、Opus 5 分布不同位置。] 在质量与成本方面,Grok 4.5、Sonnet 5、Opus 4.8 等模型在提供高质量的同时,成本低于该组的平均水平。 **质量与每案例成本** 整体质量相对于七模型平均值,与以公开标价计算的每案例平均成本的对比。 除了针对特定模型的评估,Legora BAR 还是指导我们对 Legora 框架进行性能改进的关键工具。自推出 Legora aOS 以来,我们利用 BAR 结果改进框架,使得所有已在生产中运行的模型的相对输出质量提升了 5%。 **相同模型,相隔一个月——框架改进** 质量 五月平均值 ≈ 相对提升 5% 六月到七月,相同模型 2026 年 6 月 → 2026 年 7 月 该线图显示了相同模型集在六月份和七月份使用我们框架评估的平均基准质量。由于模型本身没有改变,提升反映了 Legora 框架和平台的进步,而非任何单个模型的变化。图表展示了方向和大致规模,而非绝对分数。 ### 引用表现 利用 AI 进行法律分析需要高度的信任,而这种信任离不开信息源的透明度。律师必须能够对 Legora 产生的每个答案进行事实核查,这正是我们为所有答案提供引用的原因。 由于 Legora BAR 在真实的案件文件室内运行,它还能够衡量输出质量最重要的指标之一:引用得分。Legora 要求其产生的每个答案都必须附带引用,因此我们衡量两件事: - **引用答案**得分检查每个主张是否确实带有引用。 - **依据来源**得分检查 AI 生成答案时所参考的源文档是否反映在引用中。换句话说,它是否引用了所有它所依赖的内容? 在下图中,我们看到 OpenAI 模型在引用答案得分方面排名最高。在依据来源得分方面,Fable 5 和 Opus 4.8 表现尤为突出。 [图表说明:横轴显示引用答案和依据来源两个维度,纵轴为相对得分,标注模型包括 Grok 4.5、Sonnet 5、Opus 4.8、5.6 Luna、5.6 Terra、5.6 Sol、Fable 5、Opus 5 等,平均值线为 1.00x。]

相似文章

AGORA: 基于档案的智能体工作场所文档推理基准

arXiv cs.CL

AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。