知其形,不知其用:自动审计法律基准中的答案与权威依据脱钩

arXiv cs.CL 论文

摘要

本文提出在法律基准测试中联合自动审计答案正确性与法律权威依据的 grounding,结果表明在普通提示词下,LLM 经常给出正确答案却引用错误的适用法条。

arXiv:2608.02621v1 公告类型:新 摘要:法律基准测试通常只对最终答案进行评分,即使模型同时陈述了法律权威依据。我们测试答案正确性是否可以作为权威依据 grounded 的代理指标。在未要求引用法条的普通推理提示下,四个 LLM 在 238 道中国台湾地区律师资格考试题目中自发产生了权威依据标记。由于每道题都有经过验证的适用法条,我们自动联合审计答案正确性与权威依据 grounded 程度。这两个维度在两个方向上都会出现脱节。在刑法中,24.0–42.4% 的有效回答答案正确但遗漏了金标准法条,而 15.2–21.7% 的回答答案错误但引用了该法条。进一步的法条检索探针和允许不引用法条的干预实验表明,在输出层面,答案与引用行为可以独立变化。由于这种错位并非由对抗性或诱导不一致的提示造成,仅按答案评分的做法会将自然发生的金标准法条遗漏视为完全成功。由于法条权威依据在结构上可提取且可外部验证,这种失败可以自动测量。初步的中国大陆民法扩展实验同样观察到未要求引用时的权威依据标记,这推动了跨法域联合审计的全面开展。因此,我们提出对基于法条的法律基准测试进行答案与权威依据联合评估。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:40

# 知其形,不知其用:法律基准中答案–权威解耦的自动审计
来源:https://arxiv.org/html/2608.02621

###### 摘要

法律基准通常只对最终答案评分,即便模型也陈述了法律权威。我们检验答案正确性能否作为权威依据(authority grounding)的代理指标。在未要求援引法条的普通推理提示下,四个 LLM 在 238 道台湾律师资格考试题目上自发产生了权威标记。由于每道题都有已核验的管辖条文,我们自动联合审计答案正确性与权威依据。这两个维度在两个方向上均发生解离。在刑法中,24.0–42.4% 的有效回答答案正确但未命中黄金权威(gold authority),而 15.2–21.7% 的回答答案错误却引用了该权威。一项单独的法条检索探针和一项允让式引用克制干预进一步表明,答案与引用行为可在输出层面分别变动。由于这种错配出现在没有对抗性或一致性诱导提示的情况下,仅答案评分将自然发生的黄金权威未命中当作完全成功。由于法条权威在结构上可提取且可外部验证,这种失败可以被自动测量。一项初步的中国大陆民法扩展也观察到未要求引用时的权威标记,这推动了完整的跨法域联合审计。因此,我们提议针对以成文法为基础的法律基准进行答案–权威联合评估。

知其形,不知其用:法律基准中答案–权威解耦的自动审计

Hsien-Jyh Liao
台湾法务部
[email protected]

## 1 引言

一个模型在法律基准题中选择了正确答案,却援引了与该题已核验的黄金权威不相符的条文。基准记录为成功。个别引用错误对法律从业者而言并不意外;方法论层面的问题是:这些错误是否在普通基准作答中系统性出现,答案准确率能否察觉它们,以及它们能否大规模测量。仅基于答案的评分隐式地将两个可能不同的目标压缩为一个。对于第 \(i\) 题,基准通常只记录预测答案 \(\hat{A}_i\) 是否匹配黄金答案 \(A_i^*\)。然而,推理回答还可能陈述一个管辖权威 \(\hat{G}_i\),其与已核验的黄金权威 \(G_i^*\) 的关系在法律上具有后果。如果答案正确性与黄金权威依据可以分离,那么最终答案正确只是完全成功的成文法依据回答的必要而非充分证据。

台湾律师资格考试为这一假设提供了一个紧凑的检验。每个保留题目都有已核验的答案和管辖法条。模型被要求进行推理,但从未被要求援引法条;然而,它们以高频率产生了法条权威标记。这些标记可以被解析并与黄金条文匹配,而无需对每个输出重新进行专家评审。因此,我们对联合状态 \((A,G)\) 评分,其中 \(A\) 表示答案正确性,\(G\) 表示黄金权威依据。在四个模型中,这两个维度表现出*双重解离*:正确答案经常漏掉黄金权威,错误答案经常援引它。在刑法中,两个错配单元分别占有效回答的 24.0–42.4% 和 15.2–21.7%。由于错配出现在普通的不要求引用的提示下,这是基准正常评估机制内的效度问题,而不仅仅是对抗性压力测试的失败。由于权威依据可以被自动审计,这一发现引出了一个实用的修正:报告答案准确率、黄金权威命中率及其联合分布。

我们的贡献有三方面。首先,我们识别出答案正确性与权威依据之间非诱导的、可自动审计的双重解离。其次,我们提供了一种可添加到现有成文法基准的联合评分协议。第三,检索、非黄金权威和引用克制(citation-abstention)分析表明为何应将这两个维度分开处理,而不对隐藏推理作机制性断言。

## 2 相关工作

#### 法律基准评估。
法律 NLP 基准逐步扩大了被视为法律能力的范围。LegalBench 组织了涵盖多种法律推理形式的 162 项任务,而 LawBench 通过三个认知层面的 20 项任务评估中国法律知识 (Guha et al. (2023); Fei et al. (2024))。更近期的工作超越了粗粒度任务准确率:PLawBench 用细粒度专家评分标准评估真实法律工作流,LeMAJ 将较长的法律答案分解为自包含的法律数据点(Legal Data Points)以进行专业式的自动评审 (Shi et al. (2026); Enguehard et al. (2025))。这些方法扩展了被评估的任务或维度。然而,它们并未检验同一普通基准回答中的最终答案和所陈述的法律权威是否联合正确。

#### 推理与权威可靠性。
相关研究分别考察了法律推理质量和引用可靠性。归因和概念擦除分析表明,准确的法律结果预测不必基于法律相关的推理 (Staliūnaitė et al. (2024))。细粒度法律文本评估使用专家分类法、训练好的检测器或错误标注来识别缺口、幻觉、引用遗漏和模糊引用 (Hou et al. (2024); Gui et al. (2025))。LegalCiteBench 在面向引用的提示下直接评估引用恢复和验证,而 TW-LegalBench 报告不同任务设置下的考试和法条引用表现 (Chen et al. (2026a), b)。在法律之外,也观察到在未人为插入偏差的情况下自然出现的 CoT 不忠实 (Arcuschin et al. (2025))。

我们的设置结合了这些研究方向中分别考察的属性:权威标记在普通法律回答中未被要求的情况下出现,具有外部黄金条文,并且可以与答案联合评分。因此,由此产生的双向错配是仅答案法律评估的一个可直接测量的效度问题。

## 3 联合评估设置

### 3.1 测试平台与模型

我们最初使用来自 2022 和 2025 年台湾律师资格考试的 240 道四选一题目:120 道民法题和 120 道刑法题。在排除两道存在来源提取缺陷的民法题后,保留的数据集包含 238 道题:118 道民法

相似文章

LLM谄媚中权威层级的机制视角

arXiv cs.CL

本文通过受控的医学问答设置研究LLM中的权威偏见,揭示模型以与感知权威成比例的分级方式覆盖正确答案。该效应局限于一个关键的后层,其中正确答案表征被主动擦除。

LLM弃权的两个维度:答案正确性与问题可回答性

arXiv cs.CL

本文研究了LLM弃权的两个维度:答案正确性与问题可回答性。研究表明,单一的置信度阈值会混淆这两种失败模式,并提出了一种带有独立预算的三类选择性接受框架。在五个经过指令微调的模型上进行的实验表明,可回答性在内部是可读的,但输出置信度或自我评估难以捕捉。

当没有参考答案时,LLM评委可能过于慷慨

arXiv cs.CL

本文表明,在没有提供参考答案的情况下,LLM评委倾向于对错误答案给予过多评分,而添加参考可以将判定结果翻转多达85%,从而更符合人类判断。作者提出了在无参考设置中使用LLM评委的校准步骤。