针对单一模型设防,对下一个开放:法律多项选择基准中的仅选项可解性

arXiv cs.CL 论文

摘要

本文证明法律多项选择基准易受仅选项可解性影响,即模型无需题目即可正确作答,并且基于单一模型性能的过滤并不能提高对其他模型的有效性。

arXiv:2608.15428v1 公告类型:新 摘要:多项选择基准的评分基于模型是否选择了正确选项,而非是否需要题目。测量这一差距需谨慎:一个模型在大多数题目上回答A,只要关键答案在A上,得分就会高于随机水平,并且在不是A时会被视为识别能力。我们在UA-JudgeExam上进行测量:11,990个四选项题目,带有官方答案键,由乌克兰法官高等资格委员会发布。 仅显示选项而没有题目,Claude Haiku 4.5 得分为0.383(相对于随机水平),且泄漏集中:11.8%的题目在所有八种选项顺序中都能盲答正确,而随机期望仅为0.2题。这不是引用:搜索超过280,059版乌克兰法律仅恢复0.128。过滤掉这些后保留8,128题,在这些题目上,过滤模型本身现在得分为0.204,而未参与选择的GPT-5.6在题目隐藏时仍能正确回答0.515。对十二个保留模型在整体集合上评分,并减去每个模型的答案位置习惯,只有两个保持超额:GPT-5.6为+0.265,Sonnet 4.6为+0.081。没有它,排名会误导:Llama 3.1 8B盲答得分为0.292,高于除这两个外的所有模型,这纯粹是因为它在92%的题目上回答A。 过滤确实选择了一些真实的东西:在它拒绝的题目上,十二个模型中有十一个得分在0.518-0.789之间,每个区间都明显高于同一模型在保留题目上的得分。但这个信号是单一模型的,基于它过滤并不能向上转移。在400题样本上也不可见,其中九个模型被读作“统计上随机”。改写干扰项则过度降至0.168,低于随机水平且可被利用。在LEXam上进行相同的探测返回随机水平:每个选项都指向题干,没有超过33个字符。题目格式决定问题是否可能出现;能力决定被提取的多少。我们发布语料库、预测和工具。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:08

# 对单一模型设防,对下一模型开放:法律选择题基准中的选项可解性  
来源:https://arxiv.org/html/2608.15428  

###### 摘要  
选择题基准的评分标准在于模型是否选择了正确选项,而非是否依赖了问题本身。衡量这一差距需谨慎:若模型对大多数题目都选择A,那么无论正确答案是否为A,其得分都会高于随机水平;当答案非A时,这种行为会被误判为“识别能力”。我们在UA-JudgeExam(乌克兰法官最高资格委员会发布的11,990道四选一题目及官方答案)上对此进行了测量。当仅提供选项而*隐藏问题*时,Claude Haiku 4.5得分为0.383,显著高于随机概率(0.25),且该漏洞呈现集中性:11.8%的题目在所有八种选项排列顺序下都能被“盲解”,而随机情况下预期仅有0.2题。这并非直接引用搜索:在280,059份乌克兰法律文本中检索仅能找到0.128题。排除这些题目后保留8,128题,进行过滤的模型本身在此子集上得分0.204——而未参与过滤的GPT-5.6在隐藏问题的情况下仍能正确回答0.515。在包含全部题目的十二个保留模型评分中,扣除每个模型的位置偏好后,仅两个模型保持超额正确率:GPT-5.6(+0.265)和Sonnet 4.6(+0.081)。若不扣除位置偏好,排名会产生误导:Llama 3.1 8B在盲测中得分0.292,超过除上述两者外的所有模型,但这纯粹是因它对92%的题目都选择了A。过滤机制确实筛选出了真实信号:在它拒绝的题目上,十二个模型中有十一个得分在0.518至0.789之间,且每组得分区间都明显高于同一模型在保留题目上的得分。但该信号仅代表特定模型,过滤效果无法向更强模型迁移。在400题样本中,九个模型的得分在统计上与随机无异。改写干扰项反而使得分降至0.168,低于随机水平且易被利用。在LEXam基准上重复相同探针测试,结果与随机一致:所有选项均指向题干内容,且长度均不超过33字符。题目格式决定了该问题是否可能产生;模型能力则决定了信息被提取的程度。我们公开了语料库、预测结果及测试框架。  

关键词:基准效度、选择题评估、捷径学习、法律NLP、乌克兰语、数据污染  

## 1 引言  
选择题基准通常仅报告一个数值:模型选择正确答案的频率。该数值被视为模型在该领域能力的证据。但只有当问题本身具有实际作用时——即模型无法仅从选项中找到答案——这一证据才成立。当题库未能通过此项检验时,显而易见的修复方法是过滤:剔除模型无需问题即可回答的题目,保留其余部分。本文的核心发现是:这种修复方法并不奏效。我们对官方发布的司法考试题库进行过滤,直到过滤模型在剩余题目上的盲测得分降至0.204(低于随机水平);但未参与过滤的GPT-5.6在隐藏问题的情况下仍能正确回答其中0.515的题目。针对单一模型清洗的题库,对更强大的模型并不干净,且我们未找到使该方法有效的改进版本。在选项为自足命题的专业资格考试材料中,这并非假设性问题。干扰项由人类在时间压力下编写,错误选项的错误原因包括:引用错误法规、写错截止日期,或断言某法规未提及的内容。熟悉该领域的读者可能仅凭选项就能识别出像真实法律表述的那个选项——无需查看问题。正如我们所示,模型也能做到,尽管我们并未测试人类读者。在该现象发生的范围内,基准衡量的是对规范法律表述的识别能力,而非其声称要衡量的推理能力。当选项是指向题干的指针(如“i和iii”)时,该问题不会产生。我们证明,正是这一区别而非主题内容,划分了我们测试的基准。我们将这一现象作为研究主体而非脚注。  

我们的贡献如下:  
1. **过滤效果不可迁移**。剔除单一模型可猜中的题目后,题库保留了67.8%,且过滤模型自身在剩余题目上的得分降至0.204——但GPT-5.6在隐藏问题的情况下仍能正确回答0.515。改写干扰项反而使得分低于随机水平。两种修复方法均未产生中性数据集(§6、§8)。  
2. **测量协议与偏差分离估计器**。盲测条件在选项排列中运行,且选择模型与报告模型分离。通过强制正确答案依次占据每个位置,当选择与内容无关时,四个准确率之和为1,因此其平均值在构造上即为随机概率,任何超出部分均来自内容。以此方法测量,十二个保留模型中有十个完全未提取信息,且提示措辞、选项标记或推理时思考均无法解释其余两个模型的提取行为(§5、§6.1–§6.3)。  
3. **无泄漏基准及其成因**。在LEXam上重复相同探针测试,结果与随机一致;其所有题目均采用参考式选项,长度均不超过33字符。决定该问题是否存在的属性是选项格式,而非主题内容(§7)。  
4. **资源公开**。UA-JudgeExam:包含11,990道题目及官方答案,通过独立第二路径验证提取准确性;另含过滤后的8,128题子集及表格背后所有预测结果(§3)。  

## 2 相关工作  
#### 无需问题的作答行为  
我们使用的探针并非新颖。Balepur等人(2024)在三个MCQA数据集上仅提供选项并提示模型,在12种情况中有11种击败了多数基线,且未发现该现象源于记忆,也未发现对单个选项的先验分布能完全解释该现象。Cho等人(2026)从评分角度切入同一问题,提出一种隔离问题对模型决策贡献度的度量方法。两者均证实该现象在通用领域选择题中普遍存在。我们将其视为既定事实,并提出后续问题:在专业法律考试材料中该效应有多大?过滤能否消除它?针对单一模型构建的过滤器能否抵御其他模型?题目集的何种属性决定了该问题是否会产生?  
#### 法律基准  
法律NLP基准主要基于英语(Guha等, 2023; Chalkidis等, 2022; Hendrycks等, 2021),LEXTREME(Niklaus等, 2023)将覆盖范围扩展至24种语言,但其任务为分类和词级提取而非选择题,因此盲测条件不适用。Östling等人(2023)的语料库在法律和伦理层面与我们资源最为接近——这是一个通过机构审查后发布的国家法院语料库,发布时附带限制条件;而我们能够完整公开,仅因为题库属于版权外的政府文件。考试衍生的基准继承了出题专业的写作规范,包括本文所述的干扰项编写惯例:LEXam(Fan等, 2026)将340场法律考试构建为推理基准,Katz等人(2024)直接评估专业资格考试。我们在§7对LEXam的四选一版本进行盲测条件测量,发现完全无泄漏,原因在于其选项编写方式而非主题内容。  
#### 位置与选择偏差  
另一系列研究表明,模型对选项的*位置*敏感。Zheng等人(2024)记录了20个模型对特定选项ID的系统性偏好,并将其追溯至词元偏差——对“A/B/C/D”词元本身的额外概率质量——并通过排列选项内容进行去偏;Pezeshkpour和Hruschka(2024)展示了对选项顺序的相同敏感性。该文献与本文在单次排序实验中易混淆的测量存在差异,因为仅偏好某个位置的模型在正确答案恰位于该位置时也会得分高于随机水平。§6.2通过强制正确答案依次占据每个位置来分离两者,发现两者正交:在我们数据集中位置偏好最强的模型并非泄漏最多的模型。我们的标签扫描也涉及机制问题,因为将选项重新标记为西里尔字母或数字后,对第一位置的回避基本保持不变。  
#### 捷径与伪迹  
自然语言推理中关于标注伪迹的研究确立了模型利用假设本身信号的现象(Gururangan等, 2018; Poliak等, 2018);盲测条件是其在选择题中的对应。法律领域最接近的研究是Watson等人(2026),他们基于33,158份英国劳资审裁处索赔书,探讨法律判决预测是真正预测了什么,还是仅读取了判决书中残留的结果提示语言。他们的结论与我们的分歧值得阐述:他们移除了泄漏的*特征*,任务依然存在——宏F1值几乎未降,因此底层存在真实信号。我们移除了泄漏的*题目*,但基准在相同意义上不再成立——保留的子集对选择模型是干净的,但对更强大的模型则不然。从每个实例中删除线索与删除包含该线索的实例是不同的操作,且只有前者能保持测量完整性。  

## 3 UA-JudgeExam  
### 3.1 来源  
乌克兰法官最高资格委员会(ВККС)发布了用于上诉法官候选人匿名笔试的完整题库及每道题目的答案。我们使用委员会2024年7月15日第221/зп-24号决定发布的题库:共五份文件,总计1,672页,涵盖一般法律知识及行政、商事、刑事和民事专业方向。每道题目恰好四个选项,文件标注恰好一个为*правильна*(正确),三个为*неправильна*(错误)。题库作为委员会决定(ршення)的附件发布。乌克兰《版权与相关权法》(第2811-IX号法律)第8(1)(3)条规定,版权保护不适用于“国家机关的文件...政治、立法、行政和司法性质的官方文件(法律、法令、条例、*决定*、国家标准等)”。据此,我们重新发布题库时注明发布决定来源。题目涉及法律要点,不含个人数据。  
### 3.2 题目示例  
表1:题目vkks-2024-commercial-2237(附英文注释);正确答案为C(加粗)。选项为自足法律命题,正是这一属性使盲测条件具有意义。《民法典》第31条赋予未满14岁者*独立进行日常小额交易*的权利——选项D用*рзн*(“各种”)替换*дрбн*(“小额”),后者非法律术语;选项A用*майнов*(“财产”)替换实际授予的*особист немайнов*(“人身非财产”)权利。区分这些选项需要了解法典,而非阅读问题。  
**问题**:Як д ма право самостйно вчиняти фзична особа, яка НЕ досягла 14 рокв?(未满14岁者可独立实施哪些行为?)  
A) Здйснювати майнов права на результати нтелектуально дяльност, що охороняються законом(行使受法律保护的知识产权的财产权利)  
B) Розпоряджатися банквським вкладом, унесеним нею на сво м’я(处置以其名义存入的银行存款)  
C) Вчиняти дрбн побутов правочини(进行日常小额交易)  
D) Вчиняти рзн побутов правочини(进行各种日常交易)  
这种格式会导致泄漏。与LEXam(§7)对比,其四选一题目提供的选项如“i和iii”——指向题干中陈述列表的指针,自身不携带法律内容。  
### 3.3 提取与验证  
文档为PDF格式的规则表格。我们使用表格解析器提取,并通过*第二条独立路径*验证结果:该路径从表格水平线重建行,从垂直线重建列,从词坐标重建单元格内容——与第一条路径不共享代码。该比对对空白和换行连字符不敏感,因为两条路径以不同方式连接换行单词。提取得到11,990道格式正确的题目,另有385道委员会自身标记为“已排除”(Виключено ршенням)的题目,以及40道不符合“四选项一答案”不变式的题目。在200题分层试点中,第二条路径在0.995的题目上确认了题目文本、四个选项顺序及答案。在整个题库中,题目文本确认率为0.9896,选项顺序确认率为0.9888,答案确认率为0.9841;未通过至少一项检查的192题(1.6%)在发布时列出标识符。五道题目在源文件中格式错误,我们按原样发布而非静默修复:其中一题在PDF中第四个选项为空白,四题包含两个相同选项。它们均不包含在用于后续探针测试的400题样本中,该样本无空选项。提取细节值得说明,因其涉及静默失败模式:942道题目中编号单元格未被提取,导致天真地将两个相邻题目合并为一条八选项记录。通过检测在选项已累积时出现新题目题干来识别合并,可恢复这些题目;恢复后的编号在五份文件中均无重复(文件为委员会编号的命名空间),此检查验证了恢复的可靠性。  

## 4 可解性分布  
在询问模型得分前,我们先确立简单策略的得分。除非特别说明,所有数值基于11,990题的完整题库及发布选项。  
表2:无需对问题进行推理即可获得的结果。随机概率为0.25。表面特征几乎不携带信息:正确选项平均比干扰项长2.6字符,且无长度或位置启发式方法能超过0.301的得分。正确答案位于A的比例为28.9%,B和C各24.8%,D为21.5%,因此位置偏好可带来轻微收益;我们在§6中明确控制该变量。  
### 4.1 词汇搜索并非主要机制  
一种合理推测是:正确选项复制自法规文本,而干扰项为虚构,因此文本检索可决定题目。我们对此假设进行了检验。

相似文章

当选择成为风险:多选题约束下大语言模型的安全失效

arXiv cs.CL

# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。