小型模型能否遵循您给定的法律?孟加拉国法律问答中的上下文注入微调

arXiv cs.CL 论文

摘要

本文研究了上下文注入微调是否能提升小型语言模型在孟加拉国法律问答中利用检索到法律的能力。使用0.8B、2B和4B规模的Qwen3.5模型,发现微调在较小规模上有帮助,但在4B规模上无显著增益,并减少了语言漂移。

arXiv:2607.23446v1 公告类型: 新论文 摘要: 一个小的语言模型即使接收了相关成文法条文仍可能给出错误答案。我们测试了在包含相关法律的例子上进行微调是否能改善后续对检索到的法律的利用。我们从六部孟加拉国法案和三份附表中整理了2,165条双语问答记录,然后在0.8B、2B和4B规模的Qwen3.5上进行微调。评估使用2022年和2023年孟加拉国律师协会考试(孟加拉语及机器翻译英语版本),无检索、BM25或FAISS,通过三次随机种子运行的一致性评分。在0.8B规模上,微调将2022年英语FAISS分数从2/100提升至34/100。0.8B和2B的增益通过了配对检验,但4B模型未检测到净增益:孟加拉语有改善,而若干英语条件出现退步。微调还使答案从孟加拉语漂移到多数为英语的比例从44.0–53.2%降至0.2–0.7%,在所有规模上调整后p<.001。因此,检索质量并非唯一瓶颈。小型双语法律模型在使用提供法律的方式以及是否用所请求语言回答方面也存在差异。数据集公开于 https://huggingface.co/datasets/momahadi/bangladesh-legal-qa-dataset。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:29

# 小模型会使用你提供的法律条文吗?孟加拉国法律问答中的上下文注入微调

来源:https://arxiv.org/html/2607.23446

Moniruzzaman Mahadi¹, Abrar Mohammed Tanzim Alam¹, Sayma Siddika Monalisa¹, Mir Mohammad Asif Abdullah¹, Swakkhar Shatabda², Md Adnan Arefeen¹

¹ 南北大学电气与计算机工程系,孟加拉国达卡
² 布拉克大学计算机科学与工程系,孟加拉国达卡
通讯邮箱:[email protected]

###### 摘要

一个小型语言模型在接收到相关法律条文后,仍可能给出错误答案。我们测试了在包含相关法律的示例上进行微调是否有助于后续使用检索到的法律。我们从六部孟加拉国法案和三份附表中整理了2,165条双语问答记录,然后对Qwen3.5在0.8B、2B和4B规模上进行微调。评估使用2022年和2023年孟加拉国律师协会考试的孟加拉语原版和机器翻译英语版,不进行检索、BM25或FAISS检索,通过三次固定种子运行的严格一致性评分。在0.8B规模下,微调将2022年英语FAISS分数从2分提高到34分(满分100)。0.8B和2B规模的收益通过了配对检验,但4B模型没有检测到净收益:孟加拉语有所改善,而多个英语条件出现退步。微调还使答案从孟加拉语偏离到大部分英语的比例从44.0–53.2%降低到0.2–0.7%,所有规模下调整后p<.001。因此,检索质量并非唯一的瓶颈。小型双语法律模型在使用提供的法律条文以及是否以所要求语言回答方面也存在差异。数据集公开于:https://huggingface.co/datasets/momahadi/bangladesh-legal-qa-dataset。

# 小模型会使用你提供的法律条文吗?孟加拉国法律问答中的上下文注入微调

Moniruzzaman Mahadi¹, Abrar Mohammed Tanzim Alam¹, Sayma Siddika Monalisa¹, Mir Mohammad Asif Abdullah¹, Swakkhar Shatabda², Md Adnan Arefeen¹

¹ 南北大学电气与计算机工程系,达卡,孟加拉国
² 布拉克大学计算机科学与工程系,达卡,孟加拉国
通讯邮箱:[email protected]

## 1 引言

参考图标题

图1:研究设计。上下文注入监督生成了三个规模的Qwen3.5微调变体。在无检索、BM25和FAISS条件下,比较基础模型和微调模型在四份孟加拉国律师协会考试文件上的表现。平均严格一致性差值在0.8B和2B规模上有利于微调,但在4B规模上反转。

孟加拉国宪法第27条保障法律面前人人平等[1]。然而,法律帮助对大部分人口来说仍然遥不可及。对孟加拉国司法系统的分析描述了几百万件待决案件由大约两千名法官处理,诉讼周期长,律师费不受监管,以及公共法律援助资格狭窄[2-7]。语言技术不会修复法院系统,但它可以降低获取准确法律信息的成本,前提是它的答案始终基于现行法规。

最近的许多法律自然语言处理(NLP)通过检索来实现这种基础性:更好的索引将正确的条文放入模型的上下文中。小模型对这一假设提出了挑战。在我们的实验中,当提示中已经包含了相关条文时,它们常常失败,而孟加拉语的情况更糟。孟加拉语在当前模型族中仍然属于低资源语言[10]。孟加拉国法律语言还融合了受波斯语影响的术语和殖民时代术语与标准孟加拉语[8]。即使是前沿模型也难以处理真实的孟加拉国法律查询[11]。

我们关注检索之后发生的事情。监督微调(SFT)——在提示中已经包含相关法律文本的法律问答对上进行——是否能改善小模型在推理时使用所提供的上下文的能力?我们将这种能力称为*上下文利用*,并通过在检索到的法定上下文存在和不存在的情况下,多选准确率的变化来测量它,前后比较微调前后的状态。图1总结了这项研究。

我们的基准是2022年和2023年孟加拉国律师协会多选(MCQ)考试,包括原始孟加拉语版本和机器翻译的英语版本。MINA在这些考试上报告的最佳单元格得分为75.6–77.0%,这是使用专有的Gemini-2.5-Flash后端在两步RAG或工具使用下获得的;其小型开源权重后端得分低得多[8]。这些五次运行的平均值不能直接与我们的严格一致性分数比较。

我们固定检索机制,变换模型:基础Qwen3.5和微调后的Qwen3.5,参数规模为0.8B、2B和4B,每种条件下分别采用无检索、BM25和FAISS密集检索,每个条件进行三次固定种子的运行。GPT OSS 120B的一次运行提供了一个非正式的上限;它不是一个可复现的基线。

我们的贡献是:
1. 1.一个结构化、保留层次结构的双语语料库,涵盖律师协会教学大纲中占主导地位的六部孟加拉国法案和三份附表(第3节);
2. 2.一个精心策划的双语法律问答数据集,包含2,165条记录,采用三种难度格式,并将与每个答案相关的法律上下文注入到训练提示中(第3节);
3. 3.对基础模型和上下文注入微调模型在不同规模、语言和检索条件下的配对比较,以严格一致性、多数投票和平均准确率评分报告结果,并明确说明退步情况(第5–6节)。

效果强烈依赖于模型规模。微调后的模型在0.8B和2B上取得了很大收益,并且检索对它们的帮助远大于对基础模型的帮助。在4B上,孟加拉语大多有所改善,而多个英语条件出现退步。微调还消除了一种严重的语言漂移故障:基础模型在0.8B、2B和4B的可见输出中,分别有53.2%、44.0%和44.7%的情况下用英语回答孟加拉语问题。微调将这些比率分别降低到0.7%、0.2%和0.7%,所有规模下调整后p<.001。这些实验表明,在不同模型规模下,上下文利用和答案语言控制都存在差距。

## 2 相关工作

#### 孟加拉国的低资源法律问答。
Wasi等人(2024)[9]探索了基于LLM的孟加拉国法律辅助,通过在孟加拉国法规的英语语料库上微调GPT-2变体。作者描述了一个概念验证,但在准确性和安全性方面存在重大差距。其仅英语的设置没有反映双语法律实践。同一团队的MINA(Wasi等人,2025)[8]是一个多语言法律辅助系统,使用多种模型后端和检索配置在2022年和2023年律师协会考试上进行评估,并由法学教授审查输出。其最高表格值(75.6–77.0%)是使用专有Gemini-2.5-Flash后端在两步RAG或工具使用下的五次运行平均值;它们不能直接与我们的严格一致性分数比较。同一评估中的小型开源权重模型得分低得多。MINA评估了跨后端的完整助手,并在整个孟加拉国法规体系中进行检索;我们则孤立地研究小规模Qwen3.5系统在受控检索下的行为,仅搜索律师协会教学大纲中的六部法案和三份附表。MINA还记录了幻觉条文、遗漏法定条件以及民事/刑事混淆,并留下一个问题:当相关文本被正确提供时,这些失败是否仍然存在;我们的实验正好测试了这种情况。

#### 检索增强的法律NLP。
RAG(Lewis等人,2020)[27]将生成建立在检索到的证据上。针对孟加拉国警方公报,Kabir等人(2025)[13]构建了一个双语RAG框架,在生成之前进行相关性检查和查询细化。Pipitone和Alami(2024)[14]引入了LegalBench-RAG来单独评估检索步骤。他们认为现有基准想当然地认为检索是可靠的,并且长或嘈杂的上下文可能会埋没主导条文。LegalBench-RAG评估进入提示的内容;我们的研究从该步骤之后开始,固定检索,并在相同的检索上下文上比较基础模型和微调模型。

#### 孟加拉语能力和法律数据集。
Bhowmik等人(2025)[10]评估了十个开源LLM在八个翻译后的孟加拉语数据集上的表现,记录了与英语相比的一致差距,特别是对于较小模型和分词器过度分割孟加拉语的模型族。Aftahee等人(2025)[11]使用LLM作为裁判评分以及持证律师,评估了四个前沿LLM在来自孟加拉国法律咨询社区的250个真实问题上的表现,发现了结构良好的回应以及危险的不实信息(如捏造引用);专家审查不断暴露出自动评分无法捕捉的失败,这也警告我们不要过度解读我们的自动MCQ分数。在数据集方面,IndicLegalQA(Veningston和Mishra,2025)[15]评估了参数高效微调在结构化印度法律问答上的效果,但没有测试使用提供的上下文进行训练是否能改善推理时上下文的*使用*,这是本文的核心区别。

#### 基准和评估有效性。
KoBLEX(Lee等人,2025)[12]将开放式法律问答建立在法定条文的基础上,并要求进行多步推理;IL-TUR(Joshi等人,2024)[16]涵盖更广泛的印度法律理解和推理任务。SaulLM-7B(Colombo等人,2024)[17]依赖于在大型英语法律语料库上的持续预训练,并不针对孟加拉语法定问答。

#### 差距。
现有工作分别改进了法律检索、记录了小模型在孟加拉语上的落后程度,并在法律问答上微调了模型。在我们审查的这组工作中,没有发现评估上下文注入监督是否有助于小型孟加拉语能力模型在推理时使用提供的法定文本。我们通过在小规模双语法律问答(其提示包含相关条文)上微调小模型,然后比较基础模型和微调模型在相同检索上下文上的表现来测试这一点。

## 3 语料库和问答数据

我们根据发布的数据集重新计算了本节中的每个计数。图2(附录A)追踪了详细的数据、训练和律师协会评估流程。

### 3.1 语料库范围、来源和结构

该语料库涵盖在孟加拉国律师协会考试教学大纲中权重最大的六部法案和三份附表:1860年刑法典、1898年刑事诉讼法典、1872年证据法、1908年民事诉讼法典、1877年特定救济法和1908年时效法,加上民事诉讼法典附表I(命令和规则)、刑事诉讼法典附表II和时效法附表I。我们选择这个范围是因为入学考试是我们的基准;该语料库并非孟加拉国法规的全部体系。附表标签遵循已发布的语料库。

每部法案都是双语的:英语文本来自孟加拉国法律官方门户(http://bdlaws.minlaw.gov.bd/),孟加拉语文本来自BGS Technologies发布的法案合集。法规文档结构不规则:有法案、部分、章、节、小节、条款、子条款,以及附带的说明和解释。我们使用Google的Gemini在Antigravity平台上将每部法案转换为JSON,每部法案使用一个自定义提示,在此之前使用正则表达式预处理将说明与标识相同的条款分开。我们迭代执行模式强制执行提示(附录F),直到文件符合要求,然后人工检查。对于每个节,语料库保留了其所属法案、章、编号、旁注、完整文本和嵌套结构。

### 3.2 问答生成

从语料库中,我们生成了三个难度递增类别的指令微调记录,每个类别每种语言都有一个专用提示(附录F):
- **单跳提取**(从一个提供的条文中得出答案),
- **高级选择**(五个候选节,四个语义相似的干扰项,主导条文位于随机位置),以及
- **律师考试风格**(从法定语料库生成的合成场景MCQ,仅使用早期的律师考试问题作为风格示例,每个项目都标注有主导条文、候选和正确选项)。

生成过程不断以熟悉的方式失败:复述法定文本、跳过条款、重复问题、跨法案污染、格式漂移。我们通过提示修订解决了这些问题,已发布的提示包含了这些对策。

### 3.3 质量控制与组成

我们自己审查了记录:对照原始法律核对答案事实、验证逐字引用、删除或重新生成有缺陷的条目。没有保留逐条记录的审查日志,因此我们将此作为我们的流程,而不是经过审计的详尽协议。每一条已发布的记录都带有一个逐条记录的quality_flag,2,165条记录中没有任何一条被标记。我们只报告已发布的计数,因为预过滤生成池没有被保留。

表1:按法案、类别(单跳、高级选择、律师考试)和语言(英语/孟加拉语)划分的最终数据集。根据已发布的2,165条记录数据集重新计算;附表行单独列出,而不是归入父法案。

表1给出了经过验证的组成:2,165条记录,其中1,211条孟加拉语和954条英语;795条单跳,712条高级选择,658条律师考试风格。只有律师考试类别使用了附表,这与入学考试大量测试命令、规则和时效期的情况相符。每条记录都包含问题、逐字条文文本(如适用,候选节)、答案、引用、类型、难度、语言和来源元数据。记录如何划分和训练在第4节中描述。

### 3.4 SFT封装:上下文注入

我们准备了2,165条记录的两种聊天格式JSONL变体:一种直接回答变体,以及一种IRAC变体,它在回答之前写出推理过程。本文中的所有微调和评估都使用直接回答变体。IRAC变体使每个训练示例长得多,并且在我们的Kaggle设置上,对这些较长输入进行微调未能完成,因此我们将其搁置。

上下文注入是承载选择的关键。每个训练示例看起来与推理时的检索增强推理完全相同。

相似文章

用于小型语言模型算术微调的结构化合成推理数据

arXiv cs.AI

本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。