GreenLeaf Law Embed Tiny:法律领域检索的紧凑嵌入模型
摘要
GreenLeaf Law Embed Tiny 是一个紧凑的0.6B参数嵌入模型,用于法律领域检索,在MLEB和MTEB(Law, v1)等基准测试中实现竞争性表现,并针对资源受限环境提供高效推理。
arXiv:2608.24936v1 公告类型:新
摘要:我们提出 GreenLeaf Law Embed Tiny,一个用于法律领域检索的0.6B参数嵌入模型。GreenLeaf-Tiny 在大型法律嵌入基准测试(MLEB)上达到75.11%,在MTEB(Law, v1)上达到64.38%,展示了在参数量低于10亿的模型中具有竞争力的表现。我们的方法结合了一个两阶段训练流程:首先将大型教师模型的知识蒸馏到紧凑的学生架构中,然后使用硬负样本挖掘进行领域特定的微调;一个精心策划的数据集,包含340万查询-段落对,包括15万来自不同法律管辖区的人工整理样本;以及一个高效的推理架构,支持多种量化级别(BF16、INT8、二进制),使其能够在资源受限环境中部署。我们提供了训练方法、架构选择以及跨法律检索任务综合评估的详细分析。结果表明,使用高质量数据的领域特定训练可以提升专业领域应用的性能。
查看缓存全文
缓存时间: 2026/08/27 09:27
# GreenLeaf Law Embed Tiny:用于法律领域检索的紧凑型嵌入模型 来源:https://arxiv.org/html/2608.24936 ###### 摘要 我们推出GreenLeaf Law Embed Tiny,一个拥有0.6B参数、专用于法律领域检索的嵌入模型。GreenLeaf-Tiny在大规模法律嵌入基准测试(MLEB)中达到75.11%,在MTEB(法律版,v1)中达到64.38%,展示了其在10亿参数以下模型中的竞争力。我们的方法结合了两阶段训练流程:首先从较大的教师模型向紧凑的学生架构蒸馏知识,然后应用带有困难负样本挖掘的领域特定微调;同时采用一个精心策划的包含340万查询-文档对的数据集,其中包括来自不同司法管辖区的15万个人工筛选样本;以及一个高效的推理架构,支持多种量化级别(BF16、INT8、二进制),使其能在资源受限的环境中部署。本文详细分析了我们的训练方法、架构选择,并对法律检索任务进行了全面评估。我们的结果表明,通过高质量数据进行领域特定训练可以提升特定领域应用的性能。 ###### 索引关键词: 嵌入模型,法律信息检索,知识蒸馏,困难负样本挖掘,模型压缩 ## I 引言 法律信息检索面临着独特的挑战,使其区别于通用领域的语义搜索。法律文档具有复杂的层次结构、专业术语以及错综复杂的交叉引用,通用的嵌入模型难以有效捕捉[1]。法律检索的重要性不言而喻:遗漏判例或误解法规可能对法律结果产生重大影响。尽管精准的法律检索至关重要,但该领域长期由缺乏法律专业知识的通用模型或透明度有限的专有商业系统所主导。 近期大语言模型的发展展示了跨领域的卓越能力,但其在专业领域嵌入任务中的应用仍待深入探索。虽然OpenAI的text-embedding-3-large和Voyage的voyage-law-2等模型表现出色,但它们如同黑盒,训练数据和方法论均不透明。这种缺乏透明度的情况阻碍了研究的可重复性,并引发了数据隐私方面的担忧,这在法律领域尤为重要,因为保密性至关重要[15]。法律领域既要求准确性,也要求可解释性,这两项要求与大型专有模型的不透明性存在冲突。 本文旨在研究如何训练专用于法律领域的紧凑、高性能嵌入模型。我们证明,精心的架构选择,结合高质量的领域特定数据和训练技术,能够产出在特定法律检索任务中性能可与更大模型相媲美的模型。我们的工作填补了适用于隐私敏感法律环境部署的高效法律嵌入模型的选择空白[12]。 法律技术领域发展迅猛,预计全球法律科技市场将在2027年达到350亿美元。然而,这一增长受到大型模型计算需求的制约。拥有70亿以上参数的大型嵌入模型需要大量的GPU资源,这使得它们在许多法律应用中不切实际,尤其是在资源受限的环境中,或处理无法离开本地基础设施的机密文档时[2]。 我们的关键发现表明,一个使用领域特定技术训练的0.6B参数模型,在MLEB上达到了75.11%,在特定法律检索任务上可与一些更大的模型相媲美。蒸馏后进行领域微调的组合比仅进行直接微调提升了9.24个百分点。与随机负样本采样相比,困难负样本挖掘在细粒度法律区分任务上带来了23%的改进。INT8量化仅导致-0.3%的性能下降,同时内存占用减少了4倍。仅占总训练数据4.4%的人工筛选数据,对最终性能贡献了8.2个百分点。 本文的主要贡献总结如下: - • 我们引入了一个结合知识蒸馏与困难负样本挖掘的两阶段训练流程,该流程针对法律领域特征(包括文档层次结构和引用网络)进行了适配。我们的消融研究证明,两个阶段都对最终性能有所贡献。 - • 我们提出了JudicialMind法律语料库,包含340万查询-文档对,其中15万为人工筛选样本,构成了一个大型法律检索训练语料库。我们提供了关于数据组成、质量过滤以及跨越35种语言和40多个司法管辖区的管辖权平衡的分析。 - • 我们提供了架构规格和推理优化技术,包括支持在不同硬件约束下部署的灵活量化方案。我们的架构支持BF16、INT8和二进制推理,并记录了精度-效率权衡。 - • 我们在法律检索任务上进行了评估,分析了我们方法的优势所在以及更大模型保持优势的领域。报告包含了按任务和按类别的细分分析。 ## II 相关工作 ### II-A 文本嵌入模型 文本嵌入领域已从早期的word2vec[10]和GloVe[11]方法发展到基于Transformer模型的上下文化表示。Sentence-BERT[4]确立了使用孪生架构微调Transformer编码器以进行语义相似性计算的范式。该工作证明,双编码器架构可以达到与交叉编码器相媲美的性能,同时通过预计算嵌入实现高效检索。 近期研究扩展了这些方法:E5[7]、BGE[8]和GTE[9]表明,在大规模文本对上进行对比预训练能产生稳健的通用嵌入。这些模型采用了多样的训练策略,包括多阶段对比学习、指令微调和合成数据生成。大规模文本嵌入基准测试(MTEB)[3]已成为评估嵌入模型在多种任务上表现的标准。然而,MTEB的通用领域重点揭示了其在专业领域的局限性。后续针对领域特定嵌入的研究证明了领域适应带来的持续效益,确立了专业领域需要专门训练的观点。 ### II-B 法律领域自然语言处理 法律文本呈现独特挑战:文档长度极长(通常超过10,000个标记),复杂的交叉引用结构,以及具有司法管辖区特定含义的高度专业术语。早期工作将TF-IDF和BM25应用于法律搜索[15],为精确匹配查询建立了至今仍具竞争力的基线。然而,这些词汇方法在语义匹配和释义检测方面表现不佳。 近期方法利用在法律语料库上微调的Transformer模型。著名的法律嵌入工作包括将word2vec适应于法律语料库的Law2Vec[12],以及更近期的专业模型,如Voyage的voyage-law-2。大规模法律嵌入基准测试(MLEB)[2]提供了一个专门针对法律检索的评估框架,涵盖多个司法管辖区的案例法、合同和法规。 现有的法律嵌入模型包括闭源商业产品和需要大量计算资源的大型模型。目前缺少适用于隐私敏感法律环境部署的紧凑、高效的法律嵌入模型。 ### II-C 知识蒸馏与模型压缩 知识蒸馏[5]通过匹配输出分布或中间表示,将知识从大型教师模型迁移到紧凑的学生模型。针对嵌入模型,[4]展示了从大型交叉编码器到双编码器的蒸馏,表明学生模型在参数减少5-10倍的情况下,可以保留教师模型95%以上的性能。 近期工作[19, 20]表明,精心的蒸馏可以在参数减少5-10倍的同时保留教师模型95%以上的性能。这些方法通常聚焦于通用领域任务。我们的工作将这些技术扩展应用于法律领域,在这个领域,教师模型的通用知识必须适应专业的法律语义,同时保持效率。 我们与先前的蒸馏工作的不同之处在于:我们将蒸馏与后续的领域微调相结合,而非单独使用蒸馏;我们在学生模型设计中引入了针对法律的特定架构调整;并且我们在领域适应阶段采用了困难负样本挖掘。 ### II-D 困难负样本挖掘 负样本的质量影响对比学习的效果[6]表明,困难负样本——与正样本相似但语义不同的样本——能提升表示质量。在信息检索中,ANCE[13]和RocketQA[14]证明,使用正在训练的模型挖掘困难负样本,可以形成课程学习,从而提升区分能力。 我们采用特定于法律的困难负样本挖掘策略,考虑管辖权混淆、时间混淆和法理混淆——从使用相似术语的不同司法管辖区、从法律演进的不同时间段、从相关但不同的法律学说中挖掘负样本。 ## III 数据 ### III-A JudicialMind法律语料库 我们的训练数据包含为法律领域检索精心整理的340万查询-文档对。主要来源是judicialmind/legal-training-dataset,我们的语料库包含跨越35种语言的369万标注对,涵盖案例法、法规、合同和监管文本。该数据集包含元数据:查询类型(基于事实、学理、程序性)、法律领域(民事、刑事、公司等)、难度级别和司法管辖区。 基准去污染协议:为防止训练/评估重叠,我们实施了以下去污染程序: 1. 精确匹配过滤:移除任何与MLEB或MTEB(法律)评估查询或文档完全匹配的训练对。 2. 近似重复检测:使用MinHash(128个排列,Jaccard阈值0.8)识别并移除与评估样本相似的训练对。 3. 数据源隔离:我们训练数据中的律师资格考试题目来自与MLEB bar-exam-qa评估集不相交的司法管辖区和时间段。我们通过交叉核对题目文本和来源司法管辖区验证无重叠。 4. 时间截止:训练数据仅包含2024年1月之前发布的文档,而评估基准包含截至2024年的文档。 从主要来源出发,我们应用了额外的过滤。质量过滤移除了相似度分数低于0.5的对,该分数使用预训练的通用嵌入模型计算,并在一个专家标注的验证集上调整了阈值。去重使用MinHash(128个排列,Jaccard阈值0.8)消除了重复对和近似重复对,移除了12%的初始对(369万 -> 325万)。长度平衡通过分层抽样确保了文档长度的代表性,维持了25%的短文档、35%的中等文档和40%的长文档。管辖权平衡根据法律市场规模和数据可用性,目标设定为40%美国、25%欧盟、20%英国和15%亚洲司法管辖区。这产生了325万用于训练的高质量对。 我们用15万个人工筛选对补充了主要数据集,这些对由法律专业人士创建。来源包括来自25个司法管辖区的律师资格考试题目(与MLEB bar-exam-qa评估集不相交)、法律研究指南以及执业律师的专家标注。所有对均由持牌律师通过两阶段验证进行了查询-文档相关性审核,达到了94%的标注者间一致性。收集覆盖了50多个法律实践领域和25个司法管辖区,包含需要深入法律理解才能区分的细微差别,并整合了3万对尽管表面相似但被明确标注为不相关的困难负样本对。 大规模数据与人工筛选的结合提供了广度和精度。我们的消融研究表明,尽管规模小,人工筛选子集仍提供了可衡量的价值。 ### III-B 数据特征 表I总结了语料库统计数据。 表I:按来源和类型划分的训练语料库统计。 来源 | 对数 | 语言 | 司法管辖区 | 平均长度 --- | --- | --- | --- | --- 主要数据集 | 3,250,000 | 35 | 40+ | 342个标记 人工筛选 | 150,000 | 8 | 25 | 428个标记 总计 | 3,400,000 | 35 | 40+ | 356个标记 文档长度分布对法律应用具有相关性。图1显示了文档长度的分布,其中明显的模式对应于短法规引用(~256个标记)、标准合同条款(~512个标记)和完整司法意见(>1024个标记)。 0-256 | 257-512 | 513-1024 | 1025-2048 | 2048+ --- | --- | --- | --- | --- 0% | 20% | 40% | 22% | 14% 2% | 31% | 28% | 14% | 5% 图1:训练语料库中文档长度分布。 ## IV 训练方法论 ### IV-A 两阶段架构 我们的训练采用两阶段流程设计,旨在最大化知识迁移的同时适应法律领域的具体特点(图2)。 图2:两阶段训练流程。第一阶段从大型教师模型蒸馏通用知识。第二阶段使用困难负样本挖掘适应法律领域。 ### IV-B 知识蒸馏 第一阶段将通用语义理解从一个大型教师模型迁移到我们紧凑的学生架构。我们采用嵌入匹配和相似性保持技术,确保学生模型捕捉教师模型的通用知识。蒸馏过程产生的学生模型在通用领域基准测试上保留了教师模型94.2%的性能。 ### IV-C 领域微调 第二阶段使用我们的340万对语料库将蒸馏后的模型适应法律特定场景。我们采用带有困难负样本挖掘的对比学习,以提高对相似法律文档的区分能力。挖掘策略选择来自同一司法管辖区、同一法律领域和相似时间段的负样本,以确保模型学习细粒度的法律区别。 ### IV-D 领域特定适应 法律文本需要超越标准自然语言处理技术的特殊处理。对于长文档处理,我们使用分层编码策略来处理超过……
相似文章
@liquidai: 介绍 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M:两款为超快且精准的多语言检索模型
Liquid AI 推出 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M,这两款多语言检索模型经过优化,可在11种语言中实现快速准确的搜索,延迟低至1.5毫秒。
基于检索的多标签法律标注:可扩展、数据高效且无幻觉
本文提出了一种基于检索的多标签法律标注方法,使用冻结的嵌入模型通过k近邻检索标签,实现了有竞争力的准确性、高数据效率,并从根本上消除了标签幻觉。
极简RAG模型:B1ade 335M嵌入模型与1B参数小型语言模型
介绍了B1ade,一种极简RAG架构,包含一个335M零训练嵌入模型和一个通过GRPO在723M tokens上训练的1B小型语言模型,展示了涌现归因行为,无需大规模预训练即可获得具有竞争力的问答性能。
探索用于法院观点生成的轻量级大语言模型
本文系统性地探索了轻量级(<2B)大语言模型在刑事法院观点生成中的能力,研究了模型架构、规模与对罪名预测影响之间的权衡。作者还介绍了CVGEvalKit,一个包含三个公开数据集的评估框架。
对 Google Embeddings 2 与开源模型在多语言稠密检索和 RAG 系统中的基准测试
本文对 Google Embeddings 2 与五个开源模型在多语言稠密检索和 RAG 系统中进行了基准测试,发现 GE2 在准确性上表现最佳但速度较慢,而 mE5-L 作为低延迟的竞争性替代方案。