ModernBERT模型的法律领域适应

arXiv cs.CL 论文

摘要

本文探讨了ModernBERT模型在法律领域的领域适应,通过在美国法院意见上进行进一步预训练,取得了相对于基础模型的显著改进,并公开发布了检查点。

arXiv:2606.28538v1 公告类型:新 摘要:我们研究了现代BERT模型在法律领域的领域适应。我们使用掩码语言建模目标在所有美国法院意见上进一步预训练ModernBERT。尽管ModernBERT的训练数据量大约是原始BERT的500倍,我们仍然发现该模型受益于进一步预训练和法律领域的领域适应:我们报告了在所有与美国法院意见相关的数据集上,相比基础ModernBERT的显著改进。我们发现与早期BERT类模型领域适应工作相似的收益。然而,在我们的实验中,从头预训练并未达到在现有ModernBERT检查点上进一步预训练的性能。最终模型能够处理长达8,192个词元的序列,可用于计算有意义的法律段落嵌入,或针对给定搜索查询快速重排序数百个法律段落。我们公开发布所有模型检查点。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:27

# 现代BERT模型在法律领域的领域适应
来源:https://arxiv.org/abs/2606.28538
查看PDF (https://arxiv.org/pdf/2606.28538)

> 摘要:我们研究了现代BERT模型在法律领域的领域适应问题。我们使用掩码语言建模目标,在所有美国法院判例上进一步预训练ModernBERT。尽管ModernBERT的训练数据量约为原始BERT的500倍,但我们发现该模型仍能从进一步预训练和法律领域适应中获益:在所有与美国法院判例相关的数据集上,我们报告了相比原始ModernBERT的显著提升。我们观察到的增益与早期BERT类模型领域适应研究中的报告相似。然而,在我们的实验中,从零开始预训练的性能无法与基于现有ModernBERT检查点进行进一步预训练的结果相媲美。最终模型能够处理长达8,192个标记的序列,可用于计算法律段落的有效嵌入,或针对给定搜索查询快速重新排序数百个法律段落。我们公开发布了所有模型检查点。

## 提交历史

来自:Dominik Stammbach [查看邮件 (https://arxiv.org/show-email/6c06b8f6/2606.28538)] **\[v1\]** 2026年6月26日 星期五 18:44:11 UTC (186 KB)

相似文章

因果语言建模的短暂介入可提升编码器的继续预训练效果

Hugging Face Daily Papers

本文表明,在编码器适配过程中从掩码语言建模(MLM)切换至因果语言建模(CLM),能够提升在生物医学文本上的下游任务性能。作者发布了 ModernBERT-bio 和 ModernCamemBERT-bio,作为当前最先进的生物医学编码器。

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。