ModernBERT模型的法律领域适应
摘要
本文探讨了ModernBERT模型在法律领域的领域适应,通过在美国法院意见上进行进一步预训练,取得了相对于基础模型的显著改进,并公开发布了检查点。
arXiv:2606.28538v1 公告类型:新
摘要:我们研究了现代BERT模型在法律领域的领域适应。我们使用掩码语言建模目标在所有美国法院意见上进一步预训练ModernBERT。尽管ModernBERT的训练数据量大约是原始BERT的500倍,我们仍然发现该模型受益于进一步预训练和法律领域的领域适应:我们报告了在所有与美国法院意见相关的数据集上,相比基础ModernBERT的显著改进。我们发现与早期BERT类模型领域适应工作相似的收益。然而,在我们的实验中,从头预训练并未达到在现有ModernBERT检查点上进一步预训练的性能。最终模型能够处理长达8,192个词元的序列,可用于计算有意义的法律段落嵌入,或针对给定搜索查询快速重排序数百个法律段落。我们公开发布所有模型检查点。
查看缓存全文
缓存时间: 2026/06/30 05:27
# 现代BERT模型在法律领域的领域适应 来源:https://arxiv.org/abs/2606.28538 查看PDF (https://arxiv.org/pdf/2606.28538) > 摘要:我们研究了现代BERT模型在法律领域的领域适应问题。我们使用掩码语言建模目标,在所有美国法院判例上进一步预训练ModernBERT。尽管ModernBERT的训练数据量约为原始BERT的500倍,但我们发现该模型仍能从进一步预训练和法律领域适应中获益:在所有与美国法院判例相关的数据集上,我们报告了相比原始ModernBERT的显著提升。我们观察到的增益与早期BERT类模型领域适应研究中的报告相似。然而,在我们的实验中,从零开始预训练的性能无法与基于现有ModernBERT检查点进行进一步预训练的结果相媲美。最终模型能够处理长达8,192个标记的序列,可用于计算法律段落的有效嵌入,或针对给定搜索查询快速重新排序数百个法律段落。我们公开发布了所有模型检查点。 ## 提交历史 来自:Dominik Stammbach [查看邮件 (https://arxiv.org/show-email/6c06b8f6/2606.28538)] **\[v1\]** 2026年6月26日 星期五 18:44:11 UTC (186 KB)
相似文章
LegalBench-BR:评估大语言模型在巴西法律判决分类上的基准
研究者发布首个公开基准 LegalBench-BR,用于评估大模型在巴西法律文本分类任务上的表现。实验表明,LoRA 微调的 BERTimbau 大幅超越 GPT-4o mini 与 Claude 3.5 Haiku。
词与道:面向德国医学自然语言处理的领域特定BERT预训练策略
本文介绍了ChristBERT,一个基于RoBERTa的面向德国临床NLP的领域特定语言模型家族,并在医学命名实体识别和文本分类任务上评估了三种领域适应策略(继续预训练、从头预训练和词汇适应),取得了最先进的结果。
我在33,000份印度最高法院判决书(1950–2024)上训练了一个NER模型,CASE_CITATION的F1得分达到97.76%,比唯一的先前基线高出17个百分点 [P]
发布了 en_legal_ner_ind_trf v0.1,这是一个在33,000份印度最高法院判决书之上微调的InLegalBERT模型,在案例引用上取得了97.76%的F1得分,显著优于之前的基线。
因果语言建模的短暂介入可提升编码器的继续预训练效果
本文表明,在编码器适配过程中从掩码语言建模(MLM)切换至因果语言建模(CLM),能够提升在生物医学文本上的下游任务性能。作者发布了 ModernBERT-bio 和 ModernCamemBERT-bio,作为当前最先进的生物医学编码器。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。