标签
作者将LLM的决策蒸馏到冻结的ModernBERT编码器上的小型头部中,通过修复选项预算,将banking77任务的准确率从67.5%提升至76.0%,并提供了关于令牌读取和教师一致性的见解。
本文指出词汇差距是导致ModernBERT等先进编码器在学习型稀疏检索中表现不佳的根本原因,并提出词汇迁移(VT)这一模型无关框架,将编码器迁移至稀疏友好的词汇表,在BEIR基准测试上取得最优结果。
本文介绍了BERTomelo,一种基于ModernBERT架构预训练的下一代单语编码器,专为葡萄牙语优化。在STS和NER等下游任务中,其性能优于以往的葡萄牙语模型和多语言模型。
本文探讨了ModernBERT模型在法律领域的领域适应,通过在美国法院意见上进行进一步预训练,取得了相对于基础模型的显著改进,并公开发布了检查点。
本文系统比较了微调的编码器分类器(ModernBERT系列)与基于解码器的安全评判器在LLM对抗评估中的表现,发现编码器可以在不显著损失性能的情况下,提供一种成本和延迟更低的替代方案。
介绍LOCUS,一个全面的美国地方法规代码语料库,旨在支持机器可读的法律AI研究,覆盖9,239个城市和县的代码,并使用基于ModernBERT的分类器进行分析。
EZFurigana 是一款免费且注重隐私的工具,利用 Sudachi 和 ModernBERT 为日语文本添加上下文感知的振假名,支持多种输入格式和自定义选项。
ACL-Verbatim 引入了一系列轻量级抽取模型,用于有来源的检索增强生成(RAG),能够从源文档中返回精确文本片段,性能优于基于大型语言模型的提取器。
介绍 Ettin 重排序器系列:六款基于 ModernBERT 编码器、采用开源数据和训练方案的全新先进 CrossEncoder 重排序器,提供多种尺寸选择。
HyDRA是一种面向异构LLM池的混合动态路由架构,能够预测每个查询的细粒度能力需求,并通过不足匹配选择最便宜且能力满足需求的模型,在保持质量的同时实现高达72.5%的成本节省。该架构已部署于GitHub Copilot的VS Code Chat自动模式,并将路由与模型目录解耦,模型变更时无需重新训练。
本文表明,在编码器适配过程中从掩码语言建模(MLM)切换至因果语言建模(CLM),能够提升在生物医学文本上的下游任务性能。作者发布了 ModernBERT-bio 和 ModernCamemBERT-bio,作为当前最先进的生物医学编码器。