OntoBook:基于本体的合成教科书用于医学编码器预训练
摘要
OntoBook利用大型语言模型将医学本体图转换为合成教科书文本,然后使用生成的130万本法语教科书对ModernCamemBERT进行预训练,在医学编码基准测试上取得了显著提升。
查看缓存全文
缓存时间: 2026/07/22 08:23
# OntoBook:基于本体的合成教科书用于医学编码器预训练 来源:https://arxiv.org/abs/2607.18927 查看PDF(https://arxiv.org/pdf/2607.18927) > **摘要:** 我们提出OntoBook,一种将医学本体结构转化为编码器语言模型预训练信号的方法。该方法包含三个阶段:首先通过本体图的随机游走来捕捉医学编码之间的层级与因果关系;然后利用大型语言模型将这些游走路径重写为流畅的教科书式文本;最后用这些文本训练ModernCamemBERT(一个1.49亿参数的法语编码器),在相同数据上设置两个训练目标:掩码语言建模和编码对之间的关系预测。在三个法语医学编码基准(FRACCO、Cantemist-FR、Distemist-FR)上,OntoBook相比仅使用MLM预训练取得了显著提升:FRACCO上micro-F1提升+2.5,Distemist上micro-F1提升+8.0。我们发现目标之间的一致性至关重要:若训练目标不对齐(即不同任务使用不同数据),性能会下降30个点。我们发布130万条由大语言模型重写的医学教科书文本,覆盖三个法语本体(CIM-10、CCAM、ATC),并公开预训练模型检查点。 ## 提交历史 来自:Rian Touchent [查看邮件](https://arxiv.org/show-email/32325f56/2607.18927) [经由CCSD代理] **[v1]** 2026年7月21日星期二 10:11:10 UTC(35 KB)
相似文章
将结构化生物医学知识注入语言模型:持续预训练与GraphRAG对比
# 将结构化生物医学知识注入语言模型:持续预训练与GraphRAG 来源:[https://arxiv.org/html/2604.16422](https://arxiv.org/html/2604.16422) ###### 摘要 将领域特定知识注入模型对于使语言模型(LMs)适应生物医学等专业领域至关重要。尽管目前大多数方法依赖于非结构化文本语料库,但本研究探讨了两种利用UMLS元术语表(Metathesaurus)中结构化知识的互补策略:
因果语言建模的短暂介入可提升编码器的继续预训练效果
本文表明,在编码器适配过程中从掩码语言建模(MLM)切换至因果语言建模(CLM),能够提升在生物医学文本上的下游任务性能。作者发布了 ModernBERT-bio 和 ModernCamemBERT-bio,作为当前最先进的生物医学编码器。
MedicalBench:评估大型语言模型以改进医学概念提取
MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。
词与道:面向德国医学自然语言处理的领域特定BERT预训练策略
本文介绍了ChristBERT,一个基于RoBERTa的面向德国临床NLP的领域特定语言模型家族,并在医学命名实体识别和文本分类任务上评估了三种领域适应策略(继续预训练、从头预训练和词汇适应),取得了最先进的结果。
OpenMedQ:面向医学视觉语言模型的广泛开放预训练
OpenMedQ 是一个完全开放的医学视觉语言模型,在 14 个数据集(约 335 万样本)上进行预训练,在医学 VQA 和分类基准上取得了最先进的结果。