OntoBook:基于本体的合成教科书用于医学编码器预训练

arXiv cs.AI 论文

摘要

OntoBook利用大型语言模型将医学本体图转换为合成教科书文本,然后使用生成的130万本法语教科书对ModernCamemBERT进行预训练,在医学编码基准测试上取得了显著提升。

arXiv:2607.18927v1 公告类型:新 摘要:我们提出OntoBook,一种将医学本体结构转化为编码器语言模型预训练信号的方法。我们的方法包含三个阶段:通过本体图的随机游走来捕获医学代码之间的层次和因果关系,大型语言模型将这些游走重写为流畅的教科书风格文本,然后使用生成的文本对149M参数的法国编码器ModernCamemBERT进行训练,采用同一数据上的两个目标:掩码语言建模和代码对之间的关系预测。在三个法国医学编码基准(FRACCO、Cantemist-FR、Distemist-FR)上,OntoBook相比仅MLM预训练取得了显著改进,FRACCO上+2.5 micro-F1,Distemist上+8.0 micro-F1。我们发现目标之间的对齐是必要的:不一致的训练(每个任务使用不同数据)会导致30个点的性能下降。我们发布了来自三个法国本体(CIM-10、CCAM、ATC)的130万个由LLM重写的医学教科书以及预训练模型检查点。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:23

# OntoBook:基于本体的合成教科书用于医学编码器预训练
来源:https://arxiv.org/abs/2607.18927
查看PDF(https://arxiv.org/pdf/2607.18927)

> **摘要:** 我们提出OntoBook,一种将医学本体结构转化为编码器语言模型预训练信号的方法。该方法包含三个阶段:首先通过本体图的随机游走来捕捉医学编码之间的层级与因果关系;然后利用大型语言模型将这些游走路径重写为流畅的教科书式文本;最后用这些文本训练ModernCamemBERT(一个1.49亿参数的法语编码器),在相同数据上设置两个训练目标:掩码语言建模和编码对之间的关系预测。在三个法语医学编码基准(FRACCO、Cantemist-FR、Distemist-FR)上,OntoBook相比仅使用MLM预训练取得了显著提升:FRACCO上micro-F1提升+2.5,Distemist上micro-F1提升+8.0。我们发现目标之间的一致性至关重要:若训练目标不对齐(即不同任务使用不同数据),性能会下降30个点。我们发布130万条由大语言模型重写的医学教科书文本,覆盖三个法语本体(CIM-10、CCAM、ATC),并公开预训练模型检查点。

## 提交历史

来自:Rian Touchent [查看邮件](https://arxiv.org/show-email/32325f56/2607.18927) [经由CCSD代理] **[v1]** 2026年7月21日星期二 10:11:10 UTC(35 KB)

相似文章

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG对比

arXiv cs.CL

# 将结构化生物医学知识注入语言模型:持续预训练与GraphRAG 来源:[https://arxiv.org/html/2604.16422](https://arxiv.org/html/2604.16422) ###### 摘要 将领域特定知识注入模型对于使语言模型(LMs)适应生物医学等专业领域至关重要。尽管目前大多数方法依赖于非结构化文本语料库,但本研究探讨了两种利用UMLS元术语表(Metathesaurus)中结构化知识的互补策略:

因果语言建模的短暂介入可提升编码器的继续预训练效果

Hugging Face Daily Papers

本文表明,在编码器适配过程中从掩码语言建模(MLM)切换至因果语言建模(CLM),能够提升在生物医学文本上的下游任务性能。作者发布了 ModernBERT-bio 和 ModernCamemBERT-bio,作为当前最先进的生物医学编码器。

MedicalBench:评估大型语言模型以改进医学概念提取

arXiv cs.CL

MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。