通用嵌入与特定嵌入,哪种更好?非英语语言临床编码搜索的实证研究
摘要
本文研究了基于大型语言模型合成数据微调的紧凑型任务特定双编码器是否能在非英语语言的临床编码检索中超越通用嵌入,并在西班牙语基准测试CodiESP和DISTEMIST上取得了最先进的结果。
arXiv:2605.30529v1 Announce Type: new
摘要:用于语义搜索的句子嵌入模型绝大多数是在英语语料库上开发和评估的。当应用于其他语言的临床检索——特别是ICD-10-CM/CIE-10代码检索时,召回率的下降往往被整体基准测试所掩盖。我们研究大型生成语言模型是否可以作为数据工厂来弥合这一差距。我们构建了一个两阶段检索器(双编码器后接交叉编码器重排序器),基于Gemini生成的合成数据(涵盖英语、西班牙语、加泰罗尼亚语、意大利语、葡萄牙语和法语)对西班牙语生物医学编码器(PlanTL-GOB-ES/bsc-bio-ehr-es)进行微调,并与BioBERT-ST和未调整的西班牙语编码器进行评估。仅双编码器在MRR上匹配BioBERT-ST(0.876 vs. 0.866),并在R@3(0.650 vs. 0.626)和R@5(0.804 vs. 0.790)上超越它,无需英语生物医学预训练。添加交叉编码器重排序器将整体R@5提升至0.822,并在五种语言中的四种占主导地位(西班牙语+0.017,加泰罗尼亚语+0.033,法语+0.018,葡萄牙语+0.037),代价是英语略有下降。这种权衡在临床上是可接受的:葡萄牙语达到R@5=0.829,而BioBERT-ST为0.714。贡献:一个基于LLM生成数据构建领域特定医学检索器的开放配方;学习增益的量化(MRR从0.755提升至0.876,增幅15.9%,使用约19,500个合成对);以及按语言和排名对增益集中位置的描述。
查看缓存全文
缓存时间: 2026/06/01 09:25
# 任务对齐的嵌入用于临床代码检索 来源: https://arxiv.org/html/2605.30529 ## 小数据但特定:用于临床代码检索的任务对齐嵌入 (2026-04-10) ###### 摘要 临床编码可以视为一种细粒度语义检索任务,其中短小的临床提及必须匹配到正确的 ICD-10/CIE-10 代码,尽管在严重程度、解剖位置、时间性或病因学方面存在细微差别。现有的句子嵌入模型在此场景下适应性较差,尤其对于非英语临床文本,而手动标注的训练数据仍然稀缺且昂贵。本研究探讨了是否可以通过使用大型语言模型生成的高质量合成监督来改进紧凑型、任务特定的检索器。我们使用一个前沿大型语言模型来构建基于 ICD-10 层级的多语言训练语料库。一个西班牙语生物医学双编码器在涵盖六种语言的 19,502 个合成样本上进行微调,同时一个交叉编码器重排序器在 10,628 个列表组(包含临床合理的难负例)上进行训练。最终系统在 CodiESP v4 和 DISTEMIST 上评估,与 BM25 和几个广泛使用的句子转换器基线进行比较。提出的检索器在 CodiESP 上达到 F1=0.709 和 MAP@10=0.747,在 DISTEMIST 上达到 F1=0.776 和 MAP@10=0.812,大幅优于所有公开基线。结果表明,检索质量更多取决于任务对齐的监督和临床有意义的负例,而非仅模型规模。我们的研究发现表明,精心策划的合成数据集能够实现紧凑且有效的临床语义搜索系统,而无需网络规模的训练语料库。 关键词: 语义搜索, 医学AI, 嵌入, 临床编码, 大语言模型 ## 引言 临床编码是一个高风险的文本到代码检索问题。给定一个简短的临床提及、主诉或医疗记录片段,系统必须从受控术语表(如 ICD-10-CM 或其西班牙改编版 CIE-10)中检索出正确的条目。这比普通语义搜索更困难,因为相邻代码通常描述临床相似但由限定词(如病原体、左右侧、严重程度、发作类型或解剖位置)区分的状况。因此,有用的模型必须检索正确的临床变体,而不仅仅是正确的疾病家族。 现代密集检索通常通过两个阶段来解决此类问题。首先,双编码器将查询和候选描述投影到共享向量空间,并高效检索出候选短列表[39 (https://arxiv.org/html/2605.30529#bib.bib56),19 (https://arxiv.org/html/2605.30529#bib.bib58)]。然后,交叉编码器联合读取查询和短列表中的每个候选,以产生更精确的相关性分数[32 (https://arxiv.org/html/2605.30529#bib.bib61),13 (https://arxiv.org/html/2605.30529#bib.bib63)]。这种先召回再重排序的架构在检索增强生成[23 (https://arxiv.org/html/2605.30529#bib.bib51),47 (https://arxiv.org/html/2605.30529#bib.bib52),33 (https://arxiv.org/html/2605.30529#bib.bib15)]和自动ICD编码[30 (https://arxiv.org/html/2605.30529#bib.bib71),16 (https://arxiv.org/html/2605.30529#bib.bib72),49 (https://arxiv.org/html/2605.30529#bib.bib73)]中很常见。 难点在于大多数公开的嵌入模型和生物医学NLP资源仍以英语为中心。BioBERT[22 (https://arxiv.org/html/2605.30529#bib.bib67)]、ClinicalBERT[2 (https://arxiv.org/html/2605.30529#bib.bib68)]及相关模型在英语EHR和生物医学基准(如PubMedQA[17 (https://arxiv.org/html/2605.30529#bib.bib28)])上表现强劲,但西班牙语、加泰罗尼亚语、意大利语、葡萄牙语及其他临床语言的代表性不足[18 (https://arxiv.org/html/2605.30529#bib.bib75)]。多语言编码器有所帮助[6 (https://arxiv.org/html/2605.30529#bib.bib65),37 (https://arxiv.org/html/2605.30529#bib.bib86),40 (https://arxiv.org/html/2605.30529#bib.bib57)],但当缩写、形态、表面形式和编码惯例在不同语言间变化时,临床检索仍然脆弱[31 (https://arxiv.org/html/2605.30529#bib.bib74)]。 ### 临床编码模型的局限性 核心问题不仅仅是模型容量的不足。通用编码器通常被训练用来捕捉广泛的语义相关性,而临床编码需要细粒度的等价性。例如,“*Brucelosis debida a Brucella suis*”和“*Brucelosis debida a Brucella melitensis*”在语义上接近,但作为代码不可互换。同样的紧张关系出现在数千个CIE-10描述中:最近的临床邻居通常是错误的答案。 由此产生四个实际限制。首先,分词和预训练语料库对非英语临床形态的覆盖不足,这可能会抹平重要的词汇区别。其次,生物医学预训练如果是在另一种语言或不同的临床分布上学习的,则不一定能迁移[22 (https://arxiv.org/html/2605.30529#bib.bib67),2 (https://arxiv.org/html/2605.30529#bib.bib68),5 (https://arxiv.org/html/2605.30529#bib.bib69)]。第三,跨语言迁移在密集检索中会退化,因为小的表示变化可能改变top-1结果[21 (https://arxiv.org/html/2605.30529#bib.bib87),46 (https://arxiv.org/html/2605.30529#bib.bib85)]。第四,两阶段系统可能不一致:如果双编码器从未检索到正确代码,重排序器无法恢复;如果双编码器无法对临床相邻的候选进行排序,那么高召回率的双编码器也是不够的。 数据问题同样重要。标注的临床数据昂贵,因为标注需要医学和语言学的双重专业知识。在多语言编码中,数据还必须匹配当地编码词汇和预期的粒度级别。仅在章节级别标注的语料库不能教授完整代码的区别,而英语ICD语料库不一定包含本地编码系统必须处理的西班牙语、加泰罗尼亚语或葡萄牙语表达。 ### 提议、结果和贡献 我们研究在此类数据约束下,LLM生成的合成监督是否能使特定领域和语言的临床检索器变得实用。我们不将合成数据仅用作通用增强,而是将LLM用作受控标签空间的导师:给定一个代码、定义、相邻代码和目标语言,生成器创建临床提及、释义和难负例,迫使模型学习决策边界。这遵循了近期关于LLM生成指令和检索数据的工作[45 (https://arxiv.org/html/2605.30529#bib.bib76),3 (https://arxiv.org/html/2605.30529#bib.bib78),7 (https://arxiv.org/html/2605.30529#bib.bib77)]以及从领域知识或标签生成的临床合成文本[35 (https://arxiv.org/html/2605.30529#bib.bib81),48 (https://arxiv.org/html/2605.30529#bib.bib83),24 (https://arxiv.org/html/2605.30529#bib.bib82),20 (https://arxiv.org/html/2605.30529#bib.bib84)]。 具体来说,我们训练一个针对西班牙语CIE-10/ICD-10搜索的两阶段检索器。双编码器从*PlanTL-GOB-ES/bsc-bio-ehr-es*[5 (https://arxiv.org/html/2605.30529#bib.bib69)]在约19,500个多语言合成对(涵盖英语、西班牙语、加泰罗尼亚语、意大利语、葡萄牙语和法语)上进行微调。交叉编码器重排序器在约10,600个列表组(包含临床合理的难负例)上进行训练。我们在两个留出的西班牙语临床编码数据集CodiESP v4和DISTEMIST上以完整代码、类别和章节粒度评估最终系统。 主要结果是,有针对性的合成监督和重排序产生了比公开基线大得多的改进。在CodiESP上,完整系统达到70.9%的top-1精确准确率,比测试的最佳公开编码器MiniLM-L6-v2提高48.4个百分点,比领域内英语S-BioBERT基线提高51.6个百分点。在DISTEMIST上,达到77.6%的top-1精确准确率。结果还表明,更大的嵌入和生物医学预训练本身不够:MPNet-v2性能不如MiniLM-L6-v2,而S-BioBERT尽管有领域特定预训练,性能仍低于两者。 本文做出三点贡献: 1. 1.它记录了一个可复现的配方,用于从多语言LLM生成的监督中训练两阶段ICD检索器。 2. 2.它表明对于西班牙语临床代码检索,语言覆盖范围和任务对齐的合成策划可能比通用的生物医学预训练更重要。 3. 3.它量化了交叉编码器重排序在解决ICD-10-CM和CIE-10-ES中常见的限定词级别区分中的作用。 此处不将合成数据视为真实临床评估的替代品,因为生成的示例可能过于规整、偏向于生成器偏好的措辞,或脱离真实笔记的噪音[25 (https://arxiv.org/html/2605.30529#bib.bib79),42 (https://arxiv.org/html/2605.30529#bib.bib80)]。因此,我们仅将合成数据用于监督,并仅在留出的人类临床编码数据集上评估(仅为此任务使用人工标注集)。 本文结构如下。方法部分描述合成数据生成过程、双编码器和交叉编码器。实验设计部分定义CIE-10层次结构、搜索后端、基线模型、评估数据集和指标。结果部分报告在CodiESP和DISTEMIST上的性能。讨论部分将发现与公共基准和相关的ICD编码文献进行比较,最后章节总结局限性和未来工作。 ## 方法 ### 系统概述 我们按照密集信息检索系统中常用的检索-重排序范式,训练一个用于ICD代码搜索的两阶段神经检索架构[39 (https://arxiv.org/html/2605.30529#bib.bib56),19 (https://arxiv.org/html/2605.30529#bib.bib58)]。在第一阶段,双编码器通过共享嵌入空间中的余弦相似度检索top-k候选ICD描述。在第二阶段,交叉编码器联合建模查询和每个检索到的候选,以根据语义相关性重排序结果[32 (https://arxiv.org/html/2605.30529#bib.bib61)]。 双编码器从*PlanTL-GOB-ES/bsc-bio-ehr-es*[5 (https://arxiv.org/html/2605.30529#bib.bib69)]初始化,并使用多语言合成正例对和批内负例通过*MultipleNegativesRankingLoss*[12 (https://arxiv.org/html/2605.30529#bib.bib59)]进行微调。重排序器通过列表式softmax交叉熵目标[4 (https://arxiv.org/html/2605.30529#bib.bib60)]进行优化,每个查询对应一个正例和最多九个难负例。流程图总结于图1 (https://arxiv.org/html/2605.30529#S2.F1)。两个阶段共享相同的骨干分词器和最大序列长度(256个子词单元),使得重排序器初始化简单。 图注: 图1:两阶段检索器:多语言双编码器为西班牙语调优的交叉编码器重排序器提供输入。两个阶段之间的不对称性是本研究的核心。 来源: 内部 ### 用于训练的合成数据生成 我们使用 Google DeepMind Gemini 2.5 Flash Pro[11 (https://arxiv.org/html/2605.30529#bib.bib17)] 作为数据工厂,生成两个基于 ICD-10 章节层次结构的数据集族: 1. 1.数据集 A(双编码器训练)。该集合旨在训练密集检索模型用于多语言临床语义搜索。每个示例包含一个自由文本临床查询、两个正例(释义或规范 ICD-10 描述)、两个从同一章节内语义相邻代码中采样的难负例,以及两个从无关章节中采样的软负例。数据生成由 ICD-10 章节和目标语言参数化(我们使用章节作为种子)。我们生成英语、西班牙语、加泰罗尼亚语、意大利语、葡萄牙语和法语的示例。经过去重和质量过滤后,最终语料库包含跨越 17 个 ICD-10 章节和 6 种语言的 19,502 个示例(见表 LABEL:tbl-bi-data-stats),以及一组无章节随机种子生成的示例(表中标记为 *Ungrouped*)。 2. 2.数据集 B(交叉编码器训练)。遵循 CLEF eHealth 的 CodiEsp 赛道[29 (https://arxiv.org/html/2605.30529#bib.bib70)],我们将交叉编码器训练锚定在真实的西班牙语临床案例提及上。对于每个标注的提及,我们收集一个正面 CIE-10 描述和最多九个通过词汇和嵌入邻近性采样的难负例。最终训练文件包含 10,628 个列表组,涵盖 4,706 个独特的西班牙语查询。 数据集 A 被有意设计为紧凑但高质量的合成语料库。我们不依赖网络规模的弱监督,而是专注于具有临床基础的示例,并带有困难的章内负例,迫使双编码器学习相关诊断之间的细粒度语义区分。此设计遵循以下假设:对于专门的医疗检索任务,精心策划的合成监督可以补偿有限的数据集大小。 数据集构建的一个核心方面是难负例和软负例之间的平衡。难负例使模型接触到临床相邻的概念,这些概念可能仅在严重程度、解剖位置、时间性或病因学上有所不同,从而鼓励编码器学习ICD层次结构中的细微决策边界。相反,从无关章节中采样的软负例防止表示坍缩,并保持跨嵌入空间的全局语义分离。这种平衡在临床编码中特别重要,因为代码分配通常具有模糊性和部分主观性,许多检索错误并非源于词汇不匹配,而是源于对语义相邻诊断的混淆。 为了提高一致性并减少噪音,所有生成的样本都经过多阶段策划流程,包括基于规则的验证、语义去重、语言一致性检查和人工定点抽查。最终的数据集比通用领域检索模型使用的大规模句子嵌入语料库(通常训练于数亿文本对[8 (https://arxiv.org/html/2605.30529#bib.bib25)])要小得多,但对于特定领域的语义搜索仍然足够表达。 数据集A是多语言的,而数据集B则锚定在西班牙语CodiEsp派生的监督上。这种设置反映了西班牙临床AI团队在实际标注可用性方面的约束。 表 1: 按ICD-10章节划分的双编码器合成语料库(显示17个章节中的前10个)。*Ungrouped*行对应CodiEsp派生的种子示例,用于反向翻译和预热。 | 章节 | N | | --- | --- | | 先天性畸形、变形和染色体异常 (Q) | 1,139 | | 内分泌、营养和代谢疾病 (E) | 1,123 | | 循环系统疾病 (I) | 1,119 | | 某些传染病和寄生虫病 (A-B) | 1,115 | | 精神、行为及神经发育障碍 (F) | 1,109 | | 肌肉骨骼系统和结缔组织疾病 (M) | 1,092 | | 呼吸系统疾病 (J) | 1,085 | | 肿瘤 (C-D) | 1,084 | | 皮肤及皮下组织疾病 (L) | 1,084 | | 神经系统疾病 (G) | 1,078 | | *Ungrouped / 随机种子* | 2,906 | | 总计 (所有17个章节) | 19,502 | 双编码器和交叉编码器语料库的代表性 JSON 行参见第\thechapter\.A节 (https://arxiv.org/html/2605.30529#X.A1)。 ### 双编码器训练 我们微调...
相似文章
MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试
MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。
对 Google Embeddings 2 与开源模型在多语言稠密检索和 RAG 系统中的基准测试
本文对 Google Embeddings 2 与五个开源模型在多语言稠密检索和 RAG 系统中进行了基准测试,发现 GE2 在准确性上表现最佳但速度较慢,而 mE5-L 作为低延迟的竞争性替代方案。
面向语言集成可靠性审计的多语言句子嵌入
本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。
文本嵌入中情感线索的跨心理学情绪理论比较研究
本文评估了十二种最新文本编码器在三种心理学情绪理论中编码情感线索的能力,发现指令感知的开源权重编码器在单词级别上达到或超过专有编码器,而任务微调嵌入在句子级别上更优。
ClinLens:面向纵向多模态临床数据科学的长期编码智能体
ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。