RASC+: 面向临床值集编制的检索约束型大语言模型裁决方法
摘要
本文介绍了RASC+,一种用于临床值集编制的检索约束型大语言模型裁决方法,其通过基于Qwen3的检索和盲目裁决,提升了候选集召回率和选择精度,显著优于RASC基线中的直接生成方法。
arXiv:2606.23992v1 公告类型:新
摘要:临床值集定义了用于质量评估、表型分析、队列构建和临床决策支持的标准化术语代码。近期引入的检索增强集完成(RASC)基准表明,直接使用零样本大语言模型(LLM)生成并不适合此任务:临床代码系统规模庞大、具有版本控制,且语言模型无法可靠记忆。我们研究了一种分阶段替代方案,其中候选池构建针对召回率优化,而受约束的LLM裁决器则针对候选选择优化。在完整的3,744值集RASC测试集上,基于Qwen3的检索结合词汇感知扩展和代码显示救援检索,将候选池召回率从原始RASC检索基线的0.553提升至0.730;在保留出版商层上,池召回率为0.655。仅靠高召回率池并不足够:将原始SAPBert交叉编码器应用于此扩展池,全测试宏F1为0.287,保留出版商宏F1为0.233。将第二阶段选择器替换为对同一池进行盲目GPT-5裁决,全测试宏F1提升至0.549,保留出版商宏F1提升至0.533。这些结果表明,检索约束型LLM裁决可以显著改善值集完成,同时保持所有返回代码必须来自可审计候选池的安全约束。
查看缓存全文
缓存时间: 2026/06/24 07:44
# RASC+:用于临床值集创作的检索约束大语言模型裁决
来源:https://arxiv.org/html/2606.23992
###### 摘要
临床值集定义了质量测量、表型分析、队列构建和临床决策支持中使用的标准化术语代码。最近引入的检索增强集补全(RASC)基准表明,直接使用零样本大语言模型(LLM)生成不适合此任务:临床编码系统庞大、具有版本控制,且不能被语言模型可靠记忆。我们研究了一种分阶段替代方案,其中候选池构建针对召回率进行优化,而受约束的LLM裁决器则针对候选选择进行优化。在包含3,744个值集的完整RASC测试分片上,基于Qwen3的检索、词汇感知扩展和代码显示救援检索相结合,将候选池召回率从原始RASC检索基线0.553提升至0.730;在留出发布者层上,池召回率为0.655。仅靠更高召回率的池是不够的:将原始SAPBert交叉编码器应用于此扩展池,完整测试宏平均F1为0.287,留出发布者宏平均F1为0.233。用盲化GPT-5裁决替换阶段2选择器,在相同池上,完整测试宏平均F1提升至0.549,留出发布者宏平均F1提升至0.533。这些结果表明,检索约束的LLM裁决可以在保留所有返回代码必须来自可审计候选池这一安全约束的同时,显著改进值集补全。
## 1. 引言
临床值集指定哪些术语代码将临床概念可操作化。它们广泛应用于电子质量测量、表型分析、队列定义和决策支持。创作值集并非普通的文本生成:输出是庞大、有版本管理的术语宇宙(涵盖SNOMED-CT、ICD-10-CM、RxNorm、LOINC、CPT等系统)的子集。一个有用的系统必须足够完整以恢复相关代码,同时足够精确以避免用合理但错误的候选代码淹没人类审核者。
Mukherjee等人[5 (https://arxiv.org/html/2606.23992#bib.bib1)]引入了检索增强集补全(RASC),这是一种基于公开可用的值集权威中心(VSAC)值集[6 (https://arxiv.org/html/2606.23992#bib.bib11)]构建的临床值集创作方法。RASC的核心设计是检索相似的先前值集,将其代码合并成候选池,然后对每个候选进行分类。这种框架避免了无约束的代码生成,并使检索阶段成为下游召回率的上限。原始RASC论文报告称,SAPBert交叉编码器实现了值集级别宏平均F1 0.298,优于零样本GPT-4o生成器(宏平均F1 0.105,且经常返回VSAC中不存在的代码)。
本工作研究是否可以通过针对各自目标优化每个阶段来强化相同的“检索-选择”范式。我们将候选池构建和候选裁决视为独立问题。检索阶段应在可审查的池大小下最大化召回率,即使这会降低池精确率。裁决阶段则应恢复精确率,同时尽可能保留池的召回率。这种分解不同于直接LLM生成,后者要求模型从庞大的宇宙中回忆确切的临床代码。检索约束的裁决则询问每个提供的代码是否属于目标值集,保留可审计性和语料基础,同时仅将LLM用作有界选择器。
我们做出两项实证贡献。首先,我们展示了基于Qwen3的语义检索、词汇感知图扩展和代码显示救援检索的组合,将完整测试候选池召回率从RASC基线0.553提升至0.730,包括留出发布者上的0.655——为任何下游选择器建立了显著更高的召回率上限。其次,我们展示了在泄漏控制协议下的GPT-5裁决能够将这个更大、更嘈杂的池转化为端到端的改进,而原始SAPBert交叉编码器无法做到:完整测试宏平均F1从0.287升至0.549,在相同池上,分布外(训练中未见的值集发布者)宏平均F1从0.233升至0.533。
## 2. 相关工作
### 2.1. 检索增强集补全
RASC将值集创作形式化为在大型离散术语宇宙上的集补全[5 (https://arxiv.org/html/2606.23992#bib.bib1)]。该基准在过滤后包含11,803个VSAC值集,并采用留出发布者划分:Clinical Architecture和CSTE Steward完全保留用于测试。这种划分很重要,因为它衡量了对训练中未见过的创作风格和概念分布的泛化能力。RASC还同时报告检索召回率和下游分类器指标,允许将失败归因于候选缺失或候选选择错误。我们直接使用这种分解,同时研究不同的管线设计:更高召回率的池构建器,后接受约束的LLM裁决。原始RASC手稿报告了此处使用的主要完整测试基线;它没有为原始SAPBert交叉编码器提供相同的分布内/分布外细分,因此本文中的分布外阶段2比较是针对应用于扩展池的SAPBert进行的。
### 2.2. 检索约束生成与裁决
检索增强生成通常提供文档作为无约束生成器的上下文[3 (https://arxiv.org/html/2606.23992#bib.bib9)]。RASC不同之处在于检索提供了可行的输出集本身。下游模型不仅受检索证据的引导,而且被约束为返回检索项的子集。这一区别对于临床值集创作至关重要,因为无效代码不是无害的释义,而是无用的产物。我们的GPT-5实验遵循相同的约束:LLM从提供的池中选择候选标识符,且从不被要求从头生成代码。
### 2.3. 生物医学检索模型
原始RASC检索阶段使用了SAPBert标题嵌入。SAPBert是一种生物医学实体表示模型,使用UMLS同义词监督进行训练[4 (https://arxiv.org/html/2606.23992#bib.bib4)];相关的生物医学检索系统如MedCPT展示了针对特定领域的对比预训练对于生物医学搜索的价值[2 (https://arxiv.org/html/2606.23992#bib.bib5)]。我们的池构建实验使用Qwen3-Embedding-0.6B检查点,这是Qwen3嵌入家族的一员,专为文本嵌入和重排序设计[9 (https://arxiv.org/html/2606.23992#bib.bib2)]。稠密检索使用通过FAISS[1 (https://arxiv.org/html/2606.23992#bib.bib6)]索引的归一化嵌入。最终的LLM评估使用这些实验中可用的最高召回率池配置:Qwen3检索、词汇感知扩展和代码显示救援检索。
## 3. 方法
### 3.1. VSAC语料库与测试划分
我们使用RASC[5 (https://arxiv.org/html/2606.23992#bib.bib1)]引入的VSAC衍生基准和划分设计。每个示例是一个值集展开,包含标题、元数据、术语系统和一组\((code,system)\)黄金对。我们未重新创建语料库或更改划分。完整测试划分包含3,744个值集:1,423个来自非留出发布者,2,321个来自留出发布者。留出发布者为Clinical Architecture和CSTE Steward,与原始RASC划分一致。所有候选池和裁决结果均在此完整测试划分上报告,除非另有明确说明。
### 3.2. 语义检索
令\(\mathcal{V}_{\mathrm{train}}\)表示可用于检索的源值集语料库,令\(U\)表示观测到的\((code,system)\)对的全集。对于标题为\(t_v\)的目标值集\(v\),阶段1的目标是构建一个候选池\(C_v \subset U\),使得对未知目标集\(Y_v\)的覆盖率尽可能高。此目标不同于最终预测:候选池构建主要通过召回率评估,因为任何不在\(C_v\)中的代码都无法通过下游裁决恢复。
原始RASC系统使用SAPBert标题嵌入检索\(K=10\)个最近的先前值集。我们用量子位3嵌入0.6B替换此标题检索器。令\(f(t) \in \mathbb{R}^d\)为值集标题\(t\)的Qwen3嵌入,经过单位归一化后满足\(\|f(t)\|_2=1\)。对于标题为\(t_u\)的源值集\(u\),源集按以下方式排序:
\[ s(v,u)=f(t_v)^\top f(t_u) \]
由于嵌入已归一化,此为余弦相似度。我们检索\(K=15\)个得分最高的源集:
\[ R_K(v)=\operatorname{TopK}_{u\in \mathcal{V}_{\mathrm{train}}} s(v,u) \]
并形成初始源派生池:
\[ C_v^{\mathrm{src}}=\bigcup_{u\in R_K(v)} Y_u \]
重复的\((code,system)\)对被合并。我们使用\(K=15\)而非原始的\(K=10\),因为下游目标是高候选召回率,且阶段2选择器负责拒绝因更宽泛池而引入的假阳性。
### 3.3. 词汇感知扩展
对先前值集的语义检索可能遗漏那些结构上接近检索到的代码但本身不在检索到的源集中的目标代码。为解决此问题,我们定义了一个词汇特定的扩展算子。对于每个支持扩展的词汇\(m\),令\(G_m=(U_m, E_m)\)为该词汇内代码上的图。边关系编码了临床上有意义的局部结构:ICD-10-CM的子项和兄弟链接、RxNorm的关系邻居链接、SNOMED-CT的关系邻居链接。对于种子代码\(c \in U_m\),令\(N_m(c)\)表示此图下允许的邻域。
对于目标值集\(v\),对源派生池应用扩展如下:
\[ C_v^{\exp}=C_v^{\mathrm{src}} \cup \bigcup_{m\in \mathcal{M}_{\exp}} \bigcup_{c\in C_v^{\mathrm{src}} \cap U_m} \operatorname{Limit}_m\!\left(N_m(c)\right) \]
其中\(\mathcal{M}_{\exp}=\{\mathrm{ICD-10-CM}, \mathrm{RxNorm}, \mathrm{SNOMED-CT}\}\)。ICD-10-CM扩展使用官方ICD-10-CM层次结构工件中的子项和兄弟链接。RxNorm扩展使用官方RxNorm文件中的无向关系邻居边,保留活跃的英文RxNorm原子及其关系属性,如ingredient、precise ingredient、part-of、tradename、reformulation和dose-form-group链接。SNOMED-CT扩展使用基于本地VSAC语料库中观测到的代码的预计算同词汇词典邻域图,而非声明的完整SNOMED-CT层次结构。
算子\(\operatorname{Limit}_m\)表示用于保持池可审查的确定性截断。对于每个词汇,种子代码按候选池顺序处理。对于每个种子,模式按配置顺序处理:ICD-10-CM先子项后兄弟,RxNorm和SNOMED-CT使用邻居。对于任何单个种子,最多添加三个新代码;一旦为某个目标值集的词汇添加了60个新代码,该词汇的扩展停止。因此,每种子上限局部应用,每词汇上限是全局停止规则。扩展有意限制为常见词汇,因为这些词汇的局部结构扩展在临床上合理且简单。
候选行保留出处特征,指示代码来自源集检索、词汇扩展、直接代码显示检索还是多条路径。这些特征不用于评分池召回率,但会暴露给阶段2选择器并保留以供审计。
### 3.4. 代码显示救援检索
当目标标题的措辞与训练语料库中的标题不同时,源集检索步骤可能失败。此失败模式在发布者转移时尤其相关。为了引入不依赖于检索相似源值集的证据,我们在相同的可扩展词汇上添加了代码显示检索分支。对于每个词汇\(m \in \mathcal{M}_{\exp}\),代码显示字符串使用BM25[8 (https://arxiv.org/html/2606.23992#bib.bib8)]索引。给定目标标题\(t_v\),每个词汇的前10个显示匹配定义了一个种子集\(D_v\)。最终候选池为:
\[ C_v = C_v^{\exp} \cup D_v \cup \bigcup_{m\in \mathcal{M}_{\exp}} \bigcup_{c\in D_v \cap U_m} \operatorname{Limit}_m\!\left(N_m(c)\right) \]
对于所有阶段2裁决实验使用的最终池,代码显示种子为每个目标值集添加,而不仅仅是当源集检索显得薄弱时。由此产生的池\(C_v\)是SAPBert和GPT-5裁决的可行输出集。
### 3.5. 候选裁决模型
我们在相同的扩展候选池上评估两个阶段2选择器。选择器为每个候选\(c \in C_v\)分配包含分数\(g(v,c) \in [0,1]\)或直接包含决策。对于基于分数的模型,阈值\(\tau\)引出预测值集:
\[ \hat{Y}_v(\tau) = \{ c \in C_v : g(v,c) \geq \tau \} \]
第一个选择器是来自原始RASC工作流的导出SAPBert交叉编码器。我们没有在扩展池分布上重新训练此模型,也没有在扩展池上重新调整其阈值。这是一个故意保守的对照:它测试仅将原始分类器暴露给更大的候选集是否足以改进工作流。不应将其解读为扩充分布上最佳的SAPBert结果,因为更大的池改变了正负比,并且可能需要阈值重新调整或重新训练才能进行公平的模型开发比较。
第二个选择器是GPT-5[7 (https://arxiv.org/html/2606.23992#bib.bib13)],用作受约束的裁决器,通过兼容OpenAI的Oracle云基础设施生成式AI端点。我们将此端点视为对命名GPT-5 API模型的访问,但端点路由、内容过滤器和模型版本变化是外部服务属性而非受控实验变量。模型被呈现一个目标值集及其候选池,并必须返回一个JSON列表,其中包含被认为属于该值集的候选ID。它不被要求生成临床代码。每个返回项必须对应检索系统提供的候选ID。每个值集在单独的无状态调用中进行裁决,不提供示例或对话历史。
我们将此协议称为盲化,因为我们移除了可能允许记忆或近似重复查找的字段:目标OID、发布者或管理者、源值集OID、源值集标题、真实代码计数。相似文章
TriageRA-CCF:面向自适应秩预算的源端临床置信度与覆盖信号(用于医学大语言模型)
本文提出TriageRA-CCF,一种用于医学问答中LoRA自适应秩预算的方法。它利用源端信号(基座模型置信度、临床覆盖、反事实代理)动态选择秩预算,在Qwen3-8B和Llama3.1-8B上取得了适度的准确率提升。
基于检索增强搜索的LLM程序优化
本文提出了检索增强搜索(RAS),一种黑盒自适应方法,利用检索增强搜索和原子编辑分解(AEGIS)来改进基于LLM的C++和Python程序优化,相较于先前方法实现了高达2.06倍的提升。
高風險醫療檢索增強生成的聲明選擇性認證
本文針對高風險醫療檢索增強生成(RAG)提出聲明選擇性認證,將響應分解為可驗證的聲明,並根據證據進行評分,通過意圖感知選擇器產生操作(完整、部分、衝突、棄權),實現了低無支持聲明風險和高操作準確性。
ARES:可扩展LLM强化学习的自动评估标准合成
ARES提出了一种框架,能够从预训练文档中自动构建基于评估标准的强化学习数据,生成问答对和加权评估标准,从而为开放式的LLM回答提供实例级别的奖励监督,在多维开放式任务上优于现有方法。
判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。