面向跨基准医学问答的临床结构化秩门控LoRA

arXiv cs.CL 论文

摘要

本文提出BiRG-LoRA,一种用于医学问答的秩门控LoRA方法,利用临床结构化先验选择稀疏秩子集,在四个基准上达到69.31%的宏平均准确率,同时使用的参数少于混合专家方法。

arXiv:2606.31432v1 公告类型:新 摘要:医学多项选择题问答需要在异质知识领域和推理操作之间进行参数高效的适应。药物问题、诊断决策、公共卫生项目和护理操作项目可能需要不同的低秩更新,而某些记忆项目则应保留基础模型的表示,仅需轻度适配器干预。我们提出BiRG-LoRA,一种用于医学问答的单适配器秩门控LoRA方法。BiRG-LoRA在每个目标层保留一个LoRA模块,但使其秩维度输入条件化:对于每个问题,一个双轴门控结合隐藏语义证据与专业/职业先验、临床操作先验及其交互,以选择稀疏的top-k秩原子子集。一个标量注入系数进一步控制所选适配器更新的强度。在匹配的Qwen3-8B CMB源协议下,BiRG-LoRA在可训练的PEFT基线和匹配路由控制中取得了最高的四个基准宏平均准确率:在CMB、CMExam、MedQA和MedMCQA上平均为69.31%。它比MoELoRA提高了0.89个百分点,同时使用的可训练参数减少了28.1%;对最终预测进行配对、基准分层的bootstrap分析得出该宏平均增益的95%置信区间为[0.42, 1.37]。基本控制实验表明,BiRG-LoRA相比vanilla LoRA r16和主动秩匹配LoRA r4也分别提高了0.83个宏平均点,而评估时的弱轴扰动检查表明性能对中等程度的标签噪声并不脆弱。结果支持一个有界的主张:在匹配的单种子协议下,临床结构化的秩分配提高了跨基准医学问答的性能,而训练种子的方差仍是未来工作。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:33

# 临床结构化的秩门控LoRA在跨基准医学问答中的应用
来源:https://arxiv.org/html/2606.31432

###### 摘要

医学多项选择问答需要在异构知识领域与推理操作之间进行参数高效的适配。药物相关问题、诊断决策、公共卫生条目和护理操作条目可能需要不同的低秩更新,而某些回忆类条目应保留基础模型的表征,仅施加轻量适配器干预。我们提出BiRG-LoRA,一种用于医学问答的单适配器秩门控LoRA方法。BiRG-LoRA在每个目标层仅保留一个LoRA模块,但其秩维度是输入条件化的:对于每个问题,一个双轴门控(biaxial gate)将隐藏语义证据与专科/职业先验、临床操作先验及其交互相结合,以选择稀疏的top-κ秩原子子集。一个标量注入系数进一步控制所选适配器更新的强度。在匹配的Qwen3-8B CMB源协议下,BiRG-LoRA在可训练的PEFT基线和匹配路由控制中实现了四个基准的平均宏准确率最高:在CMB、CMExam、MedQA和MedMCQA上平均为69.31%。它比MoELoRA提高0.89个百分点,同时使用的可训练参数减少28.1%;对最终预测进行配对、基准分层的bootstrap检验,宏平均增益的95%置信区间为[0.42, 1.37]。基本对照实验显示,BiRG-LoRA相比vanilla LoRA r16和激活秩匹配的LoRA r4也提升了0.83个宏平均点,评估时的弱轴扰动检验表明性能对适度标签噪声不脆弱。这些结果支持一个有界主张:在匹配的单种子协议下,临床结构化的秩分配改善了跨基准医学问答,而训练种子方差仍有待未来研究。

## I 引言

医学大语言模型(LLMs)通常使用考试式多项选择基准进行评估,如CMB、CMExam、MedQA和MedMCQA[21, 11, 6, 15]。这些基准混合了不同的医学专科、专业角色和推理操作。一个关于药物机制的问题、一个治疗决策、一个公共卫生政策条目和一个护理操作条目可能共享相同的答案格式,但它们强调医学知识的不同领域。这使得医学问答成为普通参数高效微调的困难场景:单一固定的LoRA更新可以改进一个子集而削弱另一个子集,而多适配器混合增加了存储、路由和校准的复杂性。

最近的LoRA路由方法通过组合或选择适配器[14, 17, 23, 9]来解决这个问题,或者通过训练LoRA专家混合体[13, 8, 10, 22]。一个更细粒度的方向是秩级路由,其中单个LoRA的秩通道被视为小专家,而不是训练许多完整的适配器[27]。这对医学问答很有吸引力,因为它承诺稀疏激活和参数共享。然而,一个纯粹通用的秩级专家视角忽略了一个关键点:在医学中,路由信号不是任意的任务ID。它们具有有意义的结构。专科/职业先验、临床操作先验和隐藏语义线索各自描述了适配冲突的不同来源。

因此,我们问:*一个单一的LoRA适配器能否使用临床有意义的轴线来分配其内部的秩通道,同时与多适配器和LoRA-MoE基线保持竞争力?* 我们提出BiRG-LoRA,一种双轴秩门控LoRA方法。BiRG-LoRA在每个目标模块存储一个秩-R适配器,但每个问题只激活κ个秩原子。秩门控结合了四个信号:一个隐藏状态分支、一个专科/职业分支、一个临床操作分支和一个交互分支。一个标量注入系数控制所选低秩更新的强度。图1总结了设计。

这个公式使临床结构成为适配器本身的一部分。BiRG-LoRA不是将每个问题分配给相同的固定秩子空间,而是学习对于不同的内容领域、临床操作和问题语义组合,应该使用哪些秩原子。在匹配的Qwen3-8B协议下,使用4,200个CMB训练示例和400个更新步骤,BiRG-LoRA在CMB、CMExam、MedQA和MedMCQA上达到69.31%的平均准确率。它比可训练的MoELoRA高出0.89个百分点,同时使用66.59M而不是92.60M个可训练参数。它也比vanilla LoRA控制(包括秩-16 LoRA和激活秩匹配的秩-4 LoRA)有所改进。对最终预测的配对bootstrap检验支持主要的宏平均增益,评估时的轴扰动表明该方法对规则派生的临床标签中的适度噪声不脆弱。

我们的贡献是:

- • 我们为医学QA引入了一种双轴秩门控LoRA公式,其中专科/职业和临床操作先验共同指导单个适配器内的稀疏秩激活。
- • 我们添加了一个输入条件化的注入系数,用于决定所选适配器更新应以多大强度影响基础表征。
- • 我们提供了与基础Qwen3-8B、vanilla LoRA r16/r4/r24、MoELoRA、DoRA、受SMoRA启发的通用秩级LoRA控制,以及适配器库基线(包括MedAdapter、Arrow、MeteoRA和LoRA-Mixer风格路由)的匹配评估。
- • 我们报告了对最终预测的配对、基准分层bootstrap检验和符号检验,表明相对于MoELoRA、vanilla LoRA和通用秩级控制的主要宏平均增益不太可能由评估集采样噪声解释。
- • 我们报告了针对仅临床、仅隐藏、无注入、top-k、正交性、轴对比和弱轴噪声的消融与鲁棒性检验,表明完整的双轴设计不能简化为通用秩级激活或脆弱的元数据查找。

参考图例图 1:BiRG-LoRA使用一个共享的LoRA基,并动态选择秩原子。门控结合了隐藏语义、专科/职业轴、临床操作轴及其交互。所选的top-κ对角掩码和注入系数决定哪些秩原子是激活的,以及适配器以多强的程度修改冻结的主干网络。

## II 相关工作

**医学问答与医学LLM评估。** PubMedQA、MedQA、MedMCQA、CMB和CMExam提供了跨英语和中文的互补生物医学与考试式问答设置[7, 6, 15, 21, 11]。医学LLM研究如Med-PaLM和Med-PaLM 2显示出强劲进展,但也强调校准、不确定性与安全敏感验证[18, 19]。我们的工作不提出新的基准;它研究当源和目标基准在语言、专科混合和推理操作上不同时,医学适配器应如何分配低秩容量。

**参数高效适配。** LoRA冻结基础权重并学习低秩更新矩阵[5];QLoRA使其适用于量化LLMs[1];DoRA分离幅度和方向更新以实现更强的低秩适配[12]。自适应秩方法如AdaLoRA、DyLoRA和IncreLoRA跨模块或部署秩分配秩预算[26, 20, 25]。BiRG-LoRA不同之处在于,活跃秩子集是每个医学问题选择的,并且路由显式以临床轴为条件,而不仅仅基于权重重要性或全局部署预算。

**LoRA的混合体与路由器。** 稀疏MoE模型将令牌或示例路由到一小部分专家[16, 2]。基于LoRA的MoE系统,包括MoELoRA、MixLoRA、MING-MOE和MoLE,训练或组合多个LoRA专家[13, 8, 10, 22]。其他方法重用适配器库或对生成的候选进行路由,包括Arrow、MedAdapter、MeteoRA和LoRA-Mixer[14, 17, 23, 9]。这些系统激励了我们的基线。主要区别在于BiRG-LoRA在单个适配器内部执行结构化秩选择,而不是在多个完整适配器模块之间进行选择。

**秩级专家LoRA。** SMoRA提出每个LoRA秩可以视为独立专家,并使用动态秩级激活进行多任务学习[27]。我们建立在相同的广泛方向上,但针对不同的问题。表I总结了区别。SMoRA解决通用多任务LoRA冲突;BiRG-LoRA解决医学垂直适配冲突,其中路由信号应反映专科、临床操作和隐藏语义。我们还引入了注入系数,因为医学QA可能需要对某些条目保守地使用基础知识,而对其他条目需要更强的适配器干预。

表 I:与先前秩级LoRA的关系。

## III 方法论

### III-A 问题设定

令x为医学多项选择题,在源训练期间提供选项和正确答案y。冻结的LLM参数为Θ_0,通过在选定投影层中使用LoRA模块进行适配。我们在源集D_s上训练,在多个基准D_t上评估。目标基准标签仅用于最终报告,不用于训练、阈值选择或路由器校准。

对于目标线性层ℓ,标准LoRA计算

z_ℓ = W_ℓ^0 h_ℓ + (α/R) B_ℓ A_ℓ h_ℓ, (1)

其中W_ℓ^0冻结,A_ℓ ∈ ℝ^(R × d_in),B_ℓ ∈ ℝ^(d_out × R)。标准LoRA为每个问题激活所有R个秩通道。BiRG-LoRA则使用

z_ℓ = W_ℓ^0 h_ℓ + ρ(x) (α/R) B_ℓ Diag(ζ(x)) A_ℓ h_ℓ, (2)

其中ζ(x) ∈ {0,1}^R是一个稀疏秩掩码,‖ζ(x)‖_0 = κ,ρ(x) ∈ [0,1]是一个注入系数。在我们的主要配置中,R=16且κ=4。

每个秩通道对应一个秩-一原子:

Δ_{ℓ,j}(h_ℓ) = B_{ℓ,:,j} A_{ℓ,j,:} h_ℓ. (3)

因此,该方法将专家选择压缩到一个LoRA适配器的秩维度中,而不是在多个完整适配器之间进行选择。

表 II:BiRG-LoRA中的设计动机。每个组件与医学适配关注点相关,并对应第V节中的经验检查。

### III-B 双轴秩门控

医学问题在至少两个临床有意义的轴上存在差异。第一个是专科或职业轴s(x),包括临床医学、药学、护理、公共卫生、医学技术、中医学和基础生物医学。第二个是临床操作轴o(x),包括诊断、治疗、用药、检验解释、机制、护理操作、公共卫生和知识回忆。这些弱标签来自现有元数据和确定性关键词规则;它们作为结构先验使用,而非专家认证的解释。在训练和评估时,s(x)和o(x)仅来自问题题干、选项和公开的非答案元数据;正确答案和目标基准标签从不用于构建路由特征。

秩门控产生的logits为

a(x) = a_h(h_x) + a_s(s(x)) + a_o(o(x)) + a_so(s(x), o(x)), (4)

其中h_x是池化后的隐藏表征。隐藏分支允许模型在问题文本需要时偏离粗粒度元数据。专科和操作分支编码临床先验,交互分支捕捉诸如药学-用药与临床-诊断之类的组合。

稀疏掩码由直通(straight-through)top-κ算子形成:

p(x) = softmax(a(x)/τ), ζ(x) = STTopK(p(x), κ). (5)

前向传播使用硬top-κ掩码,而梯度通过软概率流动。这使得秩选择可审计,同时保持可微性。

### III-C 注入系数

标量ρ(x)控制更新强度:

ρ(x) = σ(w_ρ^T h_x + b_ρ). (6)

其动机是医学保守性。有些问题可以通过基础模型的广泛知识回答,激进的适配器更新可能会干扰正确答案。其他问题则需要更强的领域特定干预。在当前实验中,ρ(x)有帮助但还不是成熟的答案级风险校准器:在全模型中其均值约为0.75,无注入消融的平均值较低。因此我们将其描述为动态更新缩放器,而非临床安全保证。

### III-D 训练目标

训练使用仅在源集上的答案监督微调。损失为

L = L_ans + λ_ent L_ent + λ_bal L_bal + λ_orth L_orth + λ_axis L_axis. (7)

L_ent保持路由概率不退化,L_bal阻止全局秩坍塌,L_orth惩罚秩原子之间的相似性,L_axis分离专科和操作原型秩分布。这些损失项

相似文章

当病例罕见时:面向非指南临床问答的检索基准

arXiv cs.CL

介绍 OGCaReBench,这是一个自由形式的检索基准,用于评估 LLM 在需要超越标准指南推理的临床问题上的表现。实验表明,即使是最好的模型也仅能达到 56% 的准确率,但检索增强将性能提升至 82%。