超越端点增益:医疗专业化的权重变化审计

arXiv cs.AI 论文

摘要

本文提出一种权重变化审计方法,用于分析语言模型中的医疗专业化,考察超越端点基准分数的内部更新变化。

arXiv:2608.20768v1 Announce Type: new 摘要:专家语言模型通常通过端点增益来理解:通用模型得分较低,专家模型得分较高,差异被视为专业化的证据。这使得发布的更新本身大部分未被检查。我们提出一种配对权重变化路径审计方法,并将其应用于两个公开的、对齐的通用到医疗专家检查点对:Gemma-3-4B-IT 到 MedGemma-4B-IT 和 Qwen2.5-7B-Instruct 到 HuatuoGPT-o1-7B。在这两对中,完整的解码器端更新强烈重构了测量到的医疗基准移动(0.974 和 1.183 的端点归一化保留率),使得每个解码器变化成为审计的合适基质。然而,移动并非清晰局部化。MLP 在两对中都是最强大的宽组件家族,但混合的域外移动、10 种子匹配控制和端点锚定回滚阻止了唯一的粗家族解释。因此,审计将更新级重构与组件级解释分开。其主张涉及纯文本多选基准移动,而非临床验证、修复或电路级机制。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:23

# 超越端点增益:医学专业化的权重差审计
来源:https://arxiv.org/html/2608.20768
Shanu Kumar、Akshat Agarwal\[0.55em\] 印度坎普尔理工学院·Oracle Health AI·MBZUAI

###### 摘要
专业语言模型通常通过端点增益来理解:通用模型得分较低,专业模型得分较高,差异被视为专业化的证据。这使得发布的更新本身在很大程度上未被审视。我们提出了一种配对权重差路径审计方法,并将其应用于两对公开的、对齐的通用-医学专业检查点对:Gemma-3-4B-IT→\rightarrow MedGemma-4B-IT 和 Qwen2.5-7B-Instruct→\rightarrow HuatuoGPT-o1-7B。在这两对模型中,完整的解码器侧更新能够强有力地重建测量的医学基准表现(归一化端点保留率分别为0.974和1.183),使得每个解码器差值成为适合审计的基础。然而,这种变化并非清晰局部化。MLP是两对模型中最广泛的组件家族,但混杂的非领域移动、10个种子匹配的对照组以及端点锚定回滚,都阻碍了提供独特的粗粒度家族解释。因此,审计将更新级的重建与组件级的解释分开进行。其结论仅针对纯文本多选基准表现的变动,而非临床验证、修复或电路级机制。

## 1 引言
领域专业化的语言模型通常通过端点比较来呈现。评估基础检查点,评估专业检查点,分数差异被视为专业化的证据。对于医学领域,这种端点视角尤为常见:公开的考试式基准提供了一种便捷的方法来总结医学模型是否优于其通用祖先(26 (https://arxiv.org/html/2608.20768#bib.bib5);27 (https://arxiv.org/html/2608.20768#bib.bib6);19 (https://arxiv.org/html/2608.20768#bib.bib7);25 (https://arxiv.org/html/2608.20768#bib.bib3))。但是端点分数留下了一个基本问题:发布的更新本身带来了什么?

这个问题很重要,因为专业化不是一个单一的标量。同一个检查点更新在改进目标领域基准的同时,也可能引入非领域增益、非领域退化,以及仅从最终分数无法看到的广泛内部变化。相反,一个看似有用的组件家族可能仅仅包含了更新的大部分,而不是唯一解释了行为。端点评估告诉我们两个模型有所不同;但它没有审计发布的更新是广泛的还是局部的,是特定于目标的还是混合的,或者是否真正具有组件结构。

我们使用两对公开对齐的通用-医学专业模型来研究这个问题:Gemma-3-4B-IT→\rightarrow MedGemma-4B-IT(31 (https://arxiv.org/html/2608.20768#bib.bib4);25 (https://arxiv.org/html/2608.20768#bib.bib3))和 Qwen2.5-7B-Instruct→\rightarrow HuatuoGPT-o1-7B(37 (https://arxiv.org/html/2608.20768#bib.bib1);3 (https://arxiv.org/html/2608.20768#bib.bib2))。前者是我们主要详细审计的对象;后者检验其核心模式在架构和检查点系谱改变后是否依然成立。由于对应的解码器张量在每一对内是对齐的,因此可以将发布的检查点差异视为权重空间中可审计的路径。我们使用医学领域是因为它具有重要性且基准测试广泛,但我们关注的对象是沿发布更新的测量基准变动,而非临床可靠性。

参见标题 图1:配对检查点审计协议,以主要的 Gemma→\rightarrow MedGemma 对为例说明。对于每个对齐的发布,我们首先测试完整的解码器侧路径是否能重建测量的基准变动,然后测试组件家族解释在匹配对照和端点回滚后是否依然成立。这种路径视角将端点比较转化为一系列审计问题。首先,发布的检查点发生了什么变化?描述性 ΔW\\Delta W 筛查显示,主要更新是广泛的,并且在解码器层和投影家族中具有结构性,而非微小的局部编辑。其次,观察到的解码器更新是否真正重建了测量的医学增益?评估完整的解码器侧路径显示在两对模型中它确实重建了。第三,沿着同一条路还有什么其他变化?选定的非临床退化和选定的非临床增益并存,而总体的非临床准确率几乎持平,因此更新并不能被很好地概括为广泛遗忘。

最后一个问题在于,这种变动是否有简单的组件级解释。我们测试了限定范围的组件家族路径、匹配的随机对照组和端点锚定回滚。这些探针显示了部分充分性,但没有清晰的局部化。MLP家族路径在测试的限定桶中最强,但它也很大;匹配的随机对照组可以接近或超过结构化桶;并且从专业端点回滚单个家族会在医学保留率与选定的退化恢复之间权衡,而没有揭示出一个清晰的调节旋钮。因此,主要的组件结果是负面的:医学基准变动是路径可重现的,但并非唯一局部化到某个测试的粗粒度组件家族。

这种框架不同于任务向量迁移、模型合并、模型编辑和电路发现。那些工作线通常询问如何组合、优化、修复或从机制上解释模型行为。我们提出一个更窄的审计问题:给定一个对齐的专业发布,其观察到的更新携带了哪些基准变动,以及简单的组件解释在多大程度上能经受住对照组的检验?证据顺序很重要:端点变动促使进行完整更新重建;重建使得组件部分充分性测试成为可能;匹配的对照组检验独特性;回滚测试干预效用。这些阶段中没有一个单独能提供电路级机制。

在本文中,我们提出了一种配对权重差路径审计方法,并在两个对齐的医学专业发布上进行了评估。该审计使用医学多选题复合指标、更广泛的非临床套件、选定的退化和增益诊断以及解码器侧路径扫描。它贡献了一个可复用的协议、一个两对模型的重建结果(表明测量的医学变动由每个发布的解码器更新所携带),以及一个负面的局部化教训:组件声明必须能经受住大小/更新质量对照和端点回滚的检验,才能成为解释。

## 2 相关工作
#### 医学语言模型与端点评估
医学语言模型通常使用公开的考试式基准进行评估,包括 MedQA 和医学 MMLU 子集(14 (https://arxiv.org/html/2608.20768#bib.bib8);11 (https://arxiv.org/html/2608.20768#bib.bib9))。专业系统和医学模型发布通过提示、后训练或领域特定检查点在这些基准上报告增益(26 (https://arxiv.org/html/2608.20768#bib.bib5);27 (https://arxiv.org/html/2608.20768#bib.bib6);19 (https://arxiv.org/html/2608.20768#bib.bib7);4 (https://arxiv.org/html/2608.20768#bib.bib10);25 (https://arxiv.org/html/2608.20768#bib.bib3))。这些结果是有用的行为摘要,但它们是端点摘要:它们没有显示产生增益的更新是如何组织的,也没有建立推理质量或临床部署的准备就绪性(38 (https://arxiv.org/html/2608.20768#bib.bib11);22 (https://arxiv.org/html/2608.20768#bib.bib12))。我们的工作是互补的:我们使用一个可审计的医学多选题复合指标作为受控读数,来研究发布时的专业化更新本身。

#### 机制性定位与干预分析
可解释性工作研究模型行为在哪里实现,包括前馈记忆、知识神经元、注意力头、电路和稀疏特征(21 (https://arxiv.org/html/2608.20768#bib.bib13);24 (https://arxiv.org/html/2608.20768#bib.bib14);9 (https://arxiv.org/html/2608.20768#bib.bib15);6 (https://arxiv.org/html/2608.20768#bib.bib16);8 (https://arxiv.org/html/2608.20768#bib.bib17);7 (https://arxiv.org/html/2608.20768#bib.bib18);34 (https://arxiv.org/html/2608.20768#bib.bib19);12 (https://arxiv.org/html/2608.20768#bib.bib20);2 (https://arxiv.org/html/2608.20768#bib.bib21);15 (https://arxiv.org/html/2608.20768#bib.bib22))。因果中介、因果追踪、归因修补和相关干预措施为特定提示或机制提供了更细粒度的证据(33 (https://arxiv.org/html/2608.20768#bib.bib23);17 (https://arxiv.org/html/2608.20768#bib.bib27);5 (https://arxiv.org/html/2608.20768#bib.bib24);30 (https://arxiv.org/html/2608.20768#bib.bib25);10 (https://arxiv.org/html/2608.20768#bib.bib26))。我们的组件路径在更粗的粒度上操作:它们询问观察到的更新的广泛子集是否能重现基准变动,而不是一个最小电路或神经元集合是否实现了医学专业化。先前的工作给出了预期 MLP 有重要贡献的理由,但一个大家族可能仅仅因为包含了更新的大部分而显得充分。因此,我们将 MLP 结果视为一个假设,需针对大小和能量匹配的子集进行检验,而不是将其本身视为定位。

#### 权重空间编辑、插值与合并
权重空间方法通过事实编辑、模型平均、任务算术和抗干扰合并来修改或组合检查点(17 (https://arxiv.org/html/2608.20768#bib.bib27);18 (https://arxiv.org/html/2608.20768#bib.bib28);35 (https://arxiv.org/html/2608.20768#bib.bib29);16 (https://arxiv.org/html/2608.20768#bib.bib30);13 (https://arxiv.org/html/2608.20768#bib.bib31);36 (https://arxiv.org/html/2608.20768#bib.bib32);28 (https://arxiv.org/html/2608.20768#bib.bib33))。激活和表示空间干预提供了引导行为的另一个控制面(32 (https://arxiv.org/html/2608.20768#bib.bib34);39 (https://arxiv.org/html/2608.20768#bib.bib35);23 (https://arxiv.org/html/2608.20768#bib.bib36)),而配对模型的权重修补在精神上尤其接近(29 (https://arxiv.org/html/2608.20768#bib.bib37))。这些方法通常将差值视为要迁移、组合、优化、编辑或因果解释的对象。我们对差值的使用更为谨慎:我们将发布的同系专业更新视为待审计的证据,询问沿此更新出现了哪些基准变动,以及组件解释在多大程度上能经受住对照组的检验。简而言之,先前的权重差工作通常询问如何改变或解释模型;我们则询问在基准读数和负面对照下,一个发布时的专业更新能和不能解释什么。

#### 专业化权衡与遗忘
专业化和指令调优可以改进目标领域的行为,而其对更广泛能力的影响则需要单独评估(1 (https://arxiv.org/html/2608.20768#bib.bib38);25 (https://arxiv.org/html/2608.20768#bib.bib3);20 (https://arxiv.org/html/2608.20768#bib.bib39))。持续学习工作通常研究在已知训练序列上的遗忘;而在我们的设定中,仅观察到两个发布的端点。因此,我们把选定的非临床退化和增益视为此检查点对的端点条件诊断,而非遗忘或能力迁移的完整估计。

## 3 设置、数据与指标
### 3.1 配对检查点
我们的主要检查点对是 Gemma-3-4B-IT 及其医学专业化的后代 MedGemma-4B-IT(25 (https://arxiv.org/html/2608.20768#bib.bib3))。我们在 Qwen2.5-7B-Instruct 和 HuatuoGPT-o1-7B(37 (https://arxiv.org/html/2608.20768#bib.bib1);3 (https://arxiv.org/html/2608.20768#bib.bib2))上重复了该审计。分析需要张量对齐,而不仅仅是架构相似:对应的解码器张量必须具有匹配的形状和参数角色。这在每个发布的对内都成立。对于 Gemma,我们将观察到的检查点变动定义为:
ΔWall=WMedGemma−WGemma,\\Delta W\\{\\mathrm{all}\\}=W\\{\\mathrm{MedGemma}\\}-W\\{\\mathrm{Gemma}\\},
并类似地定义 Qwen 的变动。这些是发布的检查点差异,而非学习到的编辑器、适配器或优化的合并方向。这两对模型都是公开的、同系的且张量对齐的,因此无需推断训练轨迹或匹配不相关的模型家族即可审计其更新。

由于我们的基准输入是纯文本的,主要干预措施使用该变动中共享的解码器侧部分。令 ΔWdec\\Delta W\\{\\mathrm{dec}\\} 表示从 ΔWall\\Delta W\\{\\mathrm{all}\\} 中提取的对齐的解码器矩阵。参考解码器路径为:
Wdec(t)=WGemma+tΔWdec。W\\{\\mathrm{dec}\\}(t)=W\\{\\mathrm{Gemma}\\}+t\\Delta W\\{\\mathrm{dec}\\}。
这里 t=0 是基础解码器,t=1 是专用于文本评估的专业解码器的重建。MedGemma 还包含多模态组件;我们描述性地分析编码器侧的变化,但主要的行为审计目标是纯文本解码器路径。对于 Qwen,相同的构造使用 t=0 时的 Qwen2.5 和 t=1 时的 HuatuoGPT-o1。我们使用线性加法路径,因为它能暴露观察到的更新的分数,并使组件掩码和匹配对照可直接比较。它是一个诊断坐标,而非对训练轨迹的声明;像 SLERP 这样的曲线路径仍然是有用的鲁棒性检查。

Gemma 解码器审计覆盖 238 个对齐的二维矩阵,包含 3.209B 参数(占 3.316B 对齐矩阵参数的 96.8%);81 个编码器侧矩阵包含 0.107B 参数,将单独描述。Qwen 审计覆盖 196 个对齐的解码器投影矩阵,大约 6.53B 非嵌入参数。嵌入、归一化参数和输出头不包括在这些矩阵家族干预中。

### 3.2 路径家族
我们评估三种路径家族。第一种是上述的完整解码器路径,作为参考重建。它询问观察到的解码器侧更新是否携带了测量的基准变动。

第二种是从基础开始的限定范围组件路径。对于选定的解码器家族或桶 SS,我们仅应用该更新的子集:
WS(t)=WGemma+tΔWS, W\\{S\\}(t)=W\\{\\mathrm{Gemma}\\}+t\\Delta W\\{S\\},
其中 ΔWS⊆ΔWdec\\Delta W\\{S\\}\\subseteq\\Delta W\\{\\mathrm{dec}\\}。这些路径测试部分充分性:单个子集是否能重现参考变动。

第三种是端点锚定回滚路径。从完整的解码器更新开始,我们仅回滚选定的家族 SS:
Wanch,S(α)=Wdec(1)−(1−α)ΔWS。W\\{\\mathrm{anch},S\\}(\\alpha)=W\\{\\mathrm{dec}\\}(1)-(1-\\alpha)\\Delta W\\{S\\}。
我们针对注意力和 MLP 运行此扫描,α∈{0,0.25,0.5,0.75,1}。因此 α=1 是完整的解码器更新,而较小的值仅将选定的家族移回 Gemma 方向。限定路径询问一个家族本身是否充分;锚定回滚询问当该家族从一个原本完整专业更新中被移除时会发生什么。这两种路径都不是最小电路声明。

### 3.3 评估视图
对于两个检查点对,目标领域读数是相同的 1,810 个公开医学多选题复合指标,来自 MedQA 和医学 MMLU 子集。我们限制该复合指标仅包含具有可审计公开金标准标签、兼容单一评分流程的行。因此本文审计的是测量的基准变动,而非临床可靠性。

我们将其与相同的公开非临床套件配对,包含 7,325 个来自 GPQA Diamond、MMLU-Pro、Co

相似文章

审计挑战:健康大型语言模型输出的变异性

arXiv cs.CL

本文发现,基于API和聊天机器人界面等访问模式,大型语言模型在健康建议输出上存在系统性差异,这削弱了评估的有效性。它呼吁模型提供商启用对消费者体验的忠实复制,以进行严格审计。