MARD:镜像增强推理蒸馏用于机制级药物-药物相互作用预测

arXiv cs.CL 论文

摘要

提出MARD,一个70亿参数的模型,用于机制级药物-药物相互作用预测,采用镜像增强推理蒸馏,以前沿API约1%的成本实现了最先进的准确率,并展示了真正的药理学推理能力而非记忆。

arXiv:2606.12578v1 公告类型:新 摘要:机制级药物-药物相互作用(DDI)预测不仅需要判断两种药物是否相互作用,还需识别涉及哪种酶或药效轴、作用方向以及相关证据。我们引入了一种可重复的机制级DDI标注与评估协议,包含结构化的7大类别/147个子类分类体系、防泄漏冷分割协议,以及可审计的推理指标,用于评估超越扁平交互分类的药理学预测。我们提出了一套流水线,生成了一个70亿参数的推理模型MARD(镜像增强推理蒸馏),结合了三种训练创新:方向标签上的单token KL散度(用于锚定模型预测)、逐损失PRM加权DPO(结合程序化硬负样本),以及防泄漏的机制感知检索通道。过程奖励步骤标签可自动根据DrugBank结构化字段验证,无需人工或LLM评判。在2026年4月的DrugBank版本中,我们的MARD-7B是32个系统对比中唯一在药物对新颖性下仍保持准确率的系统,比最佳基线高13.9个百分点,比GPT-4o高6.7个百分点,而成本仅为前沿API的约1%。进一步分析显示了一种反记忆特征:在罕见药物上准确率反而提升,表明性能提升源于结构化的药理学推理而非药物频率记忆。我们发布了语料库、DDI-PRM、检索索引和训练代码。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:50

# MARD: 镜像增强推理蒸馏用于机制级药物-药物相互作用预测 来源:https://arxiv.org/html/2606.12578 Mohammadreza Riyazat¹, Vian Lelo¹, Rameen Jafri¹, Yumna Khan¹, Abeer Badawi²,³ ¹圭尔夫大学,加拿大 ²约克大学,加拿大 ³向量研究所,加拿大 \{mriyazat,vlelo,rjafri,ykhan04\}@uoguelph\.ca, abeerbadawi@yorku\.ca ###### 摘要 机制级药物-药物相互作用(DDI)预测不仅需要判断两种药物是否相互作用,还需要识别涉及的具体酶或药效轴、作用方向以及证据来源。我们提出了一种可复现的机制级DDI标注与评估协议,包含结构化的7大类/147亚型分类体系、防泄露的冷拆分协议,以及用于评估药理预测的可审计推理指标(超越平面交互分类)。我们设计了一个流水线,生成了一个7B推理模型MARD(镜像增强推理蒸馏),结合了三种训练创新:方向标签上的单token KL散度(将模型预测与方向绑定)、基于每损失PRM权重的DPO(含程序化困难负样本),以及防泄露的机制感知检索通道。过程奖励步骤标签可自动根据DrugBank结构化字段验证,无需人工或LLM评判。在2026年4月发布的DrugBank数据上,我们的MARD-7B是32个系统比较中唯一一个在药物对新颖性下准确率保持稳定的系统,在约1%的先进API成本下,比最强基线高出+13.9个百分点,比GPT-4o高出+6.7个百分点。进一步分析揭示了抗记忆化特征:在罕见药物上的准确率反而提升,表明增益来自结构化的药理推理而非药物频率记忆。我们发布数据集、DDI-PRM、检索索引和训练代码¹。 MARD: 镜像增强推理蒸馏用于机制级药物-药物相互作用预测 Mohammadreza Riyazat¹, Vian Lelo¹, Rameen Jafri¹, Yumna Khan¹, Abeer Badawi²,³ ¹圭尔夫大学,加拿大 ²约克大学,加拿大 ³向量研究所,加拿大 \{mriyazat,vlelo,rjafri,ykhan04\}@uoguelph\.ca, abeerbadawi@yorku\.ca ## 1 引言 不良药物相互作用估计导致5-10%的住院(Komagamine, 2024),而全球多药治疗影响52%的住院患者(Kim et al., 2024)进一步加剧了这一负担。临床问题不是“A与B是否相互作用”,而是机制性问题:涉及*哪个*酶、转运体或药效轴,相互作用以*哪个*方向进行,以及*哪个*证据支持该声明。未经证实的“可能相互作用”警报导致警报疲劳,并经常被忽略。一项对16项研究的系统回顾和荟萃分析发现,开药者会忽略临床决策支持系统产生的90%的DDI警报(Felisberto et al., 2024)。根本原因不是警报数量,而是内容:一个*可能相互作用*的标记,但没有指明机制、方向或证据基础,临床医生没有可操作的信息。然而,几乎每个现有基准都将DDI简化为基于特征或图的分类器的top-1标签准确率(Ryu et al., 2018; Deng et al., 2020; Yu et al., 2021),最近的理性推断系统(Sun et al., 2024; Wang et al., 2024)既没有将理性约束到可审计的模式,也没有强制执行药理对称性(即翻转一对药物必须镜像其预测)。理论上能够提供此类理性的前沿推理LLM,在直接应用时会在三个正交方向上失败:*(i) 镜像不一致* – 同一对药物以(A,B) vs. (B,A)呈现时,在模仿基线中产生不同的大类/方向预测,比例达51.4%;*(ii) 类别不平衡崩溃* – 七个机制大类跨度达47倍的大小比,朴素交叉熵MARD(镜像增强推理蒸馏)会崩溃到“AdverseRisk”吸引子上;*(iii) 证据幻觉* – 训练来模仿教师完整轨迹的模型会鹦鹉学舌般地重复措辞,而不与事实挂钩,引用了不存在的CYP标志或非靶标蛋白,药剂师无法验证。 #### 研究问题。 一个小语言模型(SLM),在测试时无法访问前沿模型的情况下,能否生成同时满足*模式约束*、*镜像稳定*、*对冷药物和冷对鲁棒*(训练时未见过的药物和组合),以及*可审计*(每条引用都可追溯到一个有限的、结构化的证据池)的DDI预测? #### 方法。 我们将任务定义为约束推理蒸馏。所得系统MARD(镜像增强推理蒸馏)是一个7B学生模型,接收查询对和结构化的证据池,生成可验证的、遵循模式的、结构化的推理轨迹。四个阶段共同解决(i)-(iii) – 跨教师共识(§3.3)、镜像增强SFT(含位置限制对称性KL散度)(§3.5)、基于PRM权重的DPO(含困难负样本)(§3.6),以及机制感知检索(§3.7) – 使用2026年4月DrugBank版本(145万对,7大类×147亚型),在三种拆分协议(随机拆分(热)、药物冷、药物对冷)下进行。 #### 主要结果。 MARD-7B是32个系统比较中唯一一个在药物对新颖性下准确率保持稳定的系统(在药物对冷场景下,比最强基线DDIMDL高+13.9个百分点,比GPT-4o高+6.7个百分点,而成本仅为约1%),同时保持镜像稳定(镜像大类稳定性MFS≥0.97,镜像预测对称性MPS≥0.78),几乎无幻觉(幻觉率HR=3.7×10⁻⁴),并通过强大的上下文-支持对齐(CSA)实现引用落地。总之,我们的工作贡献了四个方面: - • **一个可复现的机制级DDI标注和协议**。包含7个大类×147个亚型的分类体系(带方向性)、三种防泄露拆分(热、药物冷、药物对冷),以及四个轨迹质量指标(MFS、MPS、CSA、HR),以代码和DrugBank-ID清单形式发布,供许可复制。 - • **MARD:一个耦合的训练方法**。三个新成分——方向标签token上的位置限制对称性KL散度(结构化LLM预测的归纳偏置)、基于可自动验证的DrugBank步骤标签训练的PRM,以及仅限于结构化`final_answer`块的程序化困难负样本。 - • **临床推理的无评判训练信号**。基于模式的DDI轨迹可确定性地根据DrugBank验证,将过程奖励和偏好数据转化为自动标注的信号,无需人工评分员或LLM评判在循环中。 - • **证据表明成功来自于推理而非记忆化**。在结构基线、开放医疗基线和前沿基线上,MARD是唯一一个在罕见药物上每十分位准确率*上升*的系统——这一符号翻转区分了药理推理与药物指纹查表。 ## 2 相关工作 #### 预测性DDI。 主流的做法将DDI视为平坦标签空间上的监督多标签分类:DeepDDI(Ryu et al., 2018)、DDIMDL(Deng et al., 2020)、CASTER(Huang et al., 2020)、SumGNN(Yu et al., 2021)、DSN-DDI(Li et al., 2023)、LaGAT(Hong et al., 2022)和MRCGNN(Xiong et al., 2023),并打包成2020个系统的OpenDDI套件(Jin et al., 2026)。这些系统预测单一的平坦大类标签,不提供亚型、方向、理由或对称性保证。 #### 理性推断和检索增强型DDI。 较小的分支专注于理由而不是标签。ExDDI(Sun et al., 2024)检索DrugBank描述,并要求指令调优的LLM提供自由形式的解释,但仅在标签层面进行评估。ZeroDDI(Wang et al., 2024)组合生物语义进行零样本归纳预测。最接近的前期工作是CBR-DDI(Liu et al., 2025),它通过混合语义和结构相似性检索历史案例对,并报告了消融实验,显示检索块是关键支撑。然而,作为一个仅基于冻结LLM的提示框架,它没有在**固定微调**模型上,对**相同**对隔离检索的贡献。前沿和医疗LLM的直接提示已被证明在DDI上表现低于专门基线(De Vito et al., 2025; Singhal et al., 2023),这激发了蒸馏而非零样本使用。 #### 推理蒸馏、过程奖励和对称性。 逐步推理蒸馏(Magister et al., 2023; Fu et al., 2023; Chen et al., 2025)结合结果或过程奖励验证器(Cobbe et al., 2021; Uesato et al., 2022; Lightman et al., 2023)在数学推理中已成熟,而基于PRM权重的DPO(每步梯度加权)已由Full-Step-DPO(Xu et al., 2025)和R-PRM(She et al., 2025)展示。我们共享每损失PRM加权机制,但将其实例化用于临床机制预测,其中步骤标签可自动根据DrugBank结构化字段验证(Knox et al., 2024)。输入重排序下的对称性是自回归LLM的一个已知弱点(Berglund et al., 2024; Chen et al., 2024);先前的回应在完整输出上应用序列级一致性目标(Kumar and Joshi, 2022; Hejabi et al., 2025)。我们的位置限制对称性KL散度针对单个方向标签token,据我们所知,这是一种以前未用于结构化LLM预测的归纳偏置。自一致性(Wang et al., 2023)、最佳N重排序(Cobbe et al., 2021)和共形选择预测(Vovk et al., 2005; Romano et al., 2020)是标准的测试时方法,我们在训练好的学生模型上进行组合。 ## 3 方法论 我们将药物-药物相互作用(DDI)机制预测定义为在结构化证据池上的约束推理:给定一对药物,预测相互作用*大类*、*亚型*和*方向*,并附上仅引用可验证证据ID的理由。在确定任务、模式和镜像要求后(§3.1–§3.2),该方法开发了五个组件:跨教师共识蒸馏(§3.3)、具有自动可验证步骤标签的微调PRM(§3.4)、位置限制对称性KL散度的镜像增强SFT(§3.5)、基于PRM权重的DPO(§3.6),以及防泄露的机制感知检索通道(§3.7)。所有缩写和简写术语的词汇表见附录A。 工作示例:一个药物对,端到端输入 A = *伏立康唑*(抗真菌药),B = *阿昔替尼*(激酶抑制剂类抗癌药)。对于每种药物,模型接收一个固定的药理学字段模式(代谢酶、转运体、分子靶标、通路)、四个药物对级相似度分数,以及一个少量已标注的邻居对列表。 输出 一个JSON文档,包含3-8步推理轨迹——每一步引用具体的输入事实并说明哪种药物作用于哪个——以及一个结构化预测(大类、亚型、方向、极性、置信度、弃权标志、单句摘要)。 对于这对药物:伏立康唑抑制阿昔替尼的代谢,升高阿昔替尼暴露量。 约束 正确答案永远不会出现在提示中;因为输入是结构化的,每一步推理都可以仅凭数据检查。我们可以验证引用、步骤-预测一致性和幻觉,而无需下游LLM评判。这使我们能够使用自动可验证标签训练PRM(§3.4)并报告引用支持和幻觉率。图1总结了这对药物端到端的五阶段流水线;完整的一页轨迹——DrugBank字段、证据池和推理步骤——见图5(附录B)。 请参考图注 图1:对于未见药物对的MARD-7B流水线。系统检索结构化证据和相似标注对,使用镜像增强推理和PRM加权DPO进行训练,生成引用落地的推理轨迹,并产生可验证的DDI预测。MFS和HR是语料级评估指标。 ### 3.1 任务和数据集 语料库。数据集基于2026年4月发布的DrugBank(Knox et al., 2024):19,853种药物和1,456,772个无序标注对。对规范化描述模板使用正则表达式级联,产生三层分类体系:七个机制大类及147个亚型(表25),大类间大小比高达47倍(AdverseRisk 42.7% vs. PK\_Absorption 0.9%)。DDInter 2.0(Tian et al., 2025)仅贡献严重性元数据。 证据池。对于每个对p,证据池Ep汇总三层输入。*药物级事实*:每种药物的抑制/底物标志(针对标准药物代谢酶和转运体:CYP、P-gp、OATP、BCRP)、ATC药物分类路径、作用机制摘录、血浆半衰期、靶标/酶/转运体/载体蛋白集合,以及SMPDB/KEGG代谢通路成员资格。*药物对级标量*:药物A和B之间的四个相似度分数:

相似文章

The biggest AI breakthrough in medicine & drug discovery

Reddit r/singularity

MAML is a novel multi-modal AI model that unifies understanding of chemistry, genetics, and proteins, outperforming specialized models on 11 drug discovery benchmarks, promising to accelerate pharmaceutical research and improve success rates.