药物毒性预测的提示工程分析

arXiv cs.AI 论文

摘要

本文研究了使用大型语言模型进行药物毒性预测时提示工程的影响,发现LLM输出的自然方差超过了提示微调,而化学信息学特征提取则提升了模型性能。

arXiv:2609.03635v1 公告类型:新 摘要:英国的临床试验费用可高达130万英镑,药物失败率约为90%。毒性是药物失败的主要因素。测试既耗时又昂贵。近年来,人工智能被越来越多地探索用于辅助药物毒性预测,其中大型语言模型(LLMs)被广泛使用。然而,当对提示进行微小更改时,LLMs可能表现出相当大的变异,这引发了它们对提示工程敏感性的担忧。提示工程用于优化提供给LLM的提示以生成所需输出。本文提出了一种分析药物毒性预测提示工程的方法。论文的目标是研究提示措辞对药物毒性预测的重要性。通过提示LLMs识别预测药物毒性时的重要化学性质。构建提示以调查:职位角色、提示结构和规则解释。然后使用LLMs基于初始提示中识别的特征生成数据集,这些数据集随后被传递给机器学习算法。实验表明,LLMs中发生的自然变异超过了提示的任何微调。然而,当使用化学信息学代码提取特征而不是使用LLM生成的值时,模型性能有了显著提高。所提出的分析方法适用于生物信息学不同领域中的各种提示类型。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:09

# 药物毒性预测的提示工程分析
来源:https://arxiv.org/html/2609.03635
Aakash Welgamage Don2与Mark Bartlett1地址:1英国阿伯丁罗伯特戈登大学计算、工程与技术学院。2英国阿伯丁罗伯特戈登大学药学、应用科学与公共卫生学院。ORCID代码:FA 0009-0005-6021-2894;SA 0000-0001-8364-2495;TA 0000-0003-3383-4100。∗通讯作者:[email protected]

###### 摘要

提示工程,机器学习,药物毒性。摘要英国临床试验的成本可高达130万英镑,药物失败率约为90%。毒性是导致药物失败的主要因素之一。传统毒性测试耗时且成本高昂。近年来,利用人工智能辅助预测药物毒性日益受到关注,尤其是广泛使用ChatGPT等大语言模型。然而,LLM的输出在输入提示发生微小变化时可能出现显著差异。本文旨在研究提示措辞对药物毒性预测的重要性。我们构建了一个机器学习流程,在其中两个环节引入LLM提示。实验表明,LLM输出的自然变异程度超过了对提示进行任何微调所带来的影响。不过,与该领域常用的LLM生成值相比,使用化学信息学代码提取特征时模型性能显著提升。所提出的分析方法可广泛应用于生物信息学不同领域的各类提示类型。

††脚注:文章版本:2026年9月3日 h\\currenttimeCET## 1引言

英国临床试验成本可高达130万英镑\[1 (https://arxiv.org/html/2609.03635#bib.bib9)\],而仅约10%进入I期临床试验的药物能进入英国市场\[2 (https://arxiv.org/html/2609.03635#bib.bib1)\]。临床试验失败的主要原因之一是毒性\[3 (https://arxiv.org/html/2609.03635#bib.bib12)\],即化学物质对生物体可能造成的危害程度。湿实验毒性预测伴随着巨大的时间和成本负担\[4 (https://arxiv.org/html/2609.03635#bib.bib3)\]。

近年来,科学家开始使用AI方法在临床试验前预测毒性,通过跨学科工具增强毒性预测能力,实现*计算机模拟*药物毒性预测\[5 (https://arxiv.org/html/2609.03635#bib.bib15)\]。近期文献中的一种方法是使用大语言模型\[6 (https://arxiv.org/html/2609.03635#bib.bib11),7 (https://arxiv.org/html/2609.03635#bib.bib4),8 (https://arxiv.org/html/2609.03635#bib.bib14),9 (https://arxiv.org/html/2609.03635#bib.bib16)\]。LLM提供的响应可能因所给提示的不同而存在巨大差异\[6 (https://arxiv.org/html/2609.03635#bib.bib11)\],但这些研究中往往未考虑提示措辞的影响。本文通过提出一种分析药物毒性预测中提示工程的方法,弥补了这一空白。提示工程是用于优化LLM输出的方法\[10 (https://arxiv.org/html/2609.03635#bib.bib7)\]。我们研究了提示工程对LLM输出变异性的影响,以及对后续毒性预测任务准确性的影响。

药物毒性可根据训练数据以不同方式进行分类。使用不同数据集使我们能够研究特定毒性类型,其中毒性与非毒性分类由机器学习模型的训练数据决定。

### 1.1相关背景工作

近年来,AI在药物毒性预测中的应用引起了越来越多的关注\[5 (https://arxiv.org/html/2609.03635#bib.bib15)\]。最近的关注点转向使用LLM来完成此任务。本节回顾了一些近期采用与本文方法类似的研究。

*零样本方法*(如\[7 (https://arxiv.org/html/2609.03635#bib.bib4)\])在不提供示例的情况下询问LLM某种化学物质是否有毒。*少样本方法*提出相同问题,但也提供期望输出的示例,如\[7 (https://arxiv.org/html/2609.03635#bib.bib4),8 (https://arxiv.org/html/2609.03635#bib.bib14)\]所示。这些研究通常将化学物质表示为SMILES(简化分子线性输入规范),将化学信息编码为单行文本\[8 (https://arxiv.org/html/2609.03635#bib.bib14)\]结合了通用提示和特定任务模板,在少样本设置中使用GPT模型,先提供带有毒性标签的示例SMILES,然后询问未知毒性的SMILES的毒性。LLM返回0(无毒)或1(有毒)。然而,尚不清楚模型是在预测毒性还是从其训练数据中召回(即*数据泄露*问题),这使得其预测新化学物质毒性的能力存疑。

最先进的方法\[9 (https://arxiv.org/html/2609.03635#bib.bib16)\]提出的方法论与本文研究的方法最为相似。该方法并非要求LLM直接将化学物质分类为有毒或无毒,而是要求LLM提供关于每种化学物质的数据。然后使用该数据集训练ML模型来预测毒性;这避免了数据泄露。LLM从文献中进行知识综合,然后必须从标记数据集中识别推断出的数据规则以辅助毒性预测。这些规则用于创建化学物质的特征向量,其中包含每个化学物质的信息,存储为1和0的列表,对应于对问题的“是”或“否”回答。然后使用这些向量训练ML模型来预测毒性。

## 2方法与结果

所使用的一般方法如下所述,每个阶段将在后续章节中详细探讨。最初,将提示传递给LLM,要求其输出可用于预测化学物质毒性的15个特征列表。与\[9 (https://arxiv.org/html/2609.03635#bib.bib16)\]不同,我们允许的特征不仅仅是“是”或“否”的值,还包括LogP或分子量等特征。然后要求LLM为从PubChem获取的一系列SMILES\[11 (https://arxiv.org/html/2609.03635#bib.bib10)\]中的每种化学物质生成与每个特征相关的值。结果得到一个数据集,包含15个特征列和每种化学物质一行。每种化学物质是否有毒的真实标签也从PubChem获取并添加到数据集中。使用80%的数据训练ML模型以预测毒性,然后在剩余20%上进行评估。模型产生特征重要性值,并使用指标进行评估。使用不同的提示和LLM重复此过程,以研究提示措辞对预测整体质量的影响。

### 2.1初始提示与特征生成

设计提示以生成15个在预测药物毒性时重要的特征列表。构建提示以研究角色、提示结构和规则解释。如表1 (https://arxiv.org/html/2609.03635#S2.T1)所示。

实验使用了多个LLM:Gemma3 4B\[12 (https://arxiv.org/html/2609.03635#bib.bib6)\]、Deepseek-r1-Distill-Qwen-8B\[13 (https://arxiv.org/html/2609.03635#bib.bib2)\]、Llama3.2 3B Instruct\[14 (https://arxiv.org/html/2609.03635#bib.bib13)\]、Mistral 7B Instruct\[15 (https://arxiv.org/html/2609.03635#bib.bib8)\]和Gemini-2.5-flash\[16 (https://arxiv.org/html/2609.03635#bib.bib5)\]。Gemini-2.5-flash通过Google的Gemini平台使用API运行,而其他LLM使用Ollama111https://ollama.com/运行。选择这些LLM是因为它们在近期文献中出现频繁。我们的目的并非产生最先进的结果,而是为了让我们能够研究在提供相同提示时不同模型之间的差异。

分析输出列表以识别不同LLM和提示生成的特征的相似性。特征名称由Gemini 2.5 flash标准化;由于同一属性(即分子量、MolW、Mol Weight)产生了不同的名称,因此这是必要的。出现频率最高的特征如图1 (https://arxiv.org/html/2609.03635#S2.F1)所示。LogP出现在每个特征列表中,这是预期的,因为它与水溶性呈负相关,通常可以指示毒性。分子量和拓扑表面积在特征列表中也很普遍。只有7个特征在超过25%的列表中出现,表明LLM识别的大多数特征存在很大差异。

表1:传递给LLM的提示。每个提示使用四种不同的角色替代\{JOB\}占位符进行实例化:生物化学家、生物学家、化学家、未提供角色。这导致总共测试了20种提示变体。颜色表示不同提示的相应方面。参考说明图1:所有提示-LLM组合中最常识别的化学特征。

### 2.2数据集创建

为了研究LLM、角色、提示结构和固有随机性对预测准确性的影响,使用之前获得的特征列表的子集生成了18个数据集。LLM接收来自PubChem毒性数据集\[11 (https://arxiv.org/html/2609.03635#bib.bib10)\]的2,294个SMILES。该数据集包含789个有毒和1,505个无毒化合物,反映了中等程度的类别不平衡。模型还接收来自第2.1节 (https://arxiv.org/html/2609.03635#S2.SS1)的特征列表和一个带有指令的提示。选择Llama3.2是因为在初步实验中它成功遵守了严格的格式要求。基于初步实验,使用以下提示构建数据集。

> 根据给定的SMILES字符串,计算下面列出的所有化学特征。遵循提供的精确特征顺序。输出恰好15个值,仅用逗号分隔,无空格。仅数值。二进制特征编码为1或0。如果无法计算值,则输出NA。如果SMILES无效,则输出INVALID_SMILES。仅输出结果行。

为检查LLM生成值的准确性,我们编写了一个化学信息学流程,使用RDKit独立计算相同的特征。该流程使用相同的SMILES数据集和特征定义,并以相同格式生成结果进行比较。无法计算的特征要么使用相关描述符近似,要么标记为缺失。所有计算都是确定性的。无法解析的SMILES被排除在特征计算之外,但仍记录在输出中。

多次向同一LLM提出相同的提示,以测量随机变异的影响(1aL1, 1aL2和1aL3)。我们研究了使用不同的LLM,同时保持提示和角色相同(3aD, 3aM, 3aL, 3aG和3aF)。通过向Llama3.2提供带有不同角色的相同提示变体来研究角色(5aL, 5bL, 5cL和5dL)。数据集4cL_Calc和4cL_LLM使用相同的生成特征列表,分别比较通过化学信息学代码或LLM提取特征的效果。数据集名称的详细说明见图2 (https://arxiv.org/html/2609.03635#S2.F2)的说明。

### 2.3机器学习模型与评估

清理生成的数据集,移除无法计算的LLM生成特征以及包含INVALID或NaN值的行。然后将真实毒性作为新列添加。数据集用于训练几种知名的ML模型:随机森林、决策树、神经网络(多层感知机)、支持向量机、朴素贝叶斯和极端梯度提升。分别使用StandardScaler、SMOTE和GridSearchCV进行缩放、数据平衡和参数调优。

图2 (https://arxiv.org/html/2609.03635#S2.F2)显示,使用化学信息学流程提取的特征优于LLM生成的特征(以AUC衡量)。当仅改变LLM特征生成中的固有随机性时,性能在不同数据集之间也存在差异,表明生成的特征存在变异性。相比之下,更改LLM对性能影响很小,不同模型的AUC值相似。角色变体之间的性能也存在差异,没有一个变体始终表现最佳。所有评估指标显示了相似的趋势。通过破坏特征与目标变量的关系并测量由此导致的模型性能下降来计算排列特征重要性。图3 (https://arxiv.org/html/2609.03635#S2.F3)显示了所有模型和数据集上LogP和分子量的特征重要性,说明了这两个最常见特征的变异性。

参考说明图2:所有数据集前10个模型的AUC值热图。每个单元格显示模型在特定数据集上的平均AUC。暖色调表示更高的AUC,突出了在各数据集上表现一致良好的模型。x轴上的数据集标签是提示和LLM的详细说明。xyz - 其中x是使用的提示(表1中 (https://arxiv.org/html/2609.03635#S2.T1)的1-5),y是角色变体;a=生物化学家,b=生物学家,c=化学家,d=未提供角色。z是使用的LLM;D=Deepseek-v2,M=Mistral,L=Llama3.2,G=Gemma3,F=Gemini-2.5-flash。当w是数字时,数据集xyzw反映了在生成过程中固有的随机性下的重复LLM采样。当w=_Calc时,表示使用化学信息学代码生成数据集;当w=_LLM时,表示LLM生成的该数据集变体。参考说明图3:所有数据集和模型上分子量和LogP的排列特征重要性。柱状图表示特征被置换时模型性能的平均下降,通过多个模型计算得出。误差条显示特征重要性在模型间的标准差。数据集标题的详细说明见图2 (https://arxiv.org/html/2609.03635#S2.F2)的说明。

## 3结论

本研究调查了提示工程对药物毒性预测的影响。研究发现,简单的微调提示对LLM输出没有显著影响。研究发现,LLM响应中的随机变异似乎与更改提示文本或所用LLM所造成的变异程度相当。LLM提取的特征被证明不如化学信息学提取的特征有效,后者显示出更高的性能。虽然微调提示可能不是提高预测质量的可行方法,但未来的工作应探索该流程的变体,例如使用SMILES以外的表示形式,以及更复杂的特征工程方法,如检索增强生成。显著性检验也可能为观察到的变异性提供额外见解。

## 数据和软件代码可用性

## 参考文献

- \[1\]药品和医疗保健产品监管局(2026)当前MHRA费用。注:https://www.gov.uk/government/publications/mhra-fees/current-mhra-fees更新于2026年1月12日,访问于2026年2月3日 引用自:§1 (https://arxiv.org/html/2609.03635#S1.p1.1)。
- \[2\]英国制药工业协会(2025)英国工业临床试验:将行动转化为影响。

相似文章

基于交互的LLM提示敏感性评估与解释

arXiv cs.LG

本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。

多语言语言模型中有毒内容检测与缓解策略综述

arXiv cs.CL

本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。