MolSafeEval:用于揭示AI生成分子安全风险的基准测试

arXiv cs.LG 论文

摘要

介绍MolSafeEval,这是一个专门评估AI生成分子安全风险的基准,通过将异质安全知识整合到分子安全知识图谱中,并利用基于大语言模型的推理来系统检测不安全特征。

arXiv:2607.00464v1 公告类型:新 摘要:当前的分子生成基准强调任务复杂度、分子新颖性和性质对齐,但很大程度上忽略了一个关键问题:AI生成分子的潜在安全风险。实际上,许多生成模型可能产生具有毒性、反应性或其他危险特性的分子,这些隐藏的危险尚未得到充分解决。为弥补这一空白,我们提出了MolSafeEval,这是一个专门评估和分析分子生成安全风险的基准。与依赖于狭窄毒性预测器的先前方法不同,MolSafeEval将异质安全知识——从毒理学数据库到危害规则——整合到一个结构化的分子安全知识图谱中。该图谱作为基于大语言模型推理的基础,能够系统性地检测和解释生成化合物中的不安全特征。我们进一步将分子生成模型分为四种代表性任务类型——无条件生成、性质优化、基于靶蛋白的设计和基于文本的生成——并为每种类型提供标准化的数据集和安全评估协议。通过系统揭示当前生成方法的安全漏洞,MolSafeEval为分子模型的基准测试提供了新的视角,并朝着更安全、更可信的分子设计提供了重要指导。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:38

# 用于揭示AI生成分子安全风险的基准测试  
来源:https://arxiv.org/html/2607.00464  
Tong Xu¹,², Xinzhe Cao³, Zhihui Zhu², Keyan Ding¹,², Huajun Chen¹,²\*  
¹浙江大学  
²浙大-杭州全球科技创新中心  
³牛津大学  
\{xtong, dingkeyan, huajunsir\}@zju.edu.cn  

###### 摘要  
当前分子生成基准侧重于任务复杂度、分子新颖性和属性对齐,却严重忽视了一个关键问题:AI生成分子可能存在的安全风险。实践中,许多生成模型可能产生具有毒性、反应性或其他危险特性的分子,这些隐藏风险尚未得到充分解决。为填补这一空白,我们提出了MolSafeEval,一个专门用于评估和分析分子生成安全风险的基准。不同于依赖狭隘毒性预测器的先前方法,MolSafeEval将异构安全知识(从毒理学数据库到危险规则)整合到结构化的分子安全知识图谱中。该图谱作为大语言模型推理的基础,能够系统检测并解释生成化合物中的不安全特征。我们进一步将分子生成模型划分为四种代表性任务类型——无条件生成、属性优化、基于靶标蛋白的设计和基于文本的生成——并为每种类型提供标准化数据集和安全评估协议。通过系统揭示当前生成方法的安全脆弱性,MolSafeEval为分子模型基准测试提供了新视角,并为更安全、更可信的分子设计提供了必要指导。  

MolSafeEval: 用于揭示AI生成分子安全风险的基准测试  
Tong Xu¹,², Xinzhe Cao³, Zhihui Zhu², Keyan Ding¹,², Huajun Chen¹,²\*  
¹浙江大学  
²浙大-杭州全球科技创新中心  
³牛津大学  
\{xtong, dingkeyan, huajunsir\}@zju.edu.cn  

††footnotetext:\*通讯作者。  

## 1 引言  
设计具有所需属性的新分子是药物发现和材料科学中的核心挑战 Wang 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib22)。化学化合物空间估计包含 10²³ 到 10⁸⁰ 个可能分子,范围之广使得手动探索不可行且资源密集 Reymond (2015) (https://arxiv.org/html/2607.00464#bib.bib23)。为应对这一挑战,深度生成模型越来越多地用于分子设计,加速了探索并取得了有希望的结果 Pei 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib2); Xu 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib8); Fang 等人 (2024) (https://arxiv.org/html/2607.00464#bib.bib10)。分子生成模型的多样性(源于不同任务和数据集)给公平性能比较带来了挑战。为此,已有多个基准被开发出来。例如,Mol-Opt Gao 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib14) 标准化了分子优化的评估,而 TARTARUS Nigam 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib16) 则解决了复杂的现实世界设计问题。尽管取得了这些进展,一个关键缺口仍然存在:生成分子的安全性很少被评估。实践中,模型可能提出有毒、有反应性或其他危险的化合物。虽然先前研究已对AI驱动药物发现中的双重用途风险提出担忧 Urbina 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib24),但仍缺乏系统评估分子安全的基准。这一缺口阻碍了生成模型从概念验证研究向安全可信部署的过渡。  

请参阅图注  
图 1: MolSafeEval 支持 (a) 无条件生成、(b) 基于属性优化的生成、(c) 基于靶标蛋白的生成和 (d) 基于文本描述的生成的安全评估。每个任务都可能生成存在安全问题的分子,如 (e) 所示,包括药物毒性和危害。图片经许可使用 BioRender.com 创建。

为解决这一问题,我们提出了 MolSafeEval,一个用于系统揭示 AI 生成分子安全风险的基准。分子安全评估的一个关键难点在于风险具有异构性——从药物毒性到化学危害——且分散在毒理学数据集、监管标准和化学危害报告中。简单的基于预测器的过滤器无法捕捉这种多样性。为统一这些分散来源,MolSafeEval 构建了 MolSafeKG,一个结构化的分子安全知识图谱 (KG),整合了超过 80,000 种有害化合物及其相关的毒理学和危害注释。通过将此资源与大语言模型 (LLM) 推理相结合,我们既能检测不安全的结构特征,又能提供可解释的安全证据综合。MolSafeEval 评估了四种代表性任务的分子生成模型,即无条件生成 Liu 等人 (2018) (https://arxiv.org/html/2607.00464#bib.bib26)、属性优化 Gao 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib14)、基于靶标蛋白的设计 Ragoza 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib25) 和基于文本的生成 Edwards 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib1),如图 1 所示。对于每个任务,我们提供标准化数据集以确保一致性。每个生成分子通过多步流程进行分析:结构解析、基于相似性从 MolSafeKG 检索、以及 LLM 驱动的推理来预测和解释潜在风险 Wang 等人 (2025) (https://arxiv.org/html/2607.00464#bib.bib21)。本文做出以下贡献:  

- •我们构建了 MolSafeKG,一个全面的分子安全知识图谱,整合了多种化学危害和毒理学数据,为安全评估提供了可重用资源。
- •我们引入了 MolSafeEval,一个评估分子生成模型安全性的基准,支持系统比较并为安全控制机制的设计提供信息。
- •我们在 11 个分子安全预测任务上评估了我们的框架,取得了高预测精度。其可靠性通过稳定性测试、系统偏差分析以及与现有网络服务器和工具的比较得到进一步验证。利用 MolSafeEval,我们还对四类中 28 个最先进的分子生成模型进行了大规模安全评估。通过分析生成分子的安全概况并识别高风险示例,我们的研究揭示了现有模型中存在的大量隐藏危害。这些发现为分子生成模型的治理以及 AI 在分子发现中的负责任部署提供了关键见解。

## 2 相关工作  
### 2.1 分子生成模型  
生成模型已成为设计新分子的强大工具。分子生成模型可根据任务性质分类,包括生成与特定蛋白结合的分子 Zhang 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib4); Huang 等人 (2024a) (https://arxiv.org/html/2607.00464#bib.bib5); Lin 等人 (2024a) (https://arxiv.org/html/2607.00464#bib.bib6)、匹配给定文本描述 Edwards 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib1); Pei 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib2); Gong 等人 (2024) (https://arxiv.org/html/2607.00464#bib.bib3)、针对特定属性优化分子 Fu 等人 (2021b) (https://arxiv.org/html/2607.00464#bib.bib11); Fang 等人 (2024) (https://arxiv.org/html/2607.00464#bib.bib10)、或从分子数据集中无条件下生成新分子 Peng 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib9); Xu 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib7), 2023 (https://arxiv.org/html/2607.00464#bib.bib8)。这些模型常利用多样化数据集,但生成分子的安全性往往被忽视。MolSafeEval 通过标准化这些类别中的任务和数据集来解决这一缺口,促进了对这些分子生成模型安全性能的公平可靠评估。

### 2.2 分子生成基准  
为了便于分子生成模型之间的比较,研究者从不同角度提出了各种基准。MOSES Polykovskiy 等人 (2020) (https://arxiv.org/html/2607.00464#bib.bib12) 是早期标准化无条件分子生成训练和评估的工作。Mol-Opt Gao 等人 (2022) (https://arxiv.org/html/2607.00464#bib.bib14) 和 CBGBench Lin 等人 (2024b) (https://arxiv.org/html/2607.00464#bib.bib13) 涵盖了更广泛的任务类型,而 TARTARUS Nigam 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib16) 和 Lo-Hi Steshin (2023) (https://arxiv.org/html/2607.00464#bib.bib15) 则关注更复杂的分子设计问题。在此基础上,MolSafeEval 引入了互补视角,专注于深度生成模型生成分子的安全性——这是现有基准中关注有限的一个方面。它是最早系统评估分子生成模型安全性的工作之一。

请参阅图注  
图 2: MolSafeEval 概览。(a) 分子安全知识图谱包含三类主要知识:分子、分子结构和安全知识。(b) 新生成分子首先进行结构分析。根据需求,从分子安全知识图谱中检索一组结构相似的分子。(c) 利用大语言模型综合检索到的安全知识和输入分子,从而推断新生成分子的潜在安全风险。

### 2.3 知识图谱检索增强生成  
尽管大语言模型在自然语言处理任务中取得了显著成功 Chiang 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib18); Touvron 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib19),其固有的知识局限性和易产生幻觉的问题严重限制了其适用性 Xu 等人 (2024) (https://arxiv.org/html/2607.00464#bib.bib20)。为应对这些挑战,研究者采用了检索增强生成,通过索引外部知识库来增强大语言模型 Lewis 等人 (2020) (https://arxiv.org/html/2607.00464#bib.bib17)。在此基础上,知识图谱检索增强生成将结构化知识图谱整合到检索过程中,利用实体关系提供更丰富的上下文并改善对复杂查询的理解 Wang 等人 (2025) (https://arxiv.org/html/2607.00464#bib.bib21)。受此方法启发,MolSafeEval 结合了分子安全知识图谱中嵌入的广泛知识与大语言模型的推理能力,以实现对生成分子的可靠安全评估。

## 3 方法  
本节提出一种方法,结合 MolSafeKG 中的结构化安全知识与大语言模型的推理能力,进行分子安全评估。如图 2 所示,我们的方法包含三个核心组成部分:(1) 分子安全知识图谱的构建;(2) 检索增强机制,将新生成分子与已知有害类似物关联;(3) 基于 LLM 的推理流程,综合检索到的安全证据以预测潜在风险。

### 3.1 MolSafeKG 的构建  
我们构建了一个结构化的分子安全知识图谱,作为安全评估的基础知识库。如图 2a 所示,该知识图谱整合了三类主要信息:分子实体、结构特征和安全注释。关键统计信息总结于表 1。分子实体集合包含来自权威来源的 83,925 个独特化合物。其中包括欧洲化学品管理局 (ECHA) 根据 GHS 分类识别为危险的 42,275 个化合物,以及来自已建立毒性预测数据集 Bai 等人 (2025) (https://arxiv.org/html/2607.00464#bib.bib72) 中与药物不良反应相关的分子。为支持结构推理和相似性匹配,我们编码了丰富的化学子结构信息,包括元素周期表中的 117 种化学元素、分为 13 类的 149 个官能团 Fang 等人 (2023) (https://arxiv.org/html/2607.00464#bib.bib27),以及从 ChEMBL 数据库提取的 434 个结构警报 Gaulton 等人 (2011) (https://arxiv.org/html/2607.00464#bib.bib73)。对于安全评估,我们采用了双视角框架,涵盖化学危害和药物毒性。具体来说,我们纳入了 68 条 GHS 危险声明,涵盖三大类(物理、健康和环境风险)以及药物开发中常评估的八个关键毒性终点。知识图谱中的每个分子都标注了相应的安全标签,从而创建了全面的风险评估参考。

表 1:分子安全知识图谱统计信息。

### 3.2 有害类似物的知识图谱检索  
对于新生成的分子,我们采用检索机制从 MolSafeKG 中识别结构相关的有害类似物。在图 2b 中,该流程始于分子特征提取和使用 RDKit Landrum (2013) (https://arxiv.org/html/2607.00464#bib.bib38) 进行结构解析。根据感兴趣的维度(毒性或危害),我们随后使用 Tanimoto 系数作为相似度度量,从 MolSafeKG 中检索前 n 个最相似的分子。此检索步骤为后续分析提供了最相关的安全信息。检索到的化合物及其安全注释作为上下文证据,指导下游的基于 LLM 的风险评估。

### 3.3 基于 LLM 的安全风险评分  
利用检索到的证据,我们实现了一个基于 LLM 的推理流程,综合信息并预测输入分子的安全风险。如图 2c 所示,该流程结合了生成分子的结构表示与检索到的类似物的安全知识。LLM 被提示分析输入分子与已知有害化合物之间的关系,分析共享的结构特征及其相关的安全含义。此过程生成全面的安全评估,不仅能识别潜在风险,还能为预测提供文本解释。有关 LLM 推理过程的示例,请参见附录 B。为了在不同设置之间进行定量比较,我们将 LLM 生成的安全评估转换为两个维度的数值评分:毒性和化学危害。

**毒性评估。** 我们计算毒性评分,即预测具有一种或多种毒性属性的生成分子比例。这给出了群体水平的安全风险度量。

**危害评估。** 对于化学危害,我们将 68 个 GHS 标签映射到五个严重程度级别(1 = 最低风险,5 = 最高风险)。对于与多个危

相似文章

“安全AI”是什么样的?[D]

Reddit r/MachineLearning

作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。

AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现

arXiv cs.AI

AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。

当无基准存在时:验证无真实标签的LLM安全评分比较

Hugging Face Daily Papers

本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。