基于大规模自回归预训练的可控催化剂逆向设计

arXiv cs.LG 论文

摘要

本文提出了一种基于GPT架构的条件催化剂生成模型,在1.33亿个催化剂结构上进行了预训练,实现了98%的结构有效性,并能针对结合能等目标属性进行可控逆向设计。

arXiv:2606.17445v1 公告类型:新 摘要:异相催化剂的逆向设计仍然具有挑战性,因为催化剂表面表现出显著的结构复杂性,并伴随着表面-吸附物耦合相互作用,跨越了广阔的化学空间,仅通过传统筛选难以高效探索。尽管基于机器学习的高通量筛选加速了催化剂发现,但其效率随着搜索空间的增长而不可避免地下降,这促使人们开发能够直接构建具有目标属性的催化剂的生成模型。在这里,我们提出了一种基于生成式预训练变换器(GPT)架构的条件催化剂生成模型,该模型具有数值嵌入层,能够在单个自回归框架内生成同时受类别属性和连续属性条件约束的催化剂结构。该模型在1.33亿个催化剂结构上进行了预训练,随后在大约46万个优化结构上进行了微调,这些结构附带了类别属性和结合能,以进行条件生成。最终模型实现了98%的结构有效性、95%的优化有效性以及高类别条件保真度,吸附物类型和组成的联合匹配率达到93%。对于结合能条件,约20%的匹配率相比基线训练分布提高了四倍,生成的分布系统性地向目标值偏移,使得在无需额外微调的情况下,针对反应目标的催化剂发现筛选效率提升了1.5到4倍。这些结果表明,大规模自回归预训练结合显式属性条件设置为可控催化剂生成和加速催化剂发现提供了一条实用途径。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:38

#  基于大规模自回归预训练实现可控催化剂逆向设计
来源:https://arxiv.org/abs/2606.17445
查看PDF (https://arxiv.org/pdf/2606.17445)

> **摘要:**异相催化剂的逆向设计仍面临挑战,因为催化剂表面表现出显著的结构复杂性,表面-吸附物相互作用耦合,覆盖了广阔的化学空间,仅通过传统筛选手段难以高效探索。尽管基于机器学习的高通量筛选加速了催化剂发现,但随着搜索空间增大,其效率不可避免下降,这促使人们开发能够直接构建具有目标性质的催化剂结构的生成式模型。本文提出了一种基于生成式预训练变换器架构的条件催化剂生成模型,该模型采用数值嵌入层,能够在单一自回归框架内生成受类别和连续性质约束的催化剂结构。该模型在1.33亿个催化剂结构上进行了预训练,随后在大约46万个经过优化的结构上进行了微调,这些结构附带相关的类别属性和结合能,用于条件生成。所得模型实现了98%的结构有效性、95%的优化有效性,以及高类别条件保真度,其中吸附物类型和成分的联合匹配率达到93%。在结合能条件约束下,约20%的匹配率相比基线训练分布提升了四倍,且生成分布系统地朝着目标值偏移,使得在无需额外微调的情况下,面向反应目标的催化剂发现筛选效率提升了1.5至4倍。这些结果表明,大规模自回归预训练结合显式属性条件化,为实现可控催化剂生成和加速催化剂发现提供了可行途径。

## 提交历史

来自:Dong Hyeon Mok [查看邮件 (https://arxiv.org/show-email/448ad91f/2606.17445)] **[v1]**  
2026年6月16日 星期二 03:00:52 UTC (1,782 KB)

相似文章

通过预测梯度催化剂加速多目标贝叶斯优化

arXiv cs.LG

本文介绍了一种通用加速机制,用于多目标贝叶斯优化,该机制利用高斯过程预测梯度作为辅助信号来增强现有的采集函数,从而在有限的评估预算下更快地收敛到全局帕累托集。

MiniGPT: 从第一性原理重建GPT

arXiv cs.CL

本文介绍了MiniGPT,这是一个基于PyTorch从头实现的紧凑型GPT风格自回归语言模型,其构建参考了nanoGPT的研究。该模型在Tiny Shakespeare数据集上使用字符级分词进行评估,在10.77M参数配置下达到了1.4780的验证损失。

用于生成式机构综合的离散自回归Transformer

arXiv cs.LG

本文提出了一种离散自回归Transformer,能够从目标连杆曲线生成平面机构,利用变分自编码器潜变量和标记化的关节坐标,在多种拓扑结构上实现多样且精确的设计。

物理约束MCMC与化学信息高斯过程协同用于反应网络发现

arXiv cs.LG

本文提出了PC-MCMC-CIGP,这是一种灰盒工作流,结合了spike-and-slab拓扑采样、物理约束和化学信息高斯过程用于反应网络发现。该方法在苯乙烯环氧化反应中提高了产率,并在氢-溴基准测试中区分了基本反应路径与欺骗性拟合。