领域自适应分子语言模型用于高效搜索定制化库
摘要
本文对预训练分子语言模型在虚拟筛选中的应用进行了基准测试,并证明显式领域适应能提升其在药物发现、材料和催化库中的性能和样本效率。
arXiv:2608.17567v1 公告类型:新
摘要:预训练分子语言模型正越来越多地被用作分子编码器,以学习结构-性质关系。然而,它们在预训练领域内外用于分子发现的实际适用性仍不明确。本文中,我们系统地对四个分子语言模型在涵盖药物发现、有机材料和催化的六个虚拟分子库上进行了基准测试。原生分子语言模型嵌入在发现性能上显示出显著的库间差异,而分子指纹则提供了一致且稳健的基线。与潜在的领域表示不匹配一致,我们证明了显式领域适应能显著提升表示性能。在目标虚拟库的结构上微调分子语言模型编码器,一致地提高了样本效率,有几个适应后的编码器在基准任务中表现出顶级的表示效果。这些结果表明,分子表示质量强烈依赖于目标领域,显式适应能提升分子基础模型的实用性。更广泛地说,我们的研究确立了领域自适应分子表示作为虚拟筛选和自动驾驶实验室中样本高效自适应决策的有前景的策略。
查看缓存全文
缓存时间: 2026/08/19 10:29
# 领域自适应分子语言模型:高效搜索按需合成分子库 来源:https://arxiv.org/abs/2608.17567 查看PDF (https://arxiv.org/pdf/2608.17567) > 摘要:预训练分子语言模型越来越多地被用作分子编码器,以学习结构-性质关系。然而,它们在预训练领域内外用于分子发现的实际适用性仍不明确。本文系统评估了四个分子语言模型在六个涵盖药物发现、有机材料和催化领域的虚拟分子库上的性能。原生分子语言模型嵌入表征在不同分子库上的发现性能差异显著,而分子指纹则提供了一致且稳健的基线性能。与潜在的领域-表征不匹配一致,我们证明了显式的领域自适应能显著提升表征性能。在目标虚拟库的分子结构上微调分子语言模型编码器,能持续提高样本效率,其中多个经过适应的编码器成为跨基准任务的最优表征。这些结果表明,分子表征质量强烈依赖于目标领域,显式自适应可以提升分子基础模型的实际效用。更广泛地说,我们的研究确立了领域自适应分子表征作为虚拟筛选和自动化实验室中样本高效自适应决策的一种有前景的策略。 ## 提交历史 来自:Felix Strieth-Kalthoff [查看电子邮件 (https://arxiv.org/show-email/45f349fc/2608.17567)] **[v1]** 2026年8月18日 星期二 09:27:56 UTC (15,438 KB)
相似文章
语言模型会梦见结合分子吗?在空间约束下对LLMs进行基准测试
本文在3D空间约束下,将通用LLMs与专门的扩散模型进行对比基准测试,以生成结合分子。结果显示,尽管LLMs目前落后于最先进的方法,但它们展现出了潜力。
通过目标感知源选择重新思考分子OOD泛化
本文介绍了SCOPE-Bench,一个评估分子分布外泛化的基准测试,以及POMA,一个使用强化学习选择源域进行域自适应的框架,在3D分子模型上实现了显著的误差降低。
Large Discovery Models: 基于实证的模型驱动开放式搜索
本文介绍了 Large Discovery Model (LDM),这是一种循环架构,将生成模型与贝叶斯非参数替代模型耦合,以指导在分子和蛋白质等科学领域的不确定性感知搜索,相比现有方法实现了显著的性能提升。
MolEmb:多模态大型语言模型可以成为强大的分子嵌入模型
本文介绍了MolEmb,这是一个轻量级框架,它调整多模态大型语言模型以实现通用的分子嵌入,支持上下文感知的表示和跨模态检索,同时还提出了一个诊断基准MolCAR。
通过口袋条件扩散和属性感知优化生成可开发的3D分子
本文介绍了一种新颖的基于扩散的生成模型,用于基于结构的药物设计。该模型解耦了口袋和配体的表示学习,并融入了多尺度相互作用信号和属性感知优化,以生成具有更强结合亲和力和更优ADMET属性的可开发3D分子。