面向化学语言模型的不确定性感知强化学习

arXiv cs.LG 论文

摘要

提出了两种互补方法,将预测不确定性融入化学语言模型的强化学习中,提高了鲁棒性,并在从头分子设计中将真实命中率提升了0.25。

arXiv:2606.24990v1 公告类型:新 摘要:强化学习已成为从头分子设计的一个强大范式,使化学语言模型能够导航和探索化学空间,同时优化特定的期望属性。然而,现有的强化学习框架将所有评分函数视为确定性预言机,忽略了不同分子属性预测所固有的不确定性。这可能导致探索化学空间中高度不确定的区域,集中于生成得分高但训练数据支持不足的分子。这会破坏优化过程的稳定性,产生偏离真实值的预测。 我们提出并比较了两种互补方式,将预测不确定性融入强化学习。第一种方式将不确定性视为额外的优化目标,与其余评分函数结合,使策略能够在利用与可靠性之间进行权衡。第二种方式则利用不确定性来调节策略更新,减少其属性远超出评分函数置信域的分子的影响。 两种方法均在三种不同设置下进行了评估:(i) 一个受控模型系统,其中预测误差建模为高斯分布,方差与到训练数据的距离成正比;以及两个实际任务,分别使用 (ii) ChemProp 模型和 (iii) 应用于随机森林分类器的共形预测包装器。 我们表明,不确定性感知强化学习通过偏好低不确定性区域,使化学语言模型能够更鲁棒地探索化学空间。这在不牺牲分子得分的情况下实现了更可靠的命中发现,将真实命中率提高了0.25(从0.5到0.75),并将总真实命中数几乎翻倍。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:09

# 不确定性感知的强化学习用于化学语言模型
来源:https://arxiv.org/abs/2606.24990
查看 PDF(https://arxiv.org/pdf/2606.24990)

> **摘要:**强化学习(RL)已成为从头分子设计的一种强大范式,使得化学语言模型(CLMs)能够在探索化学空间的同时优化特定所需性质。然而,现有的RL框架将所有评分函数视为确定性预言机,忽略了不同分子性质预测中固有的不确定性。这可能导致对化学空间中高度不确定区域的探索,从而集中于生成得分较高但训练数据支撑不足的分子。这会破坏优化过程的稳定性,产生偏离真实值的预测。我们提出并比较了两种将预测不确定性纳入RL的互补方法。在第一种方法中,不确定性被视为一个额外的优化目标,与其余评分函数一起纳入,使策略能够在利用与可靠性之间进行权衡。其次,利用不确定性来调节策略更新,降低那些性质远超出评分函数置信域的分子对策略更新的影响。两种方法在三个不同场景中进行了评估:(i)一个受控模型系统,其中预测误差被建模为高斯分布,方差与到训练数据的距离成正比;以及两个实际任务,分别使用(ii)ChemProp模型和(iii)应用于随机森林分类器的共形预测包装器。我们表明,不确定性感知的RL通过偏向低不确定性区域,使CLMs能够更鲁棒地探索化学空间。这在不牺牲分子评分的前提下,实现了更可靠的先导发现,将真实命中率提高了0.25(从0.5提升至0.75),并将真实命中总数几乎翻倍。

## 提交历史

来自:Borja Medina \[发送邮件(https://arxiv.org/show-email/a4d954a7/2606.24990)\] **\[v1\]** 2026年6月23日 星期二 14:42:46 UTC(32,710 KB)

相似文章

利用基于图的工具改进小型语言模型中的分子性质预测

arXiv cs.AI

本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。

基于大语言模型的运筹学不确定性感知仿真推断

arXiv cs.LG

本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。

面向小规模语言模型智能体的稳健强化学习

arXiv cs.AI

本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。