面向化学语言模型的不确定性感知强化学习
摘要
提出了两种互补方法,将预测不确定性融入化学语言模型的强化学习中,提高了鲁棒性,并在从头分子设计中将真实命中率提升了0.25。
查看缓存全文
缓存时间: 2026/06/25 05:09
# 不确定性感知的强化学习用于化学语言模型 来源:https://arxiv.org/abs/2606.24990 查看 PDF(https://arxiv.org/pdf/2606.24990) > **摘要:**强化学习(RL)已成为从头分子设计的一种强大范式,使得化学语言模型(CLMs)能够在探索化学空间的同时优化特定所需性质。然而,现有的RL框架将所有评分函数视为确定性预言机,忽略了不同分子性质预测中固有的不确定性。这可能导致对化学空间中高度不确定区域的探索,从而集中于生成得分较高但训练数据支撑不足的分子。这会破坏优化过程的稳定性,产生偏离真实值的预测。我们提出并比较了两种将预测不确定性纳入RL的互补方法。在第一种方法中,不确定性被视为一个额外的优化目标,与其余评分函数一起纳入,使策略能够在利用与可靠性之间进行权衡。其次,利用不确定性来调节策略更新,降低那些性质远超出评分函数置信域的分子对策略更新的影响。两种方法在三个不同场景中进行了评估:(i)一个受控模型系统,其中预测误差被建模为高斯分布,方差与到训练数据的距离成正比;以及两个实际任务,分别使用(ii)ChemProp模型和(iii)应用于随机森林分类器的共形预测包装器。我们表明,不确定性感知的RL通过偏向低不确定性区域,使CLMs能够更鲁棒地探索化学空间。这在不牺牲分子评分的前提下,实现了更可靠的先导发现,将真实命中率提高了0.25(从0.5提升至0.75),并将真实命中总数几乎翻倍。 ## 提交历史 来自:Borja Medina \[发送邮件(https://arxiv.org/show-email/a4d954a7/2606.24990)\] **\[v1\]** 2026年6月23日 星期二 14:42:46 UTC(32,710 KB)
相似文章
基于元认知反馈的强化学习激发大语言模型中的忠实不确定性表达
本文介绍了基于元认知反馈的强化学习(RLMF)和元认知数据选择,以改进大语言模型的校准,实现内部不确定性的忠实表达,并比标准强化学习提升高达63%。
DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.
利用基于图的工具改进小型语言模型中的分子性质预测
本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。
基于大语言模型的运筹学不确定性感知仿真推断
本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。
面向小规模语言模型智能体的稳健强化学习
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。