训练化学合理性感知的大语言模型以实现单步逆合成

Hugging Face Daily Papers 论文

摘要

本文介绍了一种增强的C3LM模型,用于单步逆合成,采用Top-K提示和更大的训练数据集,在URSA-expert-2026基准测试中展现出与传统模型相竞争的性能。

单步逆合成是计算机辅助合成规划的核心组成部分,但其固有的多对一性质在单答案评估和基准测试协议中未被充分体现。为解决此问题,我们引入Top-K提示作为一种稳健的训练和推理范式,以更好地捕获多样且合理的反应预测。我们编译了CREED-CCV-2+USPTO-XL,一个包含约4560万已验证反应的超大规模数据集,用于训练C3LM(化学约束一致性语言模型)。通过整合基于ChemCensor和新颖性导向奖励的微调,我们的模型在OOD URSA-expert-2026基准测试上取得了最先进的性能。对反应独特性的进一步分析显示,大语言模型和传统模型探索的是互补的反应空间,这激发了基于集成的逆合成系统。总体而言,我们的结果确立了Top-K、合理性感知训练作为未来鲁棒的大语言模型合成规划的一个实用新方向。
查看原文
查看缓存全文

缓存时间: 2026/08/20 04:02

论文页面 - 训练具有化学合理性感知的单步逆合成大语言模型

来源:https://huggingface.co/papers/2608.18940

本研究扩展了先前提出的用于单步逆合成的ChemCensor框架(https://arxiv.org/abs/2602.03554)。该研究针对逆合成预测的一对多特性,即目标分子可能对应多种化学上有效的合成路径,使得单一答案和精确匹配评估方式显得不足。研究引入了Top‐K提示和训练方法,以生成多个多样化的反应提案,而非单一预测断开点。

新版本C3LM模型在CREED-CCV-2+USPTO-XL数据集上进行训练,该扩展数据集包含约4560万个经专家编码模板验证的反应。结合Top‐K策略,更大的训练集使C3LM模型能够在URSA-expert-2026基准测试中与强传统非大语言模型逆合成模型相抗衡——在某些场景下甚至超越后者。

此外,研究表明由新C3LM模型与最佳传统模型生成的反应化学空间是互补而非相交的,这使得如果将新模型整合进合成规划引擎,其贡献将更为显著。

相似文章