@rasyn_lab:今天,我们推出了Synthon 350M,我们的单步逆合成模型。Synthon 是目前公开报告中最强的……
摘要
Synthon 350M,一款单步逆合成模型,由rasyn_lab推出,在USPTO-50K基准测试中实现了最先进的性能,单次设置下的top-1准确率为66.23%。
查看缓存全文
缓存时间: 2026/08/24 20:03
今天,我们正式发布 Synthon 350M——一款单步逆合成预测模型。
在单次查询设定下,Synthon 是目前公开报道中该任务最强的模型。化学家通过组合简单分子来构建目标分子。逆合成正是这一过程的逆向推演:从目标分子出发,推算出需要组合哪些物质才能合成它。合成路径规划就是反复回答这个问题,逐步推导,直到剩余物质均为可采购的原料——而任何一步出错都会导致整个方案失效。Synthon 以排序列表形式呈现答案:三分之二的情况下,正确答案位列其首位推荐;九成情况下能进入前五名候选。
其工作机制如下:模型将产物分子读取为根节点对齐的SMILES字符串,从而能够从二十个不同起始原子角度分析同一分子,生成二十组独立的候选反应物集合。这些集合通过对数求和指数运算进行跨根节点池化——这意味着在多个视角下重复出现的反应物组合,其排名将高于仅在单一视角中被高度确信的组合。
我们在USPTO-50K基准数据集上对Synthon进行了评测。该数据集包含五万条来自美国专利文件的真实化学反应,其中五千零七条被保留用于测试,是逆合成模型领域公认的标准基准。以下数据可与已发表研究直接对比:
在隐藏反应类别信息的情况下,Synthon的Top-1准确率达到66.23%,Top-5准确率达91.41%。若提供反应类别信息,Top-1准确率可提升至74.12%。在无任何测试时增强处理的单次查询设定下,其Top-1准确率为62.67%。
Synthon现已在Marigold平台开放体验。本帖后续将附上该基准上所有已发布模型的完整对比数据。
我们的目标是实现化学自动化——这个支撑着医药、农业、电池、材料及大部分制造业的基础领域。当前整个领域仍受限于人工规划、执行和解读实验的速度,而规划正是首要环节。
对化学家而言,规划意味着探索目标分子的构建路径。在解决这个问题之前,后续所有工作都无法启动。你可以预测某个化合物能与靶点结合、具有良好溶解性且无毒,但除非有人在实验室中真正合成出来,否则一切都无意义。每种药物、每种农药、每种聚合物、每种电池电解质都需要有人首先找到合成路径——而对于复杂分子,这个探索过程往往需要耗费数周时间,且经常走入死胡同。
因此我们首先攻克这一环节。Synthon是我们实现该目标的首个落地模型,后续还将推出更多工具。
操作方式简单直观:输入目标分子,即返回按优先级排序的候选反应物组合列表。
提供两种运行模式:对分子进行单遍扫描约需0.4秒,Top-1准确率为62.67%;二十遍扫描并池化处理需4-6秒,Top-1准确率达66.23%——计算量增加十倍换来3.5个百分点的提升。这种权衡在单分子深度分析时颇具价值,但对于库筛场景可能并非最优选择。
若已知目标反应类型,可在输入分子时同时提供反应类别信息,此时Top-1准确率可提升至74.12%。
Synthon现已登陆Marigold平台。
http://app.rasyn.ai
相似文章
训练化学合理性感知的大语言模型以实现单步逆合成
本文介绍了一种增强的C3LM模型,用于单步逆合成,采用Top-K提示和更大的训练数据集,在URSA-expert-2026基准测试中展现出与传统模型相竞争的性能。
ConRetroBert: 基于模板的单步逆合成的EMA稳定双编码器
本文提出ConRetroBert,一种用于基于模板的单步逆合成的双编码器框架,使用对比预训练和列表排序来提高模板预测准确性,在USPTO-50k基准上达到最高75.4%的top-1准确率,同时保持可解释性。
长时程终端任务的递归合成
本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。
@rasyn_lab: 今天,我们推出 Analyst Agent,一个从原始仪器文件进行分析化学的 AI。你给它 t…
Analyst Agent 是一个 AI 系统,用于处理分析化学中的原始仪器文件,以通俗语言回答问题并提供证据,并且在不同基础模型上的盲测基准中表现最佳。
GPT-Rosalind 新增功能发布
OpenAI 推出了专为生命科学研究设计的更新版 GPT-Rosalind 模型,在药物化学、基因组学和药物发现流程方面性能提升,并引入了 LifeSciBench 和 MedChemBench 等新基准。