@rasyn_lab:今天,我们推出了Synthon 350M,我们的单步逆合成模型。Synthon 是目前公开报告中最强的……

X AI KOLs Timeline 模型

摘要

Synthon 350M,一款单步逆合成模型,由rasyn_lab推出,在USPTO-50K基准测试中实现了最先进的性能,单次设置下的top-1准确率为66.23%。

今天,我们推出了Synthon 350M,我们的单步逆合成模型。 Synthon 是这项任务中公开报告的最强模型,当每个模型只有一次机会给出答案时。化学家通过结合更简单的分子来制造分子。逆合成是相反的过程:从你想要的分子开始,推算出需要结合什么来得到它。合成计划就是这个问题反复提出,一次一步,直到剩下的所有东西都是你可以订购的,而一步出错就会浪费整个计划。Synthon 用一个排序列表来回答这个问题,正确答案有三分之二的时间是它的第一个建议,有十分之九的时间在它的前五个建议中。 它通过将产物读取为根对齐的SMILES字符串来工作,这使它能够从二十个不同的起始原子来处理同一个分子,并产生二十组独立的候选反应物。这些集合通过跨根的log-sum-exp进行池化,因此一个在多个视图中重复出现的反应物集合会排名高于一个仅在单个视图中被确信的集合。 我们在USPTO-50K上对Synthon进行了基准测试。它是从美国专利文件中精选的五万个真实反应,其中5,007个被保留用于测试,它是每个逆合成模型都报告的标准基准测试,因此下面的数字可以直接与已发表的工作进行比较。 在不提供反应类别的情况下,Synthon的top-1准确率为66.23%,top-5准确率为91.41%。在提供类别的情况下,top-1上升到74.12%。在单次设置下,没有任何测试时增强,它达到62.67%。 Synthon 现在可在 Marigold 上供您尝试。与该基准上每个已发表模型的完整比较在主题帖中。
查看原文
查看缓存全文

缓存时间: 2026/08/24 20:03

今天,我们正式发布 Synthon 350M——一款单步逆合成预测模型。

在单次查询设定下,Synthon 是目前公开报道中该任务最强的模型。化学家通过组合简单分子来构建目标分子。逆合成正是这一过程的逆向推演:从目标分子出发,推算出需要组合哪些物质才能合成它。合成路径规划就是反复回答这个问题,逐步推导,直到剩余物质均为可采购的原料——而任何一步出错都会导致整个方案失效。Synthon 以排序列表形式呈现答案:三分之二的情况下,正确答案位列其首位推荐;九成情况下能进入前五名候选。

其工作机制如下:模型将产物分子读取为根节点对齐的SMILES字符串,从而能够从二十个不同起始原子角度分析同一分子,生成二十组独立的候选反应物集合。这些集合通过对数求和指数运算进行跨根节点池化——这意味着在多个视角下重复出现的反应物组合,其排名将高于仅在单一视角中被高度确信的组合。

我们在USPTO-50K基准数据集上对Synthon进行了评测。该数据集包含五万条来自美国专利文件的真实化学反应,其中五千零七条被保留用于测试,是逆合成模型领域公认的标准基准。以下数据可与已发表研究直接对比:

在隐藏反应类别信息的情况下,Synthon的Top-1准确率达到66.23%,Top-5准确率达91.41%。若提供反应类别信息,Top-1准确率可提升至74.12%。在无任何测试时增强处理的单次查询设定下,其Top-1准确率为62.67%。

Synthon现已在Marigold平台开放体验。本帖后续将附上该基准上所有已发布模型的完整对比数据。

我们的目标是实现化学自动化——这个支撑着医药、农业、电池、材料及大部分制造业的基础领域。当前整个领域仍受限于人工规划、执行和解读实验的速度,而规划正是首要环节。

对化学家而言,规划意味着探索目标分子的构建路径。在解决这个问题之前,后续所有工作都无法启动。你可以预测某个化合物能与靶点结合、具有良好溶解性且无毒,但除非有人在实验室中真正合成出来,否则一切都无意义。每种药物、每种农药、每种聚合物、每种电池电解质都需要有人首先找到合成路径——而对于复杂分子,这个探索过程往往需要耗费数周时间,且经常走入死胡同。

因此我们首先攻克这一环节。Synthon是我们实现该目标的首个落地模型,后续还将推出更多工具。

操作方式简单直观:输入目标分子,即返回按优先级排序的候选反应物组合列表。

提供两种运行模式:对分子进行单遍扫描约需0.4秒,Top-1准确率为62.67%;二十遍扫描并池化处理需4-6秒,Top-1准确率达66.23%——计算量增加十倍换来3.5个百分点的提升。这种权衡在单分子深度分析时颇具价值,但对于库筛场景可能并非最优选择。

若已知目标反应类型,可在输入分子时同时提供反应类别信息,此时Top-1准确率可提升至74.12%。

Synthon现已登陆Marigold平台。

http://app.rasyn.ai

相似文章

长时程终端任务的递归合成

Hugging Face Daily Papers

本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。

GPT-Rosalind 新增功能发布

OpenAI Blog

OpenAI 推出了专为生命科学研究设计的更新版 GPT-Rosalind 模型,在药物化学、基因组学和药物发现流程方面性能提升,并引入了 LifeSciBench 和 MedChemBench 等新基准。