S1-Omni:用于科学理解、预测和生成的统一多模态推理模型
摘要
S1-Omni是一个用于科学任务(包括理解、预测和生成)的统一多模态推理模型。它基于包含200个科学任务的语料库进行训练,在大多数基准测试上优于GPT-5.5和Gemini-3.1-Pro。
arXiv:2607.15686v1 公告类型:新
摘要:我们提出S1-Omni,一个用于科学理解、预测和生成的统一多模态推理模型。科学人工智能(AI4S)通过领域专用模型、工具增强的大语言模型和科学语言模型取得了显著进展。然而,模型能力仍然高度碎片化,限制了异构数据、科学定律和专家知识的联合建模。S1-Omni通过将这些能力整合到一个单一、连贯的科学推理模型中来解决这一差距。S1-Omni的架构建立在三个核心组件之上:科学数据的统一表示、自然世界知识对齐以及领域特定任务的解码。首先,S1-Omni将自然语言指令和科学对象(包括CIF、SMILES、蛋白质序列、光谱和科学图像)映射到一个共享表示空间。其次,它将科学定律和专家知识融入数据构建和训练中,使模型能够基于科学证据进行推理。第三,它执行任务特定的解码以支持广泛的应用,包括属性预测、光谱到分子生成、蛋白质位点和结构预测以及科学图像生成与编辑。S1-Omni在S1-Omni-Corpus上进行训练,该语料库涵盖200个科学任务并包含数百万个推理样本,并在60多个科学基准上进行评估。它在大多数基准测试上优于GPT-5.5和Gemini-3.1-Pro,并在多个基准测试上达到或超越领域专用模型。总体而言,S1-Omni为统一科学建模提供了一条实用路径。
查看缓存全文
缓存时间: 2026/07/20 09:22
# S1-Omni:用于科学理解、预测与生成的统一多模态推理模型
来源:https://arxiv.org/html/2607.15686
###### 摘要
我们提出 S1\-Omni,一个用于科学理解、预测与生成的统一多模态推理模型。AI for Science (AI4S) 已通过领域特定模型、工具增强的大语言模型 (LLM) 和科学语言模型取得了显著进展。然而,模型能力仍然高度碎片化,限制了异构数据、科学规律和专家知识的联合建模。S1\-Omni 通过将这些能力整合到一个单一的、连贯的科学推理模型中来解决这一短板。S1\-Omni 的架构建立在三个核心组件之上:科学数据的统一表示、自然世界知识对齐,以及针对特定领域任务的解码。首先,S1\-Omni 将自然语言指令和科学对象(包括 CIF、SMILES、蛋白质序列、光谱和科学图像)映射到共享表示空间。其次,它将科学规律和专家知识融入数据构建和训练中,使模型能够从科学证据进行推理。第三,它执行任务特定的解码,以支持广泛的应用,包括性质预测、光谱到分子生成、蛋白质位点和结构预测,以及科学图像生成与编辑。S1\-Omni 在 S1\-Omni\-Corpus 上训练,该语料覆盖 200 项科学任务,包含数百万条推理样本,并在超过 60 个科学基准上进行评估。它在大多数基准上优于 GPT\-5\.5 和 Gemini\-3\.1\-Pro,并在若干基准上达到或超越领域特定模型。总体而言,S1\-Omni 为统一科学建模提供了一条实用路径。
## 1 引言
近年来,AI for Science (AI4S) 沿着三个互补方向推进。第一个方向是领域特定模型,以 AlphaFold 3\(abramson2024alphafold3\) 和 ESM3\(hayes2025simulating\) 为代表,它们围绕特定科学实体(如蛋白质、分子和材料)开发出用于结构预测、性质预测或生成的高性能能力。第二个方向是工具增强的通用模型,以 GPT\-Rosalind\(openai2026rosalind\) 和 Claude Science\(anthropic2026claudescience\) 为代表,它们通过智能体、科学工具和自动化工作流扩展通用语言模型,以操作和执行科学任务。第三个方向是科学语言模型,以 NatureLM\(xia2025naturelm\)、LOGOS\(li2026speaking\) 和 BioMatrix\(pei2026biomatrix\) 为代表,它们将蛋白质、DNA 和分子等科学实体组织为联合建模的符号序列或表示空间,并探索跨科学对象的统一建模。这些进展共同推动了领域建模、科学工作流自动化以及科学对象的表示学习,为科学中的统一多模态推理提供了重要基础。
然而,现有的科学智能仍然在领域特定模型、工具增强大语言模型和科学语言模型之间保持碎片化。领域特定模型通常局限于特定的科学实体和任务类型。工具增强的大语言模型使用外部工具完成科学任务。科学语言模型试图将科学知识统一到一个共享嵌入空间中。但这些方法尚未将来自不同学科的科学原理和约束整合到一个统一模型中。因此,统一科学智能的关键不仅仅在于提供自然语言接口或将不同的科学对象转换为单一的令牌表示。它需要将异构科学数据组织到同一模型过程中,通过隐式表示将科学规律、专家启发式和领域任务约束注入任务理解和模型推理,并产生能够在相应科学原生形式中验证的输出。
本研究探讨如何将这些分布的能力整合到一个统一的多模态推理模型中,使得一个共享主干能够发展跨学科、跨模态和跨任务的科学理解与推理。为此,我们引入 S1\-Omni,一个用于科学理解、预测与生成的统一多模态推理模型。S1\-Omni 围绕三个核心能力构建。首先,**科学数据的统一表示**。该模型将自然语言指令和多样化的科学对象组织为统一的任务表示,涵盖文本、材料 CIF、化学 SMILES、蛋白质序列、光谱、科学图像和其他科学模态。同时,它保留了对象类型的边界、表示结构和必要的编码路径,而不是将统一建模等同于统一令牌化。其次,**自然世界知识对齐**。模型训练不仅仅依赖输入输出之间的统计关联,还将科学规律和专家知识与实验事实一起融入数据构建、样本验证和训练中,使模型能够从当前任务中的科学证据形成中间判断,从而提升科学推理和可解释性。第三,**面向特定领域任务的解码**。在共享任务理解和科学推理之上,模型根据任务目标连接适当的输出表示和解码器。它支持性质预测、光谱到分子生成、蛋白质结构生成,以及科学图像生成与编辑,使统一模型能够在每个领域的原生结果空间中产生输出。
S1\-Omni 的能力建立在 S1\-Omni\-Corpus 之上,该语料覆盖 200 项科学任务,包含数百万条高质量的科学推理样本。在数据集构建过程中,我们利用科学规律和专家知识设计任务特定的推理链,考虑相关的推理维度、证据来源和输出约束。这样,S1\-Omni 不仅学习科学数据中的表面模式,还能学习如何从特定任务的证据中进行推理,为可扩展的统一科学建模范式提供了有效的初始路径。
我们的评估覆盖多种科学模态,包括分子、材料、蛋白质、光谱和科学图像,并支持性质预测、光谱到分子生成、蛋白质功能位点预测、蛋白质结构预测,以及科学图像生成与编辑等任务。在超过 60 个基准上的系统比较表明,S1\-Omni 在大多数评估指标上优于 GPT\-5\.5 和 Gemini\-3\.1\-Pro,并在若干专门基准上达到或超越任务特定模型。具体而言,它在 18 项 ADMET 评估中的 16 项上优于 GPT\-5\.5 和 Gemini\-3\.1\-Pro;在涉及 CYP 酶、hERG 和肠道吸收等多项重要药物性质任务上,达到或超越代表性领域特定模型;在一个统一框架内支持多种残基级功能位点预测任务,并在蛋白质–蛋白质相互作用、表位和小分子结合位点预测上取得领先性能;在科学图像生成与编辑方面表现强劲,包括 MSD 医学图像分割、医学图像翻译、超分辨率和科学插图生成。这些结果表明,S1\-Omni 在单一统一过程中跨模态和任务执行科学理解与推理,产生的输出能够在各自的结果空间中得到原生验证。
为支持可重复研究和进一步开发,我们在 Apache\-2\.0 许可下发布 S1\-Omni 的权重、建模和推理服务代码,以及高质量的 S1\-Omni\-Corpus\-10K 子集。
## 2 相关工作
**领域特定科学模型**。领域特定科学模型围绕特定科学对象、领域归纳偏差和评估协议构建,并在其目标任务上取得了强劲性能。AlphaFold 3\(abramson2024alphafold3\) 预测包含蛋白质、核酸、小分子、离子和修饰残基的生物分子复合物的结构。ESM3\(hayes2025simulating\) 统一了蛋白质序列、结构和功能的生成,而 ODesign\(odesign2025\) 进一步针对生物分子相互作用设计。其他科学领域也出现了类似的专门化:Materials Property Axiom\(deeprinciple2026mpa\) 专注于异构实验材料性质预测,DiffSpectra\(wang2025diffspectra\) 从光谱重建分子结构,S1\-Omni\-Image\(li2026s1omniimage\) 支持科学图像理解、生成和编辑。这些模型有效利用了领域知识和科学约束,从而在特定对象类型和任务设置下具有高度科学有效性。然而,它们的能力通常局限于特定对象、数据格式和评估协议,难以自然扩展到其他科学领域或任务。这表明领域特定模型仍然是科学智能的重要组成部分,同时也提出了如何将多样化的科学对象和领域能力连接到一个统一模型中的问题。
**工具增强的通用模型**。通用语言模型和开放域多模态模型将自然语言确立为感知、生成和工具使用的统一接口。从 GPT\-4\(openai2023gpt4\)、Gemini\(team2023gemini\)、Claude 3\(anthropic2024claude3\)、ChatGLM\(glm2024chatglm\),到多模态系统如 LLaVA\(liu2023visual\)、NExT\-GPT\(wu2023nextgpt\)、GPT\-4o\(openai2024gpt4o\)、Qwen2\.5\-Omni\(xu2025qwen25omni\)、SEED\-X\(ge2024seed\) 和 Janus\-Pro\(chen2025janus\),近期工作持续扩展跨模态理解、生成和任务组织能力。在科学场景中,诸如 GPT\-Rosalind\(openai2026rosalind\) 和 Claude Science\(anthropic2026claudescience\) 的系统进一步结合智能体、科学工具和工作流,支持文献分析、数据处理和实验协作。这类工作显著提升了通用模型组织科学任务和调用专门能力的能力。尽管如此,科学知识和执行仍然主要存在于外部工具和工作流逻辑中,而非作为科学能力内化于统一模型中。
**科学语言模型**。科学语言模型试图将多样化的科学对象映射到可联合建模的统一表示空间中,从而提高异构科学数据的互操作性。NatureLM\(xia2025naturelm\) 将小分子、蛋白质、RNA 和材料表示为自然语言中的序列。LOGOS\(li2026speaking\) 使用科学语法描述科学对象、空间约束和相互作用。BioMatrix\(pei2026biomatrix\) 在共享令牌空间中联合建模生物序列、结构和自然语言,而 LucaOne\(he2025generalized\) 研究核酸和蛋白质的统一序列建模。Omni\-Weather\(zhou2025omni\) 统一了天气雷达数据的理解与生成。这些工作表明,共享令牌或科学语法可以为异构科学对象提供通用接口,并改进跨模态建模。然而,统一对象表示本身并不等同于统一科学智能。如何将科学规律、专家知识和领域约束融入模型训练,以及如何进一步支持跨科学任务的一致推理和结果生成,仍然是悬而未决的问题。
**科学推理与知识对齐**。近期的科学推理模型进一步探索如何将科学规律和领域知识明确纳入模型推理。Proteo\-R1\(wu2026proteo\) 将推理机制引入从头蛋白质设计。BioReason\-Pro\(fallahpour2026bioreason\) 结合蛋白质表示、多模态生物学上下文和显式推理进行蛋白质功能预测。DrugTrail\(liudrugtrail\) 将结构化推理轨迹与药物性质导向的偏好优化相结合。在化学领域,ether0\(narayanan2026training\)、MPPReasoner\(zhuang2025reasoning\) 和 Chem\-R\(wang2025chem\) 分别探索了强化学习、分子性质推理轨迹和专家式推理监督。PiFlow\(pu2025piflow\) 进一步利用科学原理指导探索、验证和迭代优化。这些研究表明,将科学规律纳入模型训练可以改进科学推理。然而,大多数现有方法仍聚焦于特定领域或单个任务,尚未形成能够统一连接异构科学数据、科学规律和领域任务的基础模型。
与上述工作不同,S1\-Omni 探索了一种用于科学理解、预测与生成的统一多模态推理架构,其核心能力包括三个:科学数据的统一表示、自然世界知识对齐,以及针对特定领域任务的解码。具体而言,S1\-Omni 首先将异构科学数据——包括文本、分子、材料、蛋白质、光谱和科学图像——编码到统一建模框架中。然后,它利用科学规律和专家知识进行自然世界知识对齐,使任务决策受到科学证据的约束。最后,它执行领域特定任务的解码,实现统一的科学理解、预测与生成,而不是依赖于多个领域特定模型、外部工具或科学语言模型的组合。
## 3 方法
S1\-Omni 在单一模型过程中连接了科学数据的统一表示、自然世界知识对齐以及针对特定领域任务的解码。给定用户指令和科学对象,一个共享的视觉语言模型首先形成任务条件化的隐藏表示,并生成可选的科学推理、文本答案和任务令牌。对于输出可以直接用自然语言表达的任务,文本答案即为最终结果。对于具有专门输出空间的任务——包括性质、蛋白质位点、分子结构、3D 坐标和科学图像——任务令牌选择一个结果解码器,将共享表示转换为可在其科学原生形式中验证的输出。
设训练集为 D=\{di\}i=1N,di=(xi,yi,ti,mi),
其中 xi=(xitext,xitask), yi=(yitext,yitask), yitext=(si,ri,ai)。
这里,xitext 包含用户指令和必要的文本上下文,xitask 包含一个或多个原生科学对象。变量 si、ri 和 ai 分别表示可选的相似文章
OmniScientist: 一个全模态、全学科的人工智能科学家
OmniScientist 是一个端到端的全模态人工智能科学家,它利用自主代理和全生命周期感知,直接基于异构原始证据开展多学科研究。在36个真实数据案例上的评估显示,它提升了跨多种科学模态的基于证据的发现能力。
Gemini Omni
Gemini Omni 是 Google DeepMind 推出的新型 AI 模型,融合了推理与创意能力,支持多模态理解、视频编辑和内容生成,并内置安全措施和数字水印技术。
OmniPhys:一个统一的多模态物理理解与生成基准测试,源自中国教育语料库
OmniPhys 是一个大规模的多模态基准测试,专注于物理理解与生成,涵盖了从中学到大学级别的问题,源自中国教育语料库。其目标是评估并推动多模态大型语言模型在科学领域的发展。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。