Monkey King Bang: A Unified Scientific Multimodal Foundation Model

arXiv cs.LG 论文

摘要

MKB 是一个统一的科学多模态基础模型,使用共享的 Transformer 主干和针对模态定制的组件,处理六个科学分支(DNA、RNA、蛋白质、小分子、地球科学、医学图像),在跨领域的理解和生成方面达到有竞争力的水平。

arXiv:2607.20557v1 公告类型:新 摘要:科学发现正日益从孤立学科转向多领域推理,人工智能驱动的科学研究也面临类似的转型。现有系统要么专注于单个领域,要么主要通过文本分词和基于提示的接口来统一科学数据,这限制了它们处理多样化科学输入、生成模态原生输出以及支持跨科学领域的联合理解、推理和生成的能力。我们提出了 MKB,一个统一的多模态科学模型,同时支持理解和生成,构建于共享的 Transformer 主干以及针对模态定制的编码器、适配器和解码器之上。MKB 涵盖六个科学分支,包括 DNA、RNA、蛋白质、小分子、地球科学和医学图像,并支持原生输出,例如生物序列、分子字符串、气象场和分割掩码。训练遵循两阶段模态优先于语言的课程:第一阶段将模态专用组件与冻结的主干对齐,第二阶段使用混合科学和通用语料库将它们与语言主干整合。实验表明,MKB 在生物和分子基准测试中达到了有竞争力的科学理解水平,为天气预报、生物生成和医学图像分割生成了高保真的原生输出,并在很大程度上保留了其 Qwen3-VL 主干的通用能力。这些结果证明了所提出范式的可行性,表明具有模态定制组件的共享主干模型可以为未来跨领域科学多模态探索提供有前景的基础。模型和代码公开在 https://github.com/Shanghai-Academy-of-AI-For-Science/MKB 和 https://huggingface.co/sais-org/MKB。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:12

# 猴王榜:一个统一的科学多模态基础模型

来源:https://arxiv.org/html/2607.20557

###### 摘要

科学发现正日益从孤立学科转向多领域推理,而人工智能科学也面临着类似的转变。现有系统要么专精于单一领域,要么主要通过文本分词和基于提示的接口来统一科学数据,这限制了它们处理多样化科学输入、生成模态原生输出以及跨科学领域支持联合理解、推理和生成的能力。我们提出 MKB,一个用于理解和生成的统一科学多模态模型,它围绕一个共享的 Transformer 骨干网络和面向模态的编码器、适配器及解码器构建。MKB 涵盖六个科学分支,包括 DNA、RNA、蛋白质、小分子、地球科学和医学图像,并支持生物序列、分子字符串、气象场和分割掩码等原生输出。训练遵循一个两阶段课程:先模态后语言。第一阶段将模态特定组件与冻结的骨干网络对齐;第二阶段使用混合的科学和通用语料库将它们与语言骨干网络整合。实验表明,MKB 在生物学和分子基准测试中取得了具有竞争力的科学理解能力,在天气预报、生物生成和医学图像分割方面生成了高保真度的原生输出,并且很大程度上保留了其 Qwen3-VL 骨干网络的通用能力。这些结果证明了所提出范式的可行性,表明带有模态定制组件的共享骨干模型可以为未来的跨领域科学多模态探索提供有前景的基础。模型和代码已公开在 https://github.com/Shanghai-Academy-of-AI-For-Science/MKB 和 https://huggingface.co/sais-org/MKB。

## 1 引言

科学发现日益超越单个学科的界限。例如,理解基因组变异如何导致疾病,通常需要整合来自遗传学、转录组学、蛋白质生物学和分子药理学的证据。类似的相互依赖性在科学中普遍存在,相关知识分布于异构表征、物理尺度和学科领域之中。因此,现代科学发现越来越依赖于对多种形式科学证据的协调分析。

人工智能科学也遵循了类似的轨迹。早期 AI 系统大多作为专家模型开发,每个模型针对单个领域的数据结构和预测目标进行定制,这类系统如今在许多科学领域内定义了最先进水平。这些专家系统大致可分为两类。第一类针对其结构类似于常见视觉或时空信号的科学数据。对于医学图像和大气场,分割和预报模型适配视觉或时空架构,并从大规模模态原生语料库中学习领域特定结构,从而产生比领域无关骨干网络更清晰的分割掩码和更低的预报误差 [5 (https://arxiv.org/html/2607.20557#bib.bib45), 30 (https://arxiv.org/html/2607.20557#bib.bib42), 6 (https://arxiv.org/html/2607.20557#bib.bib41), 4 (https://arxiv.org/html/2607.20557#bib.bib38), 23 (https://arxiv.org/html/2607.20557#bib.bib40), 17 (https://arxiv.org/html/2607.20557#bib.bib39)]。第二类针对其结构难以通过通用视觉或文本表示捕获的科学对象。蛋白质、DNA 和 RNA 需要专门的字母表和长程序列建模,而分子更自然地以图或化学上有意义的分词来表示。这些需求催生了强大的专家模型,包括蛋白质语言模型 [20 (https://arxiv.org/html/2607.20557#bib.bib16), 18 (https://arxiv.org/html/2607.20557#bib.bib30)]、核苷酸编码器 [32 (https://arxiv.org/html/2607.20557#bib.bib2), 7 (https://arxiv.org/html/2607.20557#bib.bib60)] 和分子图网络 [2 (https://arxiv.org/html/2607.20557#bib.bib52)]。它们的经验优势源于架构先验和模态原生监督,而这些是通用骨干网络需要从头学习的。然而,由于构造方式,这些系统通常仍然局限于单个领域,不支持在单个模型内进行直接的跨领域组合。

近期的科学通用模型在一定程度上通过将多样的科学输入连接到共享的语言骨干网络来解决跨领域建模问题,通常采用类文本序列化或工具中介提示 [27 (https://arxiv.org/html/2607.20557#bib.bib59), 13 (https://arxiv.org/html/2607.20557#bib.bib1), 33 (https://arxiv.org/html/2607.20557#bib.bib58)]。这类方法提供了统一的对话式接口,但其以文本为中心的交互机制并不适用于所有科学数据。对于输入而言,密集的大气场、分子结构和生物医学图像包含空间、几何或数值结构,这些结构可能难以通过序列化来保留。对于输出而言,天气预报和医学图像分割等任务需要原生的密集预测,包括经纬度场和逐像素掩码,而以文本为中心的模型只能描述这些输出或将它们委托给外部预测器,而不是直接从共享的隐藏表示中解码它们。即使是当前最大的科学多模态 LLM,例如万亿参数的 Intern-S1-Pro [33 (https://arxiv.org/html/2607.20557#bib.bib58)],也专注于文本科学推理,并不原生生成连续场预报或高分辨率分割掩码。

综合来看,现有系统留下了一个重要的空白:一个单一的共享骨干模型,能够以结构上合适的形式直接编码异构的科学模态,跨模态联合上下文化信息,并在多个科学领域生成模态原生输出。

受此空白启发,我们提出了猴王榜 (MonkeyKingBang, MKB),一个用于理解和生成异构科学数据的统一科学多模态基础模型。MKB 涵盖六个科学分支:DNA、RNA、蛋白质、小分子、地球系统数据和医学图像。它围绕一个共享的自回归 Transformer 骨干网络构建,配备面向模态的编码器、适配器,并在适用时配备解码器。对于给定任务,相关的编码器-适配器对将科学输入映射为与共享骨干网络隐藏空间对齐的模态标记序列。这些模态模块根据任务进行排列,并在共享序列内联合上下文化。对于生成任务,从上下文化序列中选择目标模态的隐藏状态,并将其传递给相应的领域特定解码器,该解码器以所需的原生形式生成输出。这种设计允许任务中涉及的模态通过共享表示空间进行交互,同时保留重要的模态特定属性,包括序列依赖、分子几何、连续物理信号和高维空间结构。

然而,在共享骨干网络内联合训练异构的模态特定通路具有挑战性,因为数据结构、尺度和监督方式的差异可能导致不稳定优化和模态间的干扰。为解决此问题,训练遵循一个两阶段课程:先模态后语言。在第一阶段,每个模态特定通路与冻结的共享骨干网络对齐,使其编码器、适配器以及(适用时)解码器与骨干网络表示空间建立稳定接口。在第二阶段,模态组件和语言骨干网络使用混合的科学和通用语料库联合整合。该课程将异构的科学能力集成到单个检查点中,同时限制骨干网络原始语言和视觉能力的退化。

我们沿着三个互补维度评估 MKB:科学理解、科学生成和通用能力。在生物序列理解基准测试中,MKB 在 20 项任务中的 17 项中排名前两位,超过了基于 LLM 的最先进系统 (16/20) [33 (https://arxiv.org/html/2607.20557#bib.bib58)],尽管使用的参数大约少两个数量级 (图 1 (https://arxiv.org/html/2607.20557#S1.F1))。在分子基准测试中,它也在部分任务上超过了专家模型。对于原生科学生成,它在生物序列、分子字符串、气象场和医学图像分割掩码上产生高保真输出。特别是,MKB 实现了强大的地球系统预报性能,包括在评估设置下比 HRES [10 (https://arxiv.org/html/2607.20557#bib.bib69)] 更好的中期预报,并在评估的医学成像模态中获得了最佳的整体 Dice 性能。在联合科学多模态训练后,它还很大程度上保留了其 Qwen3-VL 骨干网络的通用能力 [24 (https://arxiv.org/html/2607.20557#bib.bib51)]。

参见图注

图 1:在 Biology-Instructions 理解套件上的领奖台覆盖情况。对于每个生物学类别和总共 20 项任务,柱状图堆叠了第一名(实心)和第二名(阴影),柱顶数字是它们的总和。MKB (11B) 达到 17/20 的前两名,领先于 Intern-S1-Pro (1T, 16/20),并远高于 Biology-Instructions (8B, 7/20)。

总体而言,这些结果证明了共享骨干建模范式的可行性,在该范式中,生物序列、分子图、空间图像特征和连续物理场被编码到共同的表示空间,并解码为模态原生的科学输出。它们也突显了在精确标量回归方面的剩余挑战,特别是对于 ADMET 预测,更强的量化监督和面向回归的建模可能是有益的。

## 2 架构

参见图注

图 2:MKB 概述。MKB 由连接到共享自回归 Transformer 骨干网络的通用和领域特定编码器、适配器和解码器组成。异构输入被映射为统一的多模态标记序列进行联合上下文化,之后目标模态的隐藏状态被派送到相应的解码器,以原生形式生成输出。虚线路径表示本报告中未评估其原生生成能力的框架组件。

### 2.1 概述

我们提出 MKB,一个统一的科学多模态模型,支持跨异构科学领域的科学理解和模态原生生成。该模型围绕一个共享的 Qwen3-VL-8B Transformer 骨干网络构建 [24 (https://arxiv.org/html/2607.20557#bib.bib51)],隐藏维度 \(D_{\mathrm{LLM}}=4096\),并配有结构感知表示通路和模态特定生成组件。MKB 涵盖六个科学分支:DNA、RNA、蛋白质、小分子、地球系统数据和医学图像,同时保留 Qwen3-VL 的通用能力。科学输入在与其共享骨干网络隐藏空间对齐之前,根据其原生结构属性进行表示。生物序列和分子图被编码为变长特征,并通过 Perceiver 风格重采样器和模态特定投影器压缩为定长潜在标记。地球系统场则保留密集的经纬度标记网格以保持其空间组织,而生物医学分割使用双路径设计,结合了指令条件化的 Qwen3-VL 表示和密集的 SAM3 图像特征。对于每个任务,只有相关模态被组合进共享的多模态序列,并由自回归 Transformer 联合上下文化。对于理解任务,共享语言模型头自回归生成文本响应。对于生成任务,从上下文化序列中选择与目标模态关联的隐藏状态,并传递给相应的生成通路,该通路以原生形式生成输出,包括生物序列、分子字符串、气象场和分割掩码。以下章节描述统一表示框架、模态特定表示通路、共享骨干网络和多模态组合机制,以及模态原生生成通路。

表 1:模态特定表示和生成通路总结。所有分支都通过共享语言模型头支持文本理解。对于序列和图模态,编码器特征通过一个模态适配器(包含 Perceiver 风格重采样器和 MLP 投影器)转换为共享 Transformer 隐藏大小 \(D_{\mathrm{LLM}}=4096\)。破折号表示在报告的实验中未使用模态原生生成通路。

| 分支 | 原生输入 | 表示通路 | 关键规格 | 面向骨干网络的表示 | 原生输出通路 |
|------|----------|----------|----------|----------------------|----------------|
| DNA | 核苷酸序列 | 编码器 + 模态适配器 | 1-D 卷积 Transformer;宽度 512;8 个块;K=64 | 64 个标记在 \(\mathbb{R}^{D_{\mathrm{LLM}}}\) | – |
| RNA | 核苷酸序列 | 编码器 + 模态适配器 | 1-D 卷积 Transformer;宽度 512;8 个块;K=64 | 64 个标记在 \(\mathbb{R}^{D_{\mathrm{LLM}}}\) | 线性核苷酸头;RNA 序列 |
| 蛋白质 | 氨基酸序列 | 编码器 + 模态适配器 | ESM2-150M;宽度 640;K=64 | 64 个标记在 \(\mathbb{R}^{D_{\mathrm{LLM}}}\) | – |
| 小分子 | 分子图 | 编码器 + 模态适配器 | Suiren-ConfAvg;宽度 256;局部和全连接图;K=64 | 64 个标记在 \(\mathbb{R}^{D_{\mathrm{LLM}}}\) | 交叉注意力 Transformer;226 标记 SMILES 词汇表 |
| 地球系统 | 密集物理场 | 结构保持空间投影 | Swin 风格编码器;宽度 2048;12 个块;6×6 补丁 | 密集的 120×240 经纬度标记网格 | Swin 风格场解码器;70 通道气象场 |
| 生物医学图像 | 图像和文本指令 | 双路径语义和空间表示 | Qwen3-VL 语义通路;SAM3 密集图像通路;2016×2016 输入 | 语义条件标记;为解码器保留的密集 SAM3 特征 | SAM3 掩码解码器;576×576 分割掩码 |

### 2.2 统一科学表示框架

对于每个任务,参与的科学模态通过模态特定表示通路进行处理,这些通路保持其原生结构属性,同时与共享 Transformer 的隐藏空间对齐。给定来自模态 \(m\) 的原生输入 \(\mathbf{X}_{(m)}\),相应的编码器产生连续表示 \(\mathbf{H}_{(m)} \in \mathbb{R}^{N_{(m)} \times d_{(m)}}\),(1) 其中 \(N_{(m)}\) 和 \(d_{(m)}\) 分别表示编码器特征的数量和维度。对于序列类和图类模态,包括 DNA、RNA、蛋白质和分子,编码器输出被传递到一个模态特定适配器。每个适配器由 Perceiver 风格重采样器后接轻型 MLP 投影器组成,从而将变长编码器特征转换为定长潜在嵌入。

相似文章

通用多模态基础模型

arXiv cs.LG

本文介绍了一种通用多模态基础模型,能够处理任意模态组合与预测任务,通过在具有多样化因果结构的大规模合成数据集上训练,实现了具有竞争力的性能。

从模态到命题:一种以语言为中心的多模态智能框架

arXiv cs.AI

本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。

可控分子生成基础模型

arXiv cs.LG

提出CoMole,一种基于基序感知图扩散和强化学习的可控分子生成基础模型,在材料和药物发现基准测试中实现了卓越的可控性。