Multimodal Flow:语言与视觉在嵌入空间中的统一流建模

Hugging Face Daily Papers 论文

摘要

Multimodal Flow 提出了一种用于语言和视觉的完全连续生成架构,采用基于连续嵌入超块(hyperchunk)的共享分块因果流骨干网络。MF-1 在 0.6B 至 1.6B 规模上进行预训练,仅使用 150B tokens,便在 GenEval、DPG-Bench、VQAv2、MMBench 和 POPE 上取得了具有竞争力的表现。

我们提出 Multimodal Flow,这是一个针对语言和视觉的完全连续生成模型。大多数统一多模态模型要么将语言和量化图像都建模为离散 token,要么将离散的语言预测与连续的图像生成结合起来。前者引入了视觉量化瓶颈,后者则需要依赖模态的目标函数和采样过程。完全连续的建模可以避免这些权衡,并实现共享的生成过程,但在多模态预训练中仍鲜有探索。Multimodal Flow 引入了一种统一的连续架构,将多模态连续表示与共享的分块因果流骨干网络集成在一起。它将文本块和图像组织为有序的连续超块,同时保留文本的 token 顺序和视觉的空间结构。骨干网络通过 Flow Matching 在这些超块上学到一个统一的向量场。联合注意力机制实现跨模态交互,而模态特定的前馈网络分别处理各个模态。模型在训练时并行预测多个目标块,并在推理时按顺序生成超块。我们实例化了 MF-1 并在多模态数据上对其进行预训练。在 0.6B、1.2B 和 1.6B 三种规模上,持续预训练都稳定地提升了多模态建模能力。仅使用 150B 预训练 tokens,MF-1 在 GenEval 和 DPG-Bench 上的平均得分为 82.8,在 VQAv2、MMBench 和 POPE 上为 75.3,与在数据量大得多的条件下训练的统一模型相比仍保持竞争力。在相同的数据、优化和参数预算下,Multimodal Flow 进一步超越了代表性的混合模型和离散模型。这些结果确立了基于连续块的嵌入流建模作为一种全新的统一多模态建模范式。相关代码和模型已在 https://github.com/hustvl/Multimodal-Flow 公开发布。
查看原文
查看缓存全文

缓存时间: 2026/10/02 08:28

论文页面 - MultimodalFlow:语言与视觉在嵌入空间中的统一流建模

来源:https://huggingface.co/papers/2609.40362

摘要

我们提出 MultimodalFlow,这是一个针对语言和视觉的完全连续的生成模型。大多数统一多模态模型要么将语言和量化后的图像都建模为离散 token,要么将离散的语言预测与连续的图像生成结合起来。前者引入了视觉量化瓶颈,后者则需要依赖模态的任务目标和采样流程。完全连续的建模方式避免了这些权衡,能够实现统一的生成过程,但在多模态预训练中仍鲜有探索。MultimodalFlow 引入了一个统一的连续架构,将多模态连续表示与共享的 chunk 因果流(chunk-causal flow)骨干网络相结合。它将文本块和图像组织为有序的连续超块(hyperchunk),从而同时保留文本的 token 顺序和视觉的空间结构。骨干网络通过 Flow Matching 在这些超块上学习单一的向量场。联合注意力机制(joint attention)实现跨模态交互,而各模态专属的前馈网络则分别处理对应模态。模型在训练阶段并行预测多个目标块,在推理阶段则按顺序生成超块。我们实现了 MF-1,并在多模态数据上对其进行了预训练。在 0.6B、1.2B 和 1.6B 三种规模上,持续预训练都稳定地提升了多模态建模能力。仅使用 150B 的预训练 token,MF-1 在 GenEval 和 DPG-Bench 上平均得分达到 82.8,在 VQAv2、MMBench 和 POPE 上平均得分达到 75.3,与在更大数据上训练的统一模型相比仍具有竞争力。在数据、优化流程和参数量均匹配的条件下,MultimodalFlow 进一步超越了代表性的混合模型和离散模型。这些结果确立了基于 chunk 的连续嵌入流建模作为一种新的完全连续范式,在统一多模态建模中具有重要意义。相关代码和模型已在 https://github.com/hustvl/Multimodal-Flow 公开发布。

查看 arXiv 页面 (https://arxiv.org/abs/2609.40362) 查看 PDF (https://arxiv.org/pdf/2609.40362) 项目页面 (https://hustvl.github.io/Multimodal-Flow) GitHub8 (https://github.com/hustvl/Multimodal-Flow) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.40362)

在你的 Agent 中获取此论文:

hf papers read 2609\.40362

还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

hustvl/Multimodal-Flow Any-to-Any • 更新于1天前 • 2 (https://huggingface.co/hustvl/Multimodal-Flow)

引用此论文的数据集0

没有关联此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2609.40362,即可将其链接到此页面。

引用此论文的 Space0

没有关联此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2609.40362,即可将其链接到此页面。

包含此论文的合集0

没有包含此论文的合集

将此论文添加到合集 (https://huggingface.co/new-collection),即可将其链接到此页面。

相似文章

掩码语言流模型

arXiv cs.CL

本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。

连续对抗性MeanFlow迁移

arXiv cs.LG

本文提出MeanFlow-Transfer(MF-T)和连续对抗性MeanFlow(CAMF),以统一预训练扩散和流动模型的适配和加速,实现数据有限新领域的高质量少步生成。