Multimodal Flow:语言与视觉在嵌入空间中的统一流建模
摘要
Multimodal Flow 提出了一种用于语言和视觉的完全连续生成架构,采用基于连续嵌入超块(hyperchunk)的共享分块因果流骨干网络。MF-1 在 0.6B 至 1.6B 规模上进行预训练,仅使用 150B tokens,便在 GenEval、DPG-Bench、VQAv2、MMBench 和 POPE 上取得了具有竞争力的表现。
查看缓存全文
缓存时间: 2026/10/02 08:28
论文页面 - MultimodalFlow:语言与视觉在嵌入空间中的统一流建模
来源:https://huggingface.co/papers/2609.40362
摘要
我们提出 MultimodalFlow,这是一个针对语言和视觉的完全连续的生成模型。大多数统一多模态模型要么将语言和量化后的图像都建模为离散 token,要么将离散的语言预测与连续的图像生成结合起来。前者引入了视觉量化瓶颈,后者则需要依赖模态的任务目标和采样流程。完全连续的建模方式避免了这些权衡,能够实现统一的生成过程,但在多模态预训练中仍鲜有探索。MultimodalFlow 引入了一个统一的连续架构,将多模态连续表示与共享的 chunk 因果流(chunk-causal flow)骨干网络相结合。它将文本块和图像组织为有序的连续超块(hyperchunk),从而同时保留文本的 token 顺序和视觉的空间结构。骨干网络通过 Flow Matching 在这些超块上学习单一的向量场。联合注意力机制(joint attention)实现跨模态交互,而各模态专属的前馈网络则分别处理对应模态。模型在训练阶段并行预测多个目标块,在推理阶段则按顺序生成超块。我们实现了 MF-1,并在多模态数据上对其进行了预训练。在 0.6B、1.2B 和 1.6B 三种规模上,持续预训练都稳定地提升了多模态建模能力。仅使用 150B 的预训练 token,MF-1 在 GenEval 和 DPG-Bench 上平均得分达到 82.8,在 VQAv2、MMBench 和 POPE 上平均得分达到 75.3,与在更大数据上训练的统一模型相比仍具有竞争力。在数据、优化流程和参数量均匹配的条件下,MultimodalFlow 进一步超越了代表性的混合模型和离散模型。这些结果确立了基于 chunk 的连续嵌入流建模作为一种新的完全连续范式,在统一多模态建模中具有重要意义。相关代码和模型已在 https://github.com/hustvl/Multimodal-Flow 公开发布。
查看 arXiv 页面 (https://arxiv.org/abs/2609.40362) 查看 PDF (https://arxiv.org/pdf/2609.40362) 项目页面 (https://hustvl.github.io/Multimodal-Flow) GitHub8 (https://github.com/hustvl/Multimodal-Flow) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.40362)
在你的 Agent 中获取此论文:
hf papers read 2609\.40362
还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
hustvl/Multimodal-Flow Any-to-Any • 更新于1天前 • 2 (https://huggingface.co/hustvl/Multimodal-Flow)
引用此论文的数据集0
没有关联此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2609.40362,即可将其链接到此页面。
引用此论文的 Space0
没有关联此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2609.40362,即可将其链接到此页面。
包含此论文的合集0
没有包含此论文的合集
将此论文添加到合集 (https://huggingface.co/new-collection),即可将其链接到此页面。
相似文章
STARFlow2:连接语言模型与归一化流以实现统一的多模态生成
STARFlow2 是一项新的研究论文,介绍了一种将语言模型与自回归归一化流相结合的架构,用于统一的多模态生成。它通过使用共享的因果掩码机制处理交错的文本-图像序列,解决了现有系统中的结构不匹配问题。
掩码语言流模型
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
FLUX 3 - 现实世界模型:迈向多模态流模型作为视觉智能的骨干
FLUX 3 提出了多模态流模型作为现实世界视觉智能的基础方法,建立在之前的 FLUX 工作之上。
BiCFlow-MER:通过条件传输协调判别式与生成式多模态情感识别
BiCFlow-MER 提出了一种基于条件流的音频-文本多模态情感识别框架,该框架能够将情感证据从说话者及词汇因素中分离出来,并在IEMOCAP、MELD和CASE基准测试中取得了最先进的成果。
连续对抗性MeanFlow迁移
本文提出MeanFlow-Transfer(MF-T)和连续对抗性MeanFlow(CAMF),以统一预训练扩散和流动模型的适配和加速,实现数据有限新领域的高质量少步生成。