NeoMME:一个用于高效微调和推理的单塔多模态原生多语言基础编码器

Hugging Face Daily Papers 论文

摘要

NeoMME 展示了一系列高效的多模态编码器,采用掩码离散扩散进行预训练,在视觉文档检索和高嵌入压缩方面表现优异,同时在基准测试中超越了更小的模型。

多模态模型通常基于为生成式视觉语言建模设计的架构,通常将单独预训练的视觉编码器与因果语言模型相结合。视觉文档检索器如 ColPali 将这些模型重新用作编码器,继承了VLM在非生成任务中的参数和计算开销。 我们引入 NeoMME,这是一系列 260M 和 800M 参数的多模态和多语言双向编码器,能在单个双向 Transformer 编码器中处理多语言文本和原始图像块。两个模型都从头开始预训练,使用掩码离散扩散文本目标,并以可见图像块为条件处理多模态示例。两者都支持 16,384 个令牌的上下文,足以编码最多两个标准 4K UHD 图像。 为了展示其下游能力,我们对 NeoMME 进行了微调,使用联合训练的密集和晚期交互头部。在 ViDoRe v3 基准测试中,得到的 NeoMME-Retriever 260M 以 0.523 nDCG@10 的分数超越了所有严格低于 800M 参数的评估模型,而 NeoMME-Retriever 800M 达到了 0.556。在 NVIDIA L40S 上匹配 2048x2048 图像输入尺寸时,NeoMME-260M 编码页面的速度约为 ColModernVBERT 的两倍。分层令牌池化和非对称量化将晚期交互多模态文档嵌入压缩了 255 倍,同时保留了超过 95% 的基线 nDCG@10。我们将 NeoMME 贡献给 Hugging Face Transformers,并在 Apache 2.0 下发布预训练骨干和检索兼容的检查点,地址为 https://hf.co/collections/Hcompany/neomme。
查看原文
查看缓存全文

缓存时间: 2026/09/03 11:51

论文页面 - NeoMME:一种单塔多模态原生多语言基础编码器,用于高效微调与推理

来源:https://huggingface.co/papers/2609.01657

摘要

NeoMME 引入了采用掩码离散扩散预训练的小型双向多模态编码器,在视觉文档检索和后期交互嵌入的高压缩方面表现出色。

多模态模型通常建立在为生成式视觉-语言建模设计的架构之上,通常将单独预训练的视觉编码器与因果语言模型相结合。视觉文档检索器(如 ColPali)将这些模型重新用作编码器,继承了视觉语言模型在非生成任务上的参数和计算开销。我们推出 NeoMME,这是一系列具有 2600 万和 8 亿参数的多模态和多语言双向编码器,它们在单个双向 Transformer 编码器(https://huggingface.co/papers?q=bidirectional%20Transformer%20encoder)中处理多语言文本和原始图像块。两个模型都从头开始使用掩码离散扩散(https://huggingface.co/papers?q=masked%20discrete-diffusion)文本目标进行预训练,对于多模态样本则以可见图像块为条件。两者都支持 16,384 个 token 的上下文,足以编码最多两张标准 4K 超高清图像。为了展示其下游能力,我们使用联合训练的稠密检索头和后期交互头(https://huggingface.co/papers?q=late-interaction%20heads)对 NeoMME 进行了微调。在 ViDoRe v3(https://huggingface.co/papers?q=ViDoRe%20v3)基准测试中,得到的 NeoMME-Retriever 260M 以 0.523 的 nDCG@10(https://huggingface.co/papers?q=nDCG%4010)得分,严格超越了所有参数低于 8 亿的评估模型,而 NeoMME-Retriever 800M 达到了 0.556。在 NVIDIA L40S 上匹配的 2048x2048 图像输入尺寸下,NeoMME-260M 的页面编码吞吐量约为 ColModernVBERT 的 2 倍。分层 token 池化(https://huggingface.co/papers?q=Hierarchical%20token%20pooling)和非对称量化(https://huggingface.co/papers?q=asymmetric%20quantization)将后期交互多模态文档嵌入压缩了 255 倍,同时保留了超过 95% 的基线 nDCG@10(https://huggingface.co/papers?q=nDCG%4010)。我们将 NeoMME 贡献给了 Hugging Face Transformers,并在 Apache 2.0 许可下发布预训练主干和检索兼容检查点,地址为 https://hf.co/collections/Hcompany/neomme。

查看 arXiv 页面 (https://arxiv.org/abs/2609.01657) 查看 PDF (https://arxiv.org/pdf/2609.01657) 项目页面 (https://huggingface.co/docs/transformers/main/en/model_doc/neomme) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01657)

在你的智能体中获取这篇论文:

hf papers read 2609.01657

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2609.01657,以将其从此页面链接。

引用此论文的数据集 0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.01657,以将其从此页面链接。

引用此论文的空间 0

没有空间关联此论文

在空间 README.md 中引用 arxiv.org/abs/2609.01657,以将其从此页面链接。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)以将其从此页面链接。

相似文章

Douyin多模态嵌入模型技术报告

Hugging Face Daily Papers

本技术报告介绍了Douyin多模态嵌入(DME),这是一个两阶段训练的模型,结合了对比预训练与基于证据的潜在推理和交叉条件重构,在MMEB-v2上取得了最先进的结果,并已部署于Douyin搜索。

UEmbed:统一稀疏与稠密多模态嵌入

Hugging Face Daily Papers

UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。

MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调

Hugging Face Daily Papers

论文页面 - MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调 来源:[https://huggingface.co/papers/2604.16943](https://huggingface.co/papers/2604.16943) 发布日期:4月18日 · 提交者 [https://huggingface.co/liboaccn](https://huggingface.co/liboaccn) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/6582c482f3006507ea10302a/KbgSsq0FnbMngBcWPhIXi.jpeg)](https://huggingface.co/liboaccn) [Bo Li](https://huggingface.co/liboaccn)

Mage-VL:一种高效的编解码原生流式多模态基础模型

Hugging Face Daily Papers

Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。