NeoMME:一个用于高效微调和推理的单塔多模态原生多语言基础编码器
摘要
NeoMME 展示了一系列高效的多模态编码器,采用掩码离散扩散进行预训练,在视觉文档检索和高嵌入压缩方面表现优异,同时在基准测试中超越了更小的模型。
查看缓存全文
缓存时间: 2026/09/03 11:51
论文页面 - NeoMME:一种单塔多模态原生多语言基础编码器,用于高效微调与推理
来源:https://huggingface.co/papers/2609.01657
摘要
NeoMME 引入了采用掩码离散扩散预训练的小型双向多模态编码器,在视觉文档检索和后期交互嵌入的高压缩方面表现出色。
多模态模型通常建立在为生成式视觉-语言建模设计的架构之上,通常将单独预训练的视觉编码器与因果语言模型相结合。视觉文档检索器(如 ColPali)将这些模型重新用作编码器,继承了视觉语言模型在非生成任务上的参数和计算开销。我们推出 NeoMME,这是一系列具有 2600 万和 8 亿参数的多模态和多语言双向编码器,它们在单个双向 Transformer 编码器(https://huggingface.co/papers?q=bidirectional%20Transformer%20encoder)中处理多语言文本和原始图像块。两个模型都从头开始使用掩码离散扩散(https://huggingface.co/papers?q=masked%20discrete-diffusion)文本目标进行预训练,对于多模态样本则以可见图像块为条件。两者都支持 16,384 个 token 的上下文,足以编码最多两张标准 4K 超高清图像。为了展示其下游能力,我们使用联合训练的稠密检索头和后期交互头(https://huggingface.co/papers?q=late-interaction%20heads)对 NeoMME 进行了微调。在 ViDoRe v3(https://huggingface.co/papers?q=ViDoRe%20v3)基准测试中,得到的 NeoMME-Retriever 260M 以 0.523 的 nDCG@10(https://huggingface.co/papers?q=nDCG%4010)得分,严格超越了所有参数低于 8 亿的评估模型,而 NeoMME-Retriever 800M 达到了 0.556。在 NVIDIA L40S 上匹配的 2048x2048 图像输入尺寸下,NeoMME-260M 的页面编码吞吐量约为 ColModernVBERT 的 2 倍。分层 token 池化(https://huggingface.co/papers?q=Hierarchical%20token%20pooling)和非对称量化(https://huggingface.co/papers?q=asymmetric%20quantization)将后期交互多模态文档嵌入压缩了 255 倍,同时保留了超过 95% 的基线 nDCG@10(https://huggingface.co/papers?q=nDCG%4010)。我们将 NeoMME 贡献给了 Hugging Face Transformers,并在 Apache 2.0 许可下发布预训练主干和检索兼容检查点,地址为 https://hf.co/collections/Hcompany/neomme。
查看 arXiv 页面 (https://arxiv.org/abs/2609.01657) 查看 PDF (https://arxiv.org/pdf/2609.01657) 项目页面 (https://huggingface.co/docs/transformers/main/en/model_doc/neomme) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01657)
在你的智能体中获取这篇论文:
hf papers read 2609.01657
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2609.01657,以将其从此页面链接。
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.01657,以将其从此页面链接。
引用此论文的空间 0
没有空间关联此论文
在空间 README.md 中引用 arxiv.org/abs/2609.01657,以将其从此页面链接。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以将其从此页面链接。
相似文章
Douyin多模态嵌入模型技术报告
本技术报告介绍了Douyin多模态嵌入(DME),这是一个两阶段训练的模型,结合了对比预训练与基于证据的潜在推理和交叉条件重构,在MMEB-v2上取得了最先进的结果,并已部署于Douyin搜索。
UEmbed:统一稀疏与稠密多模态嵌入
UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。
MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调
论文页面 - MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调 来源:[https://huggingface.co/papers/2604.16943](https://huggingface.co/papers/2604.16943) 发布日期:4月18日 · 提交者 [https://huggingface.co/liboaccn](https://huggingface.co/liboaccn) [](https://huggingface.co/liboaccn) [Bo Li](https://huggingface.co/liboaccn)
Mage-VL:一种高效的编解码原生流式多模态基础模型
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
MMCORE:多模态连接与表征对齐的潜在嵌入
MMCORE 提出一个统一的多模态图像生成与编辑框架,将 VLM 语义嵌入与扩散条件对齐,无需昂贵融合或从零训练即可实现顶尖保真度。