PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

Hugging Face Daily Papers 论文

摘要

PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。

多模态大型语言模型(MLLMs)在视觉理解任务中取得了显著进展。然而,现有的大多数 MLLMs 依赖于自回归生成,这限制了它们在需要为多个区域生成字幕的感知任务中的效率。在这项工作中,我们提出了 PerceptionDLM,一种为高效并行区域感知优化的多模态扩散语言模型。该架构基于 PerceptionDLM-Base(一个强大的基础基线,在开源扩散 MLLMs 中实现了最先进的性能)构建,充分利用了 DLM 的并行解码特性。具体来说,我们引入了高效提示和结构化注意力掩码,使模型能够同时感知多个掩码区域,从而在序列和令牌级别并行生成区域描述。与现有顺序处理区域的方法相比,这种设计显著提高了推理效率。为了系统评估 DLM 在视觉感知能力上的并行性,我们通过扩展 DLC-Bench,使其每个图像包含多个区域掩码,构建了新的并行详细局部字幕基准(ParaDLC-Bench),从而能够联合评估字幕质量和推理效率。实验表明,PerceptionDLM 在区域字幕任务中保持了有竞争力的性能,同时在大规模多区域感知任务中实现了显著的速度提升。我们的结果突出了多模态扩散语言模型在高效并行视觉感知方面的潜力。据我们所知,我们是首个利用扩散语言模型优势实现并行区域字幕和感知的工作。代码、模型和数据集均已开源。
查看原文
查看缓存全文

缓存时间: 2026/06/22 05:29

论文页面 - PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

来源:https://huggingface.co/papers/2606.19534

摘要

PerceptionDLM 通过结构化注意力掩码和高效提示,在多模态扩散语言模型中实现了高效的并行区域感知,在不牺牲描述质量的前提下显著提升了推理速度。

多模态大语言模型(MLLMs)在视觉理解任务中取得了显著进展。然而,现有大多数 MLLMs 依赖自回归生成,这限制了它们在需要描述多个区域的感知任务中的效率。本文提出 PerceptionDLM,一种专为高效并行区域感知优化的多模态扩散语言模型。该架构基于 PerceptionDLM-Base(一个在开源扩散 MLLMs 中达到领先水平的强大基础基线),充分利用了扩散语言模型的并行解码特性。具体而言,我们引入了高效提示和结构化注意力掩码,以支持同时对多个掩码区域进行感知,使模型能够在序列和 token 级别并行生成区域描述。与现有顺序处理区域的方法相比,这一设计显著提升了推理效率。为了系统评估扩散语言模型视觉感知能力的并行性,我们构建了新的并行详细局部描述基准(ParaDLC-Bench),通过将 DLC-Bench 扩展到每张图像包含多个区域掩码,从而联合评估描述质量和推理效率。实验表明,PerceptionDLM 在区域描述任务中保持了有竞争力的性能,同时在多区域感知任务中实现了显著的加速。我们的结果凸显了多模态扩散语言模型在高效、并行视觉感知方面的潜力。据我们所知,我们是首个利用扩散语言模型优势实现并行区域描述和感知的工作。代码、模型和数据集均已发布。

查看 arXiv 页面 (https://arxiv.org/abs/2606.19534) 查看 PDF (https://arxiv.org/pdf/2606.19534) 项目页面 (https://msalab-pku.github.io/projects/PerceptionDLM/index.html) GitHub11 (https://github.com/MSALab-PKU/PerceptionDLM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19534)

在你的 agent 中获取此论文:

hf papers read 2606\.19534

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型3

MSALab/PerceptionDLM 图像-文本到文本 • 9B • 3天前更新 • 14 • 6 (https://huggingface.co/MSALab/PerceptionDLM)

MSALab/PerceptionDLM-Base 图像-文本到文本 • 9B • 3天前更新 • 15 • 4 (https://huggingface.co/MSALab/PerceptionDLM-Base)

MSALab/LLaDA-8B-Instruct-HF 文本生成 • 8B • 3天前更新 • 13 (https://huggingface.co/MSALab/LLaDA-8B-Instruct-HF)

引用此论文的数据集1

MSALab/ParaDLC-Bench 3天前更新 • 253 • 1 (https://huggingface.co/datasets/MSALab/ParaDLC-Bench)

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2606.19534,以便从此页面链接。

包含此论文的收藏集1

相似文章

PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力

arXiv cs.AI

PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。

基于时空并行解码与置信度外推的高效扩散LLMs

arXiv cs.CL

本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。

多块扩散语言模型

Hugging Face Daily Papers

本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。