PerceptionDLM: 基于多模态扩散语言模型的并行区域感知
摘要
PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。
查看缓存全文
缓存时间: 2026/06/22 05:29
论文页面 - PerceptionDLM: 基于多模态扩散语言模型的并行区域感知
来源:https://huggingface.co/papers/2606.19534
摘要
PerceptionDLM 通过结构化注意力掩码和高效提示,在多模态扩散语言模型中实现了高效的并行区域感知,在不牺牲描述质量的前提下显著提升了推理速度。
多模态大语言模型(MLLMs)在视觉理解任务中取得了显著进展。然而,现有大多数 MLLMs 依赖自回归生成,这限制了它们在需要描述多个区域的感知任务中的效率。本文提出 PerceptionDLM,一种专为高效并行区域感知优化的多模态扩散语言模型。该架构基于 PerceptionDLM-Base(一个在开源扩散 MLLMs 中达到领先水平的强大基础基线),充分利用了扩散语言模型的并行解码特性。具体而言,我们引入了高效提示和结构化注意力掩码,以支持同时对多个掩码区域进行感知,使模型能够在序列和 token 级别并行生成区域描述。与现有顺序处理区域的方法相比,这一设计显著提升了推理效率。为了系统评估扩散语言模型视觉感知能力的并行性,我们构建了新的并行详细局部描述基准(ParaDLC-Bench),通过将 DLC-Bench 扩展到每张图像包含多个区域掩码,从而联合评估描述质量和推理效率。实验表明,PerceptionDLM 在区域描述任务中保持了有竞争力的性能,同时在多区域感知任务中实现了显著的加速。我们的结果凸显了多模态扩散语言模型在高效、并行视觉感知方面的潜力。据我们所知,我们是首个利用扩散语言模型优势实现并行区域描述和感知的工作。代码、模型和数据集均已发布。
查看 arXiv 页面 (https://arxiv.org/abs/2606.19534) 查看 PDF (https://arxiv.org/pdf/2606.19534) 项目页面 (https://msalab-pku.github.io/projects/PerceptionDLM/index.html) GitHub11 (https://github.com/MSALab-PKU/PerceptionDLM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.19534)
在你的 agent 中获取此论文:
hf papers read 2606\.19534
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型3
MSALab/PerceptionDLM 图像-文本到文本 • 9B • 3天前更新 • 14 • 6 (https://huggingface.co/MSALab/PerceptionDLM)
MSALab/PerceptionDLM-Base 图像-文本到文本 • 9B • 3天前更新 • 15 • 4 (https://huggingface.co/MSALab/PerceptionDLM-Base)
MSALab/LLaDA-8B-Instruct-HF 文本生成 • 8B • 3天前更新 • 13 (https://huggingface.co/MSALab/LLaDA-8B-Instruct-HF)
引用此论文的数据集1
MSALab/ParaDLC-Bench 3天前更新 • 253 • 1 (https://huggingface.co/datasets/MSALab/ParaDLC-Bench)
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.19534,以便从此页面链接。
包含此论文的收藏集1
相似文章
PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
基于时空并行解码与置信度外推的高效扩散LLMs
本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。
Semantic DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型
本文从偏差-方差角度对扩散语言模型进行了理论分析,识别了掩码扩散与均匀扩散核之间的权衡。提出了SemDLM+,通过添加全局转移和语义频率惩罚来克服语义盆地问题,在LM1B和OpenWebText基准上实现了有竞争力的生成质量。
多块扩散语言模型
本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。
DLLM-JEPA:面向掩码扩散语言模型的联合嵌入预测架构
介绍了DLLM-JEPA,这是一种针对掩码扩散语言模型的JEPA公式,通过扩散噪声调度从单个输入构建两个视图,相比LLM-JEPA减少了33%的训练FLOPs,并在GSM8K等任务上提升了微调性能。