更优、更强、更快、更广:面向基于MLLM分割的结构化全掩码预测
摘要
本文介绍了结构化全掩码预测(Structured All-Mask Prediction)及STAMPlus方法,这是一种基于MLLM的分割方法,通过一次非自回归过程联合预测所有目标掩码,解决了高分割性能、保持对话能力与快速推理之间的三难问题。
查看缓存全文
缓存时间: 2026/08/05 13:45
论文页面 - 更好、更强、更快、更广:面向基于MLLM的分割的结构化全掩码预测
来源:https://huggingface.co/papers/2608.02791 发布于8月3日 · 提交者 fmk 于8月5日
摘要
基于MLLM的分割面临一个核心分割三难问题:高分割性能、保留对话能力和快速推理。嵌入预测方法可能通过像素级目标扰乱语言建模,而下一词生成对于密集掩码效率低下。我们提出All-Mask Prediction(全掩码预测),将自回归对话与非自回归掩码预测解耦。其二进制实例STAMP(Simultaneous Textual All-Mask Prediction,同步文本全掩码预测)发出一个词表内触发词,将图像对齐的掩码token与相应的图像块特征融合,并使用混合注意力在一次前向过程中将所有token分类为前景或背景。因此,它结合了强大的指代和推理分割,同时保留了多模态能力和高效推理。然而,二进制掩码无法在不重复进行特定目标预测的情况下保留多个语义或实例身份。因此,我们提出结构化全掩码预测(Structured All-Mask Prediction)并开发了STAMPlus。它生成带有显式ID和可选框的目标列表,将这些ID绑定到一个共享的多类掩码空间,并在一次非自回归过程中联合预测所有目标。一个统一的检查点保留了STAMP的指代和推理能力,同时扩展到开放词汇语义分割、实例感知分割和遥感小目标分割,其中高分辨率掩码token缩放保留了更精细的空间证据。在这些设置中,STAMPlus实现了最先进的分割性能,保持了一般的多模态指令跟随能力,并将12类别延迟从重复STAMP推理的13.50秒降至5.16秒。进一步的分析表明,准确的目标线索有助于分割,学习到的空间接地有利于二次推理。总体而言,STAMPlus解决了超越单目标预测的三难问题。
查看 arXiv 页面 (https://arxiv.org/abs/2608.02791) 查看 PDF (https://arxiv.org/pdf/2608.02791) 项目页面 (https://arxiv.org/pdf/2608.02791) GitHub (https://github.com/HKUST-LongGroup/STAMP) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02791)
在你的agent中获取这篇论文:hf papers read 2608\.02791
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型
0 没有模型链接此论文 在模型README.md中引用arxiv.org/abs/2608.02791以从此页面链接它。
引用此论文的数据集
0 没有数据集链接此论文 在数据集README.md中引用arxiv.org/abs/2608.02791以从此页面链接它。
引用此论文的 Spaces
0 没有Space链接此论文 在Space README.md中引用arxiv.org/abs/2608.02791以从此页面链接它。
包含此论文的收藏集
0 没有收藏集包含此论文 将此论文添加到收藏集以从此页面链接它。
相似文章
用于LLM强化学习的预测性散度掩码
提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。
AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction
This paper introduces AdaMTP, an adaptive training paradigm for multi-token prediction that dynamically aligns prediction horizons with sequence predictability using entropy-based segmentation, consistently outperforming standard MTP on math, code, and general benchmarks across three LLM backbones.
DLLM-JEPA:面向掩码扩散语言模型的联合嵌入预测架构
介绍了DLLM-JEPA,这是一种针对掩码扩散语言模型的JEPA公式,通过扩散噪声调度从单个输入构建两个视图,相比LLM-JEPA减少了33%的训练FLOPs,并在GSM8K等任务上提升了微调性能。
基于音系激活映射的音素分割与识别
本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。
ProactiveLLM: 学习主动交互的流式大语言模型
ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。