region-captioning

标签

Cards List
#region-captioning

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

Hugging Face Daily Papers ↗ · 2026-06-17 缓存

PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈