M2Retinexformer: 多模态Retinexformer用于低光照图像增强
摘要
M2Retinexformer通过交叉注意力和自适应门控机制融合深度、亮度和语义线索,扩展了Retinexformer框架用于低光照图像增强,在多个基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/05/14 12:18
论文页面 - M2Retinexformer:面向低光图像增强的多模态 Retinexformer
来源:https://huggingface.co/papers/2605.12556
https://huggingface.co/papers/2605.12556#m2retinexformer-multi-modal-retinexformer-for-low-light-image-enhancementM2Retinexformer:多模态 Retinexformer 用于低光图像增强
低光图像增强因复杂的退化问题(包括放大的噪声、伪影和色彩失真)而充满挑战。尽管基于 Retinex 的深度学习方法已取得令人瞩目的成果,但它们主要依赖于单一模态的 RGB 信息。
我们提出 M2Retinexformer(多模态 Retinexformer),这是一种新颖的框架,通过渐进式精炼流水线,将深度线索、亮度先验和语义特征融入 Retinexformer 中。
深度提供了对光照变化不变的几何上下文,而亮度与语义特征则分别提供亮度分布和场景理解的明确指导。多模态信息在多个尺度上提取,并通过交叉注意力进行融合,同时自适应门控根据辅助线索的可靠性,动态平衡光照引导的自注意力与交叉注意力。
在 LOL、SID、SMID 和 SDSD 基准上的评估表明,M2Retinexformer 相比 Retinexformer 及近期最先进方法均有全面提升。
相似文章
ControlLight:面向可控、一致且可泛化的低光照增强
ControlLight 是一个可控的低光照增强框架,利用大规模真实世界数据集和加权流匹配损失,在不同增强强度下实现一致的图像质量,达到最先进性能。
M^{2}SNet:多尺度内多尺度减法网络用于医学图像分割
本文提出了M2SNet,一种用于医学图像分割的多尺度内多尺度减法网络。它利用减法运算捕获编码器各层之间的差异特征,提高了病灶定位的准确性和边缘的清晰度。在涵盖四种医学成像模态的十一个数据集上,该方法取得了最先进的性能。
MirrorPPR:基于示例的人像照片修图
MirrorPPR 提出了一种基于示例的人像修图框架,采用带有 LoRA 适应的扩散变换器和自增强训练数据,实现了卓越的质量和身份保持。
MRT:面向大规模分层图像生成与编辑的掩码区域Transformer
MRT是一个200亿参数的掩码区域扩散模型,统一了文本到层、图像到层以及层到层任务,用于可扩展的多层透明图像生成与编辑,达到了最先进的性能。
迈向可解释的视网膜眼底图像基础模型
本文提出DualIFM,一种为视网膜眼底图像设计的可解释基础模型,以更少的参数实现与RETFound相当的性能,同时提供可解释的预测。