ReFlowSET:用于SAR到EO图像翻译的表示对齐潜在流匹配
摘要
ReFlowSET是一个用于高保真SAR到EO图像翻译的潜在流匹配框架,通过编解码器选择和带有视觉模型对齐的条件DiT,实现了最先进的性能。
查看缓存全文
缓存时间: 2026/09/02 03:46
论文页面 - ReFlowSET:基于表征对齐的潜在流匹配方法,实现SAR到EO图像转换
来源:https://huggingface.co/papers/2609.00968
摘要
ReFlowSET 通过联合 SAR-EO 重建选择了一个潜在编解码器,并训练了一个小型条件 DiT 模型,该模型采用双流条件控制,并与冻结的视觉模型进行对齐,以实现高保真的 SAR 到 EO 图像转换。
SAR 到 EO 图像转换旨在从合成孔径雷达(SAR)观测数据生成电光(EO)图像。现有的潜在扩散方法通常沿用一个预先确定的自编码器,尽管不同编解码器和模态之间的重建保真度可能存在很大差异。由于潜在编解码器会影响 SAR 条件和 EO 目标的往返保持,因此编解码器选择 (https://huggingface.co/papers?q=codec%20selection) 构成了一个根本性的设计选择;然而,现有方法大多依赖于在自然图像上预训练的编解码器。为了解决这个问题,我们引入了 ReFlowSET,这是一个条件潜在流匹配 (https://huggingface.co/papers?q=latent%20flow-matching) 框架,它通过联合 SAR-EO 重建审计来选择自己的编解码器。ReFlowSET 不是沿用一个庞大的预训练生成器,而是在选定的潜在空间中从头开始训练一个显著更小的条件 DiT (https://huggingface.co/papers?q=conditional%20DiT),使用双流 SAR 条件控制 (https://huggingface.co/papers?q=dual-stream%20SAR%20conditioning),然后进行联合特征精炼 (https://huggingface.co/papers?q=joint%20feature%20refinement)。为了给这个从头开始的训练提供语义指导,中间带噪声的 EO 特征会与冻结的视觉基础模型 (https://huggingface.co/papers?q=vision%20foundation%20model) 提取的干净目标 EO 表征进行对齐。这种对齐仅在训练期间使用,不会引入额外的推理成本。在 QXS-SAROPT 和 SAR2Opt 数据集上的实验表明,在各种感知保真度和分布指标上均达到了最先进的性能。代码和预训练权重可在 https://github.com/KAIST-VICLab/ReFlowSET 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2609.00968) 查看 PDF (https://arxiv.org/pdf/2609.00968) 项目主页 (https://kaist-viclab.github.io/ReFlowSET_site/) GitHub2 (https://github.com/KAIST-VICLab/ReFlowSET) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.00968)
在你的代理中获取此论文:
hf papers read 2609\.00968
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
JeonghyeokDo/ReFlowSET 图像到图像• 约2小时前更新 • 1 (https://huggingface.co/JeonghyeokDo/ReFlowSET)
引用本文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.00968 以从本页面链接。
引用本文的空间0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.00968 以从本页面链接。
包含本文的收藏0
没有收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
面向图像生成的球形流匹配中的潜在几何对齐
本文提出对齐潜在几何以实现球形流匹配,将潜在变量投影到固定半径的球面上,并使用球形线性插值来提升图像生成质量,在类条件ImageNet上持续改进FID。
ChangeFlow -- 基于潜空间纠正流的遥感变化检测
ChangeFlow 提出了一种用于遥感变化检测的生成式框架,该框架利用纠正流在潜空间中合成变化掩码,通过基于采样的预测集成实现了更高的准确率和鲁棒性,在四个基准数据集上的平均F1分数达到80.4%。
CAT-Flow: 用于流匹配的曲率自适应步长
本文提出了CAT-OV和CAT-OT两种轻量级、无需训练的算法,它们基于曲率自适应调整流匹配采样中的步长,提升图像质量并将生成步数最多减少40%。
LeapAlign:通过构建两步轨迹在任意生成步骤后训练流匹配模型
LeapAlign是一种后训练方法,通过两步轨迹捷径降低计算成本,同时实现梯度稳定传播到早期生成步骤,从而改善流匹配模型与人类偏好的对齐。在微调Flux模型时,该方法在多种图像质量和文本对齐指标上均优于现有最先进方法。
多分辨率流匹配:基于分阶段采样的免训练扩散加速
MrFlow 是一种针对流匹配文本到图像模型的免训练多分辨率加速策略,它结合了低分辨率生成、像素空间超分辨率和噪声注入,无需训练或运行时修改即可实现高达25倍的端到端加速。