PRISM: 先验纠正与不确定性感知结构建模的基于扩散的文本图像超分辨率

Hugging Face Daily Papers 论文

摘要

PRISM是一个基于扩散的文本图像超分辨率框架,利用流匹配先验纠正和不确定性感知残差编码来提升严重退化下的准确性,实现了毫秒级推理的最新性能。

文本图像超分辨率(Text-SR)需要的不仅仅是视觉上合理的细节合成:笔画拓扑结构中的微小错误可能会改变字符身份并破坏可读性。现有方法通过更强的基于识别或生成先验来提升文本保真度,但在严重退化下仍面临两个未解决的挑战:从低质量输入中提取的文本条件本身可能不可靠,且合理的全局先验并不能完全确定精细的笔画边界。我们提出了PRISM,一种单步扩散的文本超分辨率框架,通过流匹配先验纠正(FMPR)和结构引导的不确定性感知残差编码器(SURE)来解决这两个挑战。FMPR从配对的低质量/高质量潜在空间中构建特权训练先验,并学习一个流匹配,将退化的嵌入向量传输到面向恢复的先验空间,从而提供更准确可靠的全局文本指导。SURE进一步预测不确定性感知的结构残差,以选择性吸收可靠的局部边界证据,同时抑制模糊的笔画线索。这两个组件共同在单次扩散恢复过程中实现了显式的全局先验纠正和局部结构细化。在合成和真实基准上的实验表明,PRISM以毫秒级推理实现了最先进的性能。我们的数据集和代码将在https://github.com/faithxuz/PRISM上提供。
查看原文
查看缓存全文

缓存时间: 2026/05/15 08:24

论文页面 - PRISM:基于扩散的文本图像超分辨率中的先验校正与不确定性感知结构建模

来源:https://huggingface.co/papers/2605.13027
发布于 5 月 13 日

·

提交者 https://huggingface.co/young13579

张扬 (https://huggingface.co/young13579) 于 5 月 15 日

摘要

PRISM 是一个基于扩散的文本超分辨率框架,通过流匹配先验校正和不确定性感知残差编码,在严重退化条件下提升了准确性。

文本图像超分辨率(Text-SR)需要的不仅仅是视觉上合理的细节合成:笔画拓扑(https://huggingface.co/papers?q=stroke%20topology)上的细微错误可能会改变字符身份并破坏可读性。现有方法通过更强的基于识别或生成的先验来提升文本保真度,但在严重退化条件下仍面临两个未解决的挑战:从低质量输入中提取的文本条件(https://huggingface.co/papers?q=text%20condition)本身可能不可靠,且一个合理的全局先验(https://huggingface.co/papers?q=global%20prior)并不能完全确定精细的笔画边界。我们提出 PRISM,一个单步基于扩散的 Text-SR(https://huggingface.co/papers?q=diffusion-based%20Text-SR)框架,通过流匹配先验校正(https://huggingface.co/papers?q=Flow-Matching%20Prior%20Rectification,FMPR(https://huggingface.co/papers?q=FMPR))和结构引导不确定性感知残差编码器(https://huggingface.co/papers?q=Structure-guided%20Uncertainty-aware%20Residual%20Encoder,SURE(https://huggingface.co/papers?q=SURE))来解决这两个挑战。FMPR(https://huggingface.co/papers?q=FMPR)从成对的低质量/高质量潜在表示中构建一个特权训练时先验,并学习一个流匹配(https://huggingface.co/papers?q=flow%20matching),将退化嵌入传输至这个面向恢复的先验空间,从而生成更准确可靠的全局文本指导。SURE(https://huggingface.co/papers?q=SURE)进一步预测不确定性感知的结构残差,以选择性地吸收可靠的局部边界证据,同时抑制模糊的笔画线索。这些组件共同在单次扩散恢复过程中实现了显式的全局先验(https://huggingface.co/papers?q=global%20prior)校正和局部结构细化(https://huggingface.co/papers?q=local%20structure%20refinement)。在合成和真实世界基准上的实验表明,PRISM 实现了最先进的性能,且推理时间仅为毫秒级。我们的数据集和代码将在 https://github.com/faithxuz/PRISM 提供。

查看 arXiv 页面 (https://arxiv.org/abs/2605.13027) 查看 PDF (https://arxiv.org/pdf/2605.13027) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13027)

在您的 agent 中获取这篇论文:

hf papers read 2605.13027

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

没有模型链接本论文

在模型 README.md 中引用 arxiv.org/abs/2605.13027 可从本页链接。

引用本论文的数据集 0

没有数据集链接本论文

在数据集 README.md 中引用 arxiv.org/abs/2605.13027 可从本页链接。

引用本论文的 Space 0

没有 Space 链接本论文

在 Space README.md 中引用 arxiv.org/abs/2605.13027 可从本页链接。

包含本论文的收藏 0

没有收藏包含本论文

将本论文添加到一个收藏 (https://huggingface.co/new-collection) 中可从本页链接。

相似文章

PRISM: 程序化时空推理基准

arXiv cs.AI

PRISM是一个大规模基准,包含10,372个人工校准的指令-代码对,用于评估程序化视频生成,并采用了一个漏斗式框架,包含四个指标。对七个大型语言模型的评估揭示了代码可执行性与空间一致性之间存在显著差距。