标签
一条推文串,倡导更广泛采用HDiT架构和NATTEN,强调其在超分辨率、图像恢复和基因组标注方面的显著速度提升。
本文提出了PhyMRI-SR,一种物理感知的MRI超分辨率方法,它利用高斯溅射和物理约束建模来动态调整分辨率-SNR配置,实现了最先进的性能。
MrFlow 是一种针对流匹配文本到图像模型的免训练多分辨率加速策略,它结合了低分辨率生成、像素空间超分辨率和噪声注入,无需训练或运行时修改即可实现高达25倍的端到端加速。
Patch-PODiff-ViT 引入了一种结构化潜在扩散框架,利用分块本征正交分解 (POD) 实现超分辨率和不确定性量化,通过固定的线性正交基和预测方差的解析传播实现高效扩散。
本文提出了一项新任务:参考引导的生成内容超分辨率与精炼(RefGC-SR²),该任务利用频率感知扩散变换器模型,同时恢复高分辨率细节并修正生成伪影。该方法在后处理阶段利用高分辨率参考图像提升AI生成图像的质量。
本文提出 SRT(时间序列超分辨率),一种使用解耦校正流方法从低分辨率输入重建高分辨率时间模式的框架。该方法将输入分解为趋势和季节性成分,应用隐式神经表示进行分辨率对齐,并引入跨分辨率注意力机制以生成细粒度细节,在多个数据集上实现了最先进的性能。
AirCast-SR 是一个基于扩散模型的基础模型,能够将全球AI天气预报从0.25°降尺度到1公里分辨率,每小时生成一次预报,可产生67小时预报,具有接近零偏差和结构真实感,同时在单个商用GPU上仅需数分钟即可完成推理。
本文介绍了MOSAIC,一种多模态自适应光学显微镜,能够在多种成像模式(宽场、光片、双光子等)之间切换,并对样品引起的光学像差进行自适应校正,从而实现对从单分子到整个生物体的活体成像。
介绍了Q-SRDRN,一种使用分位数损失的多分位数超分辨率网络,用于改进极端降水降尺度,在保持整体精度的同时,显著提高了强降雨事件的检测率。
Wink Engineering 评估了将神经超分辨率作为车牌识别 OCR 预处理手段的有效性,结论是它未能提高准确率,且与直接在低分辨率数据上训练相比,往往导致识别出幻觉字符。
NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。
JoyFox Lab 发布了 LTX2.3-ICEdit-Insight,这是一个基于 LTX-2.3 构建的任务感知型视频恢复与编辑模型系列,支持视频恢复、高清增强、水印去除和字幕去除。