Phase Marginalization: 解决Vision Transformers中补丁网格不稳定性
摘要
Phase Marginalization是一种事后方法,通过评估结构化补丁网格相位并聚合输出来解决Vision Transformers中依赖于相位的不稳定性。与标准基线相比,它以最小的额外成本改善了分割、深度和局部匹配性能。
查看缓存全文
缓存时间: 2026/06/10 00:13
论文页面 - 面向视觉Transformer中图块网格不稳定性的相位边缘化
来源:https://huggingface.co/papers/2606.08132
摘要
相位边缘化是一种事后方法,通过评估结构化的图块网格相位并在原始图像坐标系中聚合输出,来解决视觉Transformer中相位相关的不稳定性问题。
视觉Transformer(https://huggingface.co/papers?q=Vision%20Transformers)基于固定的图块网格(https://huggingface.co/papers?q=patch%20grids)运行,这可能会在密集预测(https://huggingface.co/papers?q=dense%20prediction)中引入相位相关的不稳定性(https://huggingface.co/papers?q=phase-dependent%20instability):改变图块划分会改变像素可获得的令牌证据,尤其是在边界附近。我们将图块网格相位(https://huggingface.co/papers?q=patch-grid%20phase)形式化为一个干扰变量,并提出相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization),这是一种事后边缘化方法,它评估结构化的图块网格相位(https://huggingface.co/papers?q=structured%20patch-grid%20phases),逆对齐(https://huggingface.co/papers?q=inverse-align)密集输出(https://huggingface.co/papers?q=dense%20outputs),并在原始图像坐标系(https://huggingface.co/papers?q=image%20coordinate%20system)中聚合它们。核心变体——采用K=4的均匀相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization)——无需训练,在所测量的语义分割(https://huggingface.co/papers?q=segmentation)、深度估计和局部匹配(https://huggingface.co/papers?q=local%20matching)设置中均优于经典的K=1基线。在受控的Cityscapes(https://huggingface.co/papers?q=Cityscapes)实验中,均匀相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization)相比基于通用平移四次前向测试时增强(https://huggingface.co/papers?q=test-time%20augmentation)(TTA)的方法,在相同计算量下具有适度优势(平均交并比(https://huggingface.co/papers?q=Intersection-over-Union)比最强测试通用方案高+0.31)。进一步的可扩展性研究表明,K=4是实用的性价比平衡点:K=8时结果基本不变,K=16时精度提升甚微但延迟显著增加。这些结果将图块网格相位(https://huggingface.co/papers?q=patch-grid%20phase)定位为可测量的干扰变量,并将相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization)定位为用于密集ViT预测的简单诊断和事后边缘化基线。
查看arXiv页面(https://arxiv.org/abs/2606.08132)查看PDF(https://arxiv.org/pdf/2606.08132)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.08132)
在您的智能体中使用本论文:
hf papers read 2606\.08132
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接该论文
请在模型README.md中引用 arxiv.org/abs/2606.08132 以便从此页面链接。
引用该论文的数据集0
没有数据集链接该论文
请在数据集README.md中引用 arxiv.org/abs/2606.08132 以便从此页面链接。
引用该论文的Space0
没有Space链接该论文
请在Space README.md中引用 arxiv.org/abs/2606.08132 以便从此页面链接。
包含该论文的合集0
没有合集包含该论文
请将该论文添加到合集(https://huggingface.co/new-collection)以便从此页面链接。
相似文章
ResilPhase:即插即用的相位映射与抗噪宏轨迹外推,用于扩散加速
ResilPhase是一个免训练的扩散模型加速框架,将加速推理重述为ODE空间中的稳定宏轨迹外推,通过无导数重心拉格朗日外推和有界相位映射,在高加速比下实现最先进的保真度。
变宽变换器
提出了一种非均匀宽度分配的变换器(沙漏形状),在语言建模中优于均匀基线,减少了FLOPs和KV缓存大小。
PointDiT: 像素空间扩散用于单目几何估计
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。
Patch-PODiff-ViT: 基于分块POD的结构化潜在扩散模型,用于超分辨率和不确定性量化
Patch-PODiff-ViT 引入了一种结构化潜在扩散框架,利用分块本征正交分解 (POD) 实现超分辨率和不确定性量化,通过固定的线性正交基和预测方差的解析传播实现高效扩散。
位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位
本文提出结构化缺陷定位(SDG)方法,将文本到图像缺陷建模为(位置、类型、原因、重要性)结构化元组,并利用视觉语言模型(VLM)进行检测,同时构建了包含3万张图像的SDG-30K数据集以及名为BoxFlow-GRPO的诊断到对齐框架。