Phase Marginalization: 解决Vision Transformers中补丁网格不稳定性

Hugging Face Daily Papers 论文

摘要

Phase Marginalization是一种事后方法,通过评估结构化补丁网格相位并聚合输出来解决Vision Transformers中依赖于相位的不稳定性。与标准基线相比,它以最小的额外成本改善了分割、深度和局部匹配性能。

Vision Transformers基于固定补丁网格运行,这可能会为密集预测引入依赖于相位的不稳定性:改变补丁划分会改变像素可用的令牌证据,尤其是在边界附近。我们将补丁网格相位形式化为一个干扰变量,并提出Phase Marginalization,一种事后边缘化方法,它评估结构化补丁网格相位,反向对齐密集输出,并将它们在原始图像坐标系中聚合。核心变体,即K=4的均匀相位边缘化,无需训练,并且在测量的分割、深度和局部匹配设置上优于标准K=1基线。在受控的Cityscapes实验中,均匀相位边缘化相比于基于平移的四次前向测试时增强(TTA)提供了适度的计算匹配优势(在最强测试通用行上平均交并比提高0.31)。一项扩展研究进一步表明,K=4是一个实用的成本-精度权衡:K=8基本不变,而K=16在更高延迟下仅增加少量精度。这些结果将补丁网格相位定位为一个可测量的干扰变量,并将Phase Marginalization定位为密集ViT预测的简单诊断和事后边缘化基线。
查看原文
查看缓存全文

缓存时间: 2026/06/10 00:13

论文页面 - 面向视觉Transformer中图块网格不稳定性的相位边缘化

来源:https://huggingface.co/papers/2606.08132

摘要

相位边缘化是一种事后方法,通过评估结构化的图块网格相位并在原始图像坐标系中聚合输出,来解决视觉Transformer中相位相关的不稳定性问题。

视觉Transformer(https://huggingface.co/papers?q=Vision%20Transformers)基于固定的图块网格(https://huggingface.co/papers?q=patch%20grids)运行,这可能会在密集预测(https://huggingface.co/papers?q=dense%20prediction)中引入相位相关的不稳定性(https://huggingface.co/papers?q=phase-dependent%20instability):改变图块划分会改变像素可获得的令牌证据,尤其是在边界附近。我们将图块网格相位(https://huggingface.co/papers?q=patch-grid%20phase)形式化为一个干扰变量,并提出相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization),这是一种事后边缘化方法,它评估结构化的图块网格相位(https://huggingface.co/papers?q=structured%20patch-grid%20phases),逆对齐(https://huggingface.co/papers?q=inverse-align)密集输出(https://huggingface.co/papers?q=dense%20outputs),并在原始图像坐标系(https://huggingface.co/papers?q=image%20coordinate%20system)中聚合它们。核心变体——采用K=4的均匀相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization)——无需训练,在所测量的语义分割(https://huggingface.co/papers?q=segmentation)、深度估计和局部匹配(https://huggingface.co/papers?q=local%20matching)设置中均优于经典的K=1基线。在受控的Cityscapes(https://huggingface.co/papers?q=Cityscapes)实验中,均匀相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization)相比基于通用平移四次前向测试时增强(https://huggingface.co/papers?q=test-time%20augmentation)(TTA)的方法,在相同计算量下具有适度优势(平均交并比(https://huggingface.co/papers?q=Intersection-over-Union)比最强测试通用方案高+0.31)。进一步的可扩展性研究表明,K=4是实用的性价比平衡点:K=8时结果基本不变,K=16时精度提升甚微但延迟显著增加。这些结果将图块网格相位(https://huggingface.co/papers?q=patch-grid%20phase)定位为可测量的干扰变量,并将相位边缘化(https://huggingface.co/papers?q=Phase%20Marginalization)定位为用于密集ViT预测的简单诊断和事后边缘化基线。

查看arXiv页面(https://arxiv.org/abs/2606.08132)查看PDF(https://arxiv.org/pdf/2606.08132)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.08132)

在您的智能体中使用本论文:

hf papers read 2606\.08132

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接该论文

请在模型README.md中引用 arxiv.org/abs/2606.08132 以便从此页面链接。

引用该论文的数据集0

没有数据集链接该论文

请在数据集README.md中引用 arxiv.org/abs/2606.08132 以便从此页面链接。

引用该论文的Space0

没有Space链接该论文

请在Space README.md中引用 arxiv.org/abs/2606.08132 以便从此页面链接。

包含该论文的合集0

没有合集包含该论文

请将该论文添加到合集(https://huggingface.co/new-collection)以便从此页面链接。

相似文章

变宽变换器

Hugging Face Daily Papers

提出了一种非均匀宽度分配的变换器(沙漏形状),在语言建模中优于均匀基线,减少了FLOPs和KV缓存大小。

PointDiT: 像素空间扩散用于单目几何估计

Hugging Face Daily Papers

PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。