从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测

Hugging Face Daily Papers 论文

摘要

ReChannel通过将令牌直接映射到像素空间块,适配预训练的扩散变换器(如FLUX-Klein)用于密集预测任务,在无三元图的抠图、KITTI深度和指代分割上以极少的额外参数取得了最先进的成果。

大规模文本到图像模型是密集预测的理想基础架构,因为RGB生成预训练学习了丰富的语义、结构和几何先验。现有的生成和编辑方法通过将密集预测转化为目标生成来重用这些先验:深度、法线、alpha抠图、掩码和热图等注释被编码到RGB训练的VAE潜在空间中,并解码回类似图像的目标。我们认为这继承了比密集预测所需的更多的生成输出界面:与RGB合成不同,密集预测要求在同一图像平面上获得像素正确、任务原生的场,而不是渲染新的RGB内容。我们的关键观察是,预训练的DiT已经通过图像平面上的块到令牌到块的格点组织RGB输入,因此每个令牌索引一个固定输出块,其通道可以携带任务原生的量而不是RGB外观。我们将其实现为ReChannel:我们保留用于DiT输入分布的VAE编码器,但丢弃目标侧解码器,用任务LoRA适配冻结的DiT,并通过共享的令牌局部线性头(约33K参数,无空间混合)将每个令牌映射到其p x p x K_t像素空间块。使用FLUX-Klein,我们在六个密集预测任务和十几个基准上进行了评估。这种最小界面在无三元图的抠图、KITTI深度和指代分割上树立了新的最先进水平,并在法线、显著性、姿态方面保持竞争力。在匹配的4B设置中,它比编辑加潜在解码对应方法更准确且快2.48倍——密集感知可以从生成预训练中受益,而无需继承其输出界面。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:49

论文页面 - 从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测

来源:https://huggingface.co/papers/2607.06553

摘要

预训练的扩散变换器可以通过将token映射到任务原生输出(而非生成RGB图像)来适应密集预测任务,以最少的额外参数实现最先进的结果。

大规模文本到图像模型(https://huggingface.co/papers?q=text-to-image%20models)之所以成为密集预测(https://huggingface.co/papers?q=dense%20prediction)的理想骨干网络,是因为RGB生成预训练学习了丰富的语义、结构和几何先验知识。现有的生成和编辑(https://huggingface.co/papers?q=dit)方法通过将密集预测(https://huggingface.co/papers?q=dense%20prediction)重构为目标生成来重用这些先验:诸如深度、法线(https://huggingface.co/papers?q=normals)、alpha蒙版、掩码和热力图等标注被编码到经过RGB训练的VAE潜在空间(https://huggingface.co/papers?q=VAE%20latent%20space)中,再解码回类似图像的输出目标。我们认为这种做法继承了比密集预测(https://huggingface.co/papers?q=dense%20prediction)实际所需的更多的生成式输出接口:与RGB合成不同,密集预测(https://huggingface.co/papers?q=dense%20prediction)要求在同一图像平面上输出像素正确、任务原生的场,而不是渲染新的RGB内容。我们的关键观察是:预训练的DiT(https://huggingface.co/papers?q=DiT)已经通过一个patch-to-token-to-patch的格点结构在图像平面上组织RGB输入,因此每个token索引一个固定的输出patch,其通道可以携带任务原生的量值而非RGB外观。我们将其实例化为ReChannel:保留DiT(https://huggingface.co/papers?q=DiT)输入分布所需的VAE编码器,但舍弃目标侧的解码器,用任务LoRA(https://huggingface.co/papers?q=task%20LoRA)适配冻结的DiT(https://huggingface.co/papers?q=DiT),并通过一个共享的token局部线性头(https://huggingface.co/papers?q=token-local%20linear%20head)将每个token映射到其p x p x K_t的像素空间patch——仅约33K参数,无空间混合操作。使用FLUX-Klein(https://huggingface.co/papers?q=FLUX-Klein),我们在六个密集预测(https://huggingface.co/papers?q=dense%20prediction)任务和十余个基准上进行了评估。这个极简的接口在无trimap抠图(https://huggingface.co/papers?q=trimap-free%20matting)、KITTI深度(https://huggingface.co/papers?q=KITTI%20depth)和指代分割(https://huggingface.co/papers?q=referring%20segmentation)上取得了新的最先进结果,并在法线(https://huggingface.co/papers?q=normals)、显著性(https://huggingface.co/papers?q=saliency)和姿态(https://huggingface.co/papers?q=pose)任务上也保持了竞争力。在匹配的4B参数设置下,它比编辑(https://huggingface.co/papers?q=dit)+潜在解码的对应方法更准确且快2.48倍——密集感知可以从生成式预训练中受益,而无需继承其输出接口。

查看arXiv页面(https://arxiv.org/abs/2607.06553)| 查看PDF(https://arxiv.org/pdf/2607.06553)| GitHub9(https://github.com/xmz111/ReChannel)| 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.06553)

在你的agent中获取此论文:

hf papers read 2607.06553

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

请在模型README.md中引用arxiv.org/abs/2607.06553以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2607.06553以从此页面链接。

引用此论文的Spaces0

无Space链接此论文

请在Space README.md中引用arxiv.org/abs/2607.06553以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

请将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

表征先于像素:语义引导的分层视频预测

Hugging Face Daily Papers

Re2Pix 是一个分层视频预测框架,通过首先使用冻结的视觉基础模型预测语义表征,然后将这些预测作为条件输入到潜在扩散模型中以生成逼真的帧,从而改进未来视频生成。该方法通过嵌套丢弃和混合监督策略解决了训练-测试不匹配问题,在自动驾驶基准测试中实现了更好的时间语义一致性和感知质量。

L2P:释放像素生成的潜在潜力

Hugging Face Daily Papers

L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。