从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测
摘要
ReChannel通过将令牌直接映射到像素空间块,适配预训练的扩散变换器(如FLUX-Klein)用于密集预测任务,在无三元图的抠图、KITTI深度和指代分割上以极少的额外参数取得了最先进的成果。
查看缓存全文
缓存时间: 2026/07/13 07:49
论文页面 - 从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测
来源:https://huggingface.co/papers/2607.06553
摘要
预训练的扩散变换器可以通过将token映射到任务原生输出(而非生成RGB图像)来适应密集预测任务,以最少的额外参数实现最先进的结果。
大规模文本到图像模型(https://huggingface.co/papers?q=text-to-image%20models)之所以成为密集预测(https://huggingface.co/papers?q=dense%20prediction)的理想骨干网络,是因为RGB生成预训练学习了丰富的语义、结构和几何先验知识。现有的生成和编辑(https://huggingface.co/papers?q=dit)方法通过将密集预测(https://huggingface.co/papers?q=dense%20prediction)重构为目标生成来重用这些先验:诸如深度、法线(https://huggingface.co/papers?q=normals)、alpha蒙版、掩码和热力图等标注被编码到经过RGB训练的VAE潜在空间(https://huggingface.co/papers?q=VAE%20latent%20space)中,再解码回类似图像的输出目标。我们认为这种做法继承了比密集预测(https://huggingface.co/papers?q=dense%20prediction)实际所需的更多的生成式输出接口:与RGB合成不同,密集预测(https://huggingface.co/papers?q=dense%20prediction)要求在同一图像平面上输出像素正确、任务原生的场,而不是渲染新的RGB内容。我们的关键观察是:预训练的DiT(https://huggingface.co/papers?q=DiT)已经通过一个patch-to-token-to-patch的格点结构在图像平面上组织RGB输入,因此每个token索引一个固定的输出patch,其通道可以携带任务原生的量值而非RGB外观。我们将其实例化为ReChannel:保留DiT(https://huggingface.co/papers?q=DiT)输入分布所需的VAE编码器,但舍弃目标侧的解码器,用任务LoRA(https://huggingface.co/papers?q=task%20LoRA)适配冻结的DiT(https://huggingface.co/papers?q=DiT),并通过一个共享的token局部线性头(https://huggingface.co/papers?q=token-local%20linear%20head)将每个token映射到其p x p x K_t的像素空间patch——仅约33K参数,无空间混合操作。使用FLUX-Klein(https://huggingface.co/papers?q=FLUX-Klein),我们在六个密集预测(https://huggingface.co/papers?q=dense%20prediction)任务和十余个基准上进行了评估。这个极简的接口在无trimap抠图(https://huggingface.co/papers?q=trimap-free%20matting)、KITTI深度(https://huggingface.co/papers?q=KITTI%20depth)和指代分割(https://huggingface.co/papers?q=referring%20segmentation)上取得了新的最先进结果,并在法线(https://huggingface.co/papers?q=normals)、显著性(https://huggingface.co/papers?q=saliency)和姿态(https://huggingface.co/papers?q=pose)任务上也保持了竞争力。在匹配的4B参数设置下,它比编辑(https://huggingface.co/papers?q=dit)+潜在解码的对应方法更准确且快2.48倍——密集感知可以从生成式预训练中受益,而无需继承其输出接口。
查看arXiv页面(https://arxiv.org/abs/2607.06553)| 查看PDF(https://arxiv.org/pdf/2607.06553)| GitHub9(https://github.com/xmz111/ReChannel)| 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.06553)
在你的agent中获取此论文:
hf papers read 2607.06553
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
请在模型README.md中引用arxiv.org/abs/2607.06553以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
请在数据集README.md中引用arxiv.org/abs/2607.06553以从此页面链接。
引用此论文的Spaces0
无Space链接此论文
请在Space README.md中引用arxiv.org/abs/2607.06553以从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
请将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
@xichen_pan: 现代文本到图像模型越来越多地依赖大型预训练LLM。但存在一个有趣的不匹配:LLM…
RepFusion提出了一种方法,在扩散Transformer中将预训练多模态LLM用作噪声表示编码器,用于文本到图像生成,在相似计算量下超越基线。
表征先于像素:语义引导的分层视频预测
Re2Pix 是一个分层视频预测框架,通过首先使用冻结的视觉基础模型预测语义表征,然后将这些预测作为条件输入到潜在扩散模型中以生成逼真的帧,从而改进未来视频生成。该方法通过嵌套丢弃和混合监督策略解决了训练-测试不匹配问题,在自动驾驶基准测试中实现了更好的时间语义一致性和感知质量。
L2P:释放像素生成的潜在潜力
L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。
UltraFlux:数据-模型协同设计实现多种宽高比下的高质量原生4K文本到图像生成
UltraFlux 提出了一种数据-模型协同设计方法,用于多种宽高比下的原生4K文本到图像生成,解决了位置编码、VAE压缩和优化挑战。它优于现有的开源基线,并达到了与 Seedream 4.0 等专有模型相当的水平。