@anton_lozhkov:很令人沮丧的是,@RiversHaveWings @StefanABaumann @Birchlabs等人的HDiT架构(以及一般的NATTEN)并没有……

X AI KOLs Timeline 模型

摘要

一条推文串,倡导更广泛采用HDiT架构和NATTEN,强调其在超分辨率、图像恢复和基因组标注方面的显著速度提升。

很令人沮丧的是,@RiversHaveWings @StefanABaumann @Birchlabs等人的HDiT架构(以及一般的NATTEN)并没有得到更广泛的采用 + 多年来,它一直是我超分辨率和图像恢复实验的主要工具。 + 在HF的基因组标注项目中,它使吞吐量提升了11倍。 + 它很可能对我正在尝试的基于GroundingDINO风格的精细分割管道起到很好的作用。 说真的,各位,别再在UNet变压器中使用卷积层来牺牲模型容量和收敛速度了,向HDiT学习吧!
查看原文
查看缓存全文

缓存时间: 2026/07/16 08:15

真的很令人沮丧的是,@RiversHaveWings @StefanABaumann @Birchlabs 等人的 HDiT 架构(以及整体的 NATTEN)没有得到更广泛的采用。

  • 多年来,它一直是我超分辨率和图像复原实验的主力。
  • 在 Hugging Face 的基因组标注项目中,它将吞吐量提升了 11 倍。
  • 它很可能在我正在尝试的类似 GroundingDINO 风格的精细分割流水线中表现良好。

说真的,各位,别再在 UNet 变换器中使用卷积层来损害你的模型容量和收敛速度了,向 HDiT 学习吧!

项目页:https://crowsonkb.github.io/hourglass-diffusion-transformers/…

相似文章

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。