标签
VisCo是一个高效训练的自压缩框架,它重用预训练的视觉-语言模型作为视觉令牌压缩的内在编码器,在所有压缩比率下均实现优越性能,且无需外部模块。
Lumos-Nexus 是一个训练高效的视频生成框架,采用两阶段设计:训练时使用轻量级生成器,推理时使用高容量预训练生成器,通过统一渐进频率桥接实现增强的视觉保真度。