Lens:重新思考基础文本到图像模型的训练效率

Hugging Face Daily Papers 论文

摘要

Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。

我们推出了Lens,一个拥有38亿参数的T2I模型,在多个基准测试中,其性能与超过60亿参数的最先进模型相当,甚至在多项指标上超越它们,同时训练计算量显著减少。例如,Lens仅需Z-Image约19.3%的训练计算量。Lens的训练效率源于两个关键策略(除了其紧凑的模型规模)。首先,我们通过以下方式最大化每个训练批次的数据信息密度:(i)在Lens-800M数据集上训练,该数据集包含8亿个密集标注的图像-文本对,标注由GPT-4.1生成,平均每个标注约109个词,相比传统短标注提供了更丰富的语义监督;(ii)从多种分辨率、不同宽高比的图像中构建每个批次,从而扩大每次优化步骤的有效视觉覆盖范围。其次,我们通过谨慎的架构选择提升了收敛速度,包括采用提供更好潜在表示的语义VAE,以及使用强大的语言编码器,它在加速优化的同时,仅凭英文训练数据即可实现多语言泛化。预训练后,我们应用基于分类法驱动的提示(Lens-RL-8K)和结构化奖励准则的强化学习来抑制伪影并提升视觉质量;通过免训练系统提示搜索的推理模块来更好地对齐用户请求与模型;以及基于蒸馏的加速,实现4步推理。通过高效的训练和系统优化,Lens可泛化至1:2到2:1的任意宽高比以及最高1440²的分辨率,并支持多种常用语言的提示。得益于紧凑的尺寸,Lens在单个NVIDIA H100 GPU上生成1024×1024图像仅需3.15秒,而其蒸馏版turbo版本进行4步生成仅需0.84秒。
查看原文
查看缓存全文

缓存时间: 2026/05/25 02:35

论文页 - Lens:重新思考基础文生图模型的训练效率

来源:https://huggingface.co/papers/2605.21573 发布于5月20日

#1 今日论文(https://huggingface.co/papers/date/2026-05-25) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Lens是一个参数量为3.8B的紧凑型文生图模型,通过密集字幕数据集、多分辨率批处理、高效架构和优化技术,以更少的训练计算量实现了卓越性能。

我们提出Lens,一个3.8B参数量的文生图模型(https://huggingface.co/papers?q=T2I%20model),其性能与参数量超过6B的最新模型相当,并在多项基准测试中有所超越,同时训练计算量显著降低。例如,Lens所需的训练计算量仅为Z-Image的19.3%。Lens的高训练效率除了紧凑的模型规模外,还源于两大关键策略。第一,我们通过以下方式最大化每个训练批次的数据信息密度:(i) 在Lens-800M数据集上训练,该数据集包含8亿对密集字幕的图像-文本对,字幕由GPT-4.1生成,平均约109个单词,相比传统短字幕提供了更丰富的语义监督;(ii) 每个批次由多种分辨率和不同长宽比的图像构成,从而扩大了每次优化步骤的有效视觉覆盖范围。第二,通过精心设计的架构选择提升收敛速度,包括采用语义VAE(https://huggingface.co/papers?q=VAE)以提供更好的潜在表示,以及使用强大的语言编码器(https://huggingface.co/papers?q=language%20encoder)加速优化,并实现仅从英文训练数据即可泛化到多语言的能力。预训练后,我们应用基于分类学驱动的提示词(https://huggingface.co/papers?q=taxonomy-driven%20prompts)的强化学习(https://huggingface.co/papers?q=RL)(Lens-RL(https://huggingface.co/papers?q=RL)-8K)和结构化奖励评分体系(https://huggingface.co/papers?q=structured%20reward%20rubrics)来抑制伪影并提升视觉质量;引入推理模块(https://huggingface.co/papers?q=reasoner%20module)配合无训练的系统提示搜索,以更好地对齐用户请求与模型;以及基于蒸馏的加速(https://huggingface.co/papers?q=distillation-based%20acceleration)实现4步推理。通过高效训练和系统优化,Lens可泛化至1:2到2:1的任意长宽比以及最高1440²的分辨率,并支持多种常用语言提示词。得益于紧凑的规模,Lens在单张NVIDIA H100 GPU上生成1024²图像仅需3.15秒,其蒸馏版Turbo版本可在0.84秒内完成4步生成。

查看arXiv页面(https://arxiv.org/abs/2605.21573)查看PDF(https://arxiv.org/pdf/2605.21573)项目页面(https://huggingface.co/microsoft/Lens)GitHub(https://github.com/microsoft/Lens)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21573)

在您的智能体中获取此论文:

hf papers read 2605.21573

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型4

microsoft/Lens-Turbo 文生图• 更新于3天前 • 543 • 72(https://huggingface.co/microsoft/Lens-Turbo)

microsoft/Lens 文生图• 更新于3天前 • 434 • 68(https://huggingface.co/microsoft/Lens)

microsoft/Lens-Base 文生图• 更新于3天前 • 154 • 13(https://huggingface.co/microsoft/Lens-Base)

ngoctham/Lens 文生图• 更新于2天前 • 13 • 1(https://huggingface.co/ngoctham/Lens)

引用本文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2605.21573以在此页面建立链接。

引用本文的Spaces1

包含本文的收藏0

没有收藏包含此论文

将本文添加到一个收藏(https://huggingface.co/new-collection)以在此页面建立链接。

相似文章

microsoft/Lens-Turbo

Hugging Face Models Trending

微软发布了Lens,一个拥有38亿参数的基础文本到图像模型,具备高效的训练和快速的高分辨率生成能力,采用密集字幕预训练和混合分辨率学习。

microsoft/Lens

Hugging Face Models Trending

微软发布了Lens,一个38亿参数的基础文本到图像模型,专为高效训练和快速高分辨率生成而设计,以更少的计算量实现了具有竞争力的质量。