Lens:重新思考基础文本到图像模型的训练效率
摘要
Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。
查看缓存全文
缓存时间: 2026/05/25 02:35
论文页 - Lens:重新思考基础文生图模型的训练效率
来源:https://huggingface.co/papers/2605.21573 发布于5月20日
#1 今日论文(https://huggingface.co/papers/date/2026-05-25) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Lens是一个参数量为3.8B的紧凑型文生图模型,通过密集字幕数据集、多分辨率批处理、高效架构和优化技术,以更少的训练计算量实现了卓越性能。
我们提出Lens,一个3.8B参数量的文生图模型(https://huggingface.co/papers?q=T2I%20model),其性能与参数量超过6B的最新模型相当,并在多项基准测试中有所超越,同时训练计算量显著降低。例如,Lens所需的训练计算量仅为Z-Image的19.3%。Lens的高训练效率除了紧凑的模型规模外,还源于两大关键策略。第一,我们通过以下方式最大化每个训练批次的数据信息密度:(i) 在Lens-800M数据集上训练,该数据集包含8亿对密集字幕的图像-文本对,字幕由GPT-4.1生成,平均约109个单词,相比传统短字幕提供了更丰富的语义监督;(ii) 每个批次由多种分辨率和不同长宽比的图像构成,从而扩大了每次优化步骤的有效视觉覆盖范围。第二,通过精心设计的架构选择提升收敛速度,包括采用语义VAE(https://huggingface.co/papers?q=VAE)以提供更好的潜在表示,以及使用强大的语言编码器(https://huggingface.co/papers?q=language%20encoder)加速优化,并实现仅从英文训练数据即可泛化到多语言的能力。预训练后,我们应用基于分类学驱动的提示词(https://huggingface.co/papers?q=taxonomy-driven%20prompts)的强化学习(https://huggingface.co/papers?q=RL)(Lens-RL(https://huggingface.co/papers?q=RL)-8K)和结构化奖励评分体系(https://huggingface.co/papers?q=structured%20reward%20rubrics)来抑制伪影并提升视觉质量;引入推理模块(https://huggingface.co/papers?q=reasoner%20module)配合无训练的系统提示搜索,以更好地对齐用户请求与模型;以及基于蒸馏的加速(https://huggingface.co/papers?q=distillation-based%20acceleration)实现4步推理。通过高效训练和系统优化,Lens可泛化至1:2到2:1的任意长宽比以及最高1440²的分辨率,并支持多种常用语言提示词。得益于紧凑的规模,Lens在单张NVIDIA H100 GPU上生成1024²图像仅需3.15秒,其蒸馏版Turbo版本可在0.84秒内完成4步生成。
查看arXiv页面(https://arxiv.org/abs/2605.21573)查看PDF(https://arxiv.org/pdf/2605.21573)项目页面(https://huggingface.co/microsoft/Lens)GitHub(https://github.com/microsoft/Lens)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21573)
在您的智能体中获取此论文:
hf papers read 2605.21573
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型4
microsoft/Lens-Turbo 文生图• 更新于3天前 • 543 • 72(https://huggingface.co/microsoft/Lens-Turbo)
microsoft/Lens 文生图• 更新于3天前 • 434 • 68(https://huggingface.co/microsoft/Lens)
microsoft/Lens-Base 文生图• 更新于3天前 • 154 • 13(https://huggingface.co/microsoft/Lens-Base)
ngoctham/Lens 文生图• 更新于2天前 • 13 • 1(https://huggingface.co/ngoctham/Lens)
引用本文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2605.21573以在此页面建立链接。
引用本文的Spaces1
包含本文的收藏0
没有收藏包含此论文
将本文添加到一个收藏(https://huggingface.co/new-collection)以在此页面建立链接。
相似文章
microsoft/Lens-Turbo
微软发布了Lens,一个拥有38亿参数的基础文本到图像模型,具备高效的训练和快速的高分辨率生成能力,采用密集字幕预训练和混合分辨率学习。
microsoft/Lens
微软发布了Lens,一个38亿参数的基础文本到图像模型,专为高效训练和快速高分辨率生成而设计,以更少的计算量实现了具有竞争力的质量。
@HuggingPapers:微软刚刚在Hugging Face上发布了Lens,一个38亿参数的文本到图像模型,提供高效训练和高…
微软在Hugging Face上发布了Lens,一个38亿参数的文本到图像模型,支持高效训练和高达1440×1440的高分辨率生成。
@xichen_pan: 现代文本到图像模型越来越多地依赖大型预训练LLM。但存在一个有趣的不匹配:LLM…
RepFusion提出了一种方法,在扩散Transformer中将预训练多模态LLM用作噪声表示编码器,用于文本到图像生成,在相似计算量下超越基线。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。