microsoft/Lens
摘要
微软发布了Lens,一个38亿参数的基础文本到图像模型,专为高效训练和快速高分辨率生成而设计,以更少的计算量实现了具有竞争力的质量。
查看缓存全文
缓存时间: 2026/05/26 07:58
microsoft/Lens · Hugging Face
来源:https://huggingface.co/microsoft/Lens
https://huggingface.co/microsoft/Lens#lens-rethinking-training-efficiency-for-foundational-text-to-image-modelsLens:重新思考基础文生图模型的训练效率
Lens 预告图
贡献者(按字母顺序排列): Baining Guo、Chong Luo、Dong Chen†、Dongdong Chen、Fangyun Wei†、Ji Li、Jianmin Bao、Jiawei Zhang*、Jinjing Zhao*、Lei Shi、Qinhong Yang、Sirui Zhang*、Xiuyu Wu、Xuelu Feng、Yan Lu、Yanchen Dong、Yang Yue*、Yitong Wang、Yunuo Chen、Zhiyang Liang*、Ziyu Wan† Microsoft | *核心贡献者 | †项目负责人
arXiv (https://arxiv.org/abs/2605.21573) Hugging Face (https://huggingface.co/microsoft/Lens) GitHub (https://github.com/microsoft/Lens) 许可证:MIT (https://huggingface.co/microsoft/LICENSE)
Lens 是一个 38亿参数 的基础文生图模型,专为 高效训练 和 快速高分辨率生成 而设计。它结合了密集字幕预训练、混合分辨率学习、GPT-OSS 多层文本特征以及 FLUX.2 语义 VAE,以显著低于大型 T2I 模型的训练计算量达到具有竞争力的质量。
此仓库提供从 Lens DiT 检查点生成图像的最小推理代码。
https://huggingface.co/microsoft/Lens#highlightsHighlights
- 高效基础 — 使用 Lens-800M 进行训练,这是一个包含 8 亿图像-文本对的数据集,带有长 GPT-4.1 字幕,最大化每个训练批次的信息密度。
- 紧凑且富有表现力 — 一个 48 块的 MMDiT 去噪器利用 FLUX.2 潜变量和拼接的多层 GPT-OSS 特征,实现更强的提示理解和多语言泛化。
- 灵活分辨率 — 混合分辨率训练支持从
1:2到2:1的宽高比以及高达 1440×1440 的分辨率推理。 - 后训练变体 — RL 调优提升视觉质量和伪影抑制;蒸馏后的 Lens-Turbo 支持快速 4 步 生成。
https://huggingface.co/microsoft/Lens#galleryGallery
第 1 / 6 页 样本 000-005 Lens 图库样本 000 样本 000· 1440x1440 一份丰盛的经典英式炸鱼薯条,盛放在白纸上,金黄酥脆的啤酒面糊鳕鱼块搭配厚切薯条、柠檬角、一小碗豌豆泥,旁边放着麦醋瓶,木质酒吧桌,俯拍 Lens 图库样本 001 样本 001· 1440x1440 伦敦大本钟和议会大厦在金色黄昏中的标志性景象,泰晤士河反射着温暖的琥珀色光芒,前景是威斯敏斯特桥,一辆经典的红色双层巴士正在过桥,日落映照下戏剧性的云层 Lens 图库样本 002 样本 002· 1440x1440 从特罗卡德罗广场眺望黄昏中的埃菲尔铁塔,金属结构闪耀着成千上万闪烁的金色灯光,天空从深蓝渐变为紫色,前景的特罗卡德罗喷泉反射着金色光芒,漫步者的剪影 Lens 图库样本 003 样本 003· 1248x1664 一条水晶巨龙在极光天空中翱翔,整个身体由透明多面水晶构成,折射着绿色和紫色的极光,形成彩虹光谱,冰晶从翅膀上飘落,奇幻风格数字艺术 Lens 图库样本 004 样本 004· 1664x1248 云南元阳梯田日出时的鸟瞰图,成千上万层叠的水田反射着金色和粉色的天空色彩,晨雾在梯田层间缭绕,翠绿的山坡上散落着棕榈树,无人机摄影 Lens 图库样本 005 样本 005· 1664x1248 一只绿色鬣蜥栖息在热带雨林布满青苔的倒木上,每一片鳞片和脊柱都细节清晰,水珠挂在皮肤上,背景是模糊的瀑布和茂密的热带植被,国家地理野生动物摄影风格
第 2 / 6 页 样本 006-011 Lens 图库样本 006 样本 006· 1248x1664 文艺复兴时期贵族女性的油画肖像,身穿深蓝色天鹅绒长裙,佩戴珍珠耳坠,柔和的明暗对比光线衬托出细腻的肌肤,画面上有细裂纹纹理,维米尔风格 Lens 图库样本 007 样本 007· 1440x1440 一个手工蜂蜜罐,带有手绘复古植物标签,上面用棕色衬线活版印刷字体写着“Mountain Wildflower Honey”,附有装饰性花纹,周围是详细的野花、三叶草和蜜蜂的墨水画,牛皮纸标签贴在透明玻璃罐上 Lens 图库样本 008 样本 008· 1440x1440 水彩画肖像:一位沉思的年轻人在巴黎咖啡馆里读着一本破旧的皮面书,宽松的湿画法笔触融入温暖的琥珀色和焦赭色水彩,可见的纸张纹理 Lens 图库样本 009 样本 009· 1664x1248 探险家的橡木书桌,摊开一张旧世界地图,黄铜六分仪,皮革装订的航海日志上有手写记录,铜烛台上燃烧的蜡烛,散落的指南针和羽毛笔,温暖的窗光,静物摄影 Lens 图库样本 010 样本 010· 1664x1248 纽约中央车站地铁站,经典的站名“GRAND CENTRAL”用优雅的白色陶瓷马赛克字母镶嵌在深绿色瓷砖墙上,每个字母约八英寸高,华丽的瓷砖边框,可见轨道的 S 形曲线 Lens 图库样本 011 样本 011· 1664x1248 一只红喉蜂鸟悬停在一朵鲜红的蝎尾蕉花前,翅膀冻结成八字形图案,显现出虹彩羽毛的细节,鸟周围悬浮着单个水滴,高速微距摄影,深色背景
第 3 / 6 页 样本 012-017 Lens 图库样本 012 样本 012· 1664x1248 一台老式 Remington 打字机,一张米色纸卷在滚筒上,打出的字“Chapter One: The Beginning”以略微不均匀的 Courier 字体呈现,带有特征性的墨水密度变化,一些字母略有错位,温暖的台灯光线 Lens 图库样本 013 样本 013· 1664x1248 角马大迁徙在金色黄昏中穿越马拉河,数百只动物冲入翻滚的水中,水花四溅,河岸边尘土飞扬,戏剧性的逆光场景,国家地理纪录片风格 Lens 图库样本 014 样本 014· 1248x1664 一家迷人的花店橱窗,玻璃上手工绘制的白色草书写着“Fresh Flowers Daily”,带有装饰性笔触,透过字母可见桶中摆放的玫瑰和牡丹,早晨的阳光照在彩绘字母上 Lens 图库样本 015 样本 015· 1248x1664 一个蒸汽朋克风格的漂浮天空城市,建在巨大的齿轮驱动平台上,黄铜和铜塔通过链桥连接,蒸汽动力飞艇和热气球停靠在各个层面,城市下方是日落云层,详细的概念艺术 Lens 图库样本 016 样本 016· 1664x1248 新西兰米尔福德峡湾黎明时分,陡峭峡湾壁在如镜的水面上完美倒映,瀑布从千英尺高的悬崖上倾泻而下,晨雾弥漫在水面上,全景风光摄影 Lens 图库样本 017 样本 017· 1248x1664 一位印度婆罗多舞古典舞者以阿拉曼迪姿势起舞,青铜脚铃和精美的手印手势,华丽的丝绸服装搭配金色神庙首饰,在戏剧性舞台灯光下表演中被捕捉
第 4 / 6 页 样本 018-023 Lens 图库样本 018 样本 018· 1248x1664 马拉喀什古老麦地那的一条狭窄小巷,墙壁涂成鲜艳的钴蓝色,墙上挂着色彩缤纷的手工编织地毯和陶瓷盘,华丽的木门,上方温暖的阳光投射出戏剧性的阴影,摩洛哥建筑 Lens 图库样本 019 样本 019· 1664x1248 渔村码头上一块粗犷的木牌,上面用航海蓝色的手工雕刻字母写着“Fresh Catch of the Day”,粗麻绳穿过标牌作为边框,背景堆放着渔网和龙虾笼,海滨氛围 Lens 图库样本 020 样本 020· 1664x1248 海底一艘沉船,完全被色彩斑斓的珊瑚覆盖,鱼群穿过破损的船体和舷窗,阳光从水面投射下来,水下考古摄影 Lens 图库样本 021 样本 021· 1664x1248 张家界石柱山在日出时从云海中升起,金色阳光照亮砂岩峰林,超现实的阿凡达式悬浮山景观延伸到地平线,无人机航拍展现出巨大的垂直尺度 Lens 图库样本 022 样本 022· 1440x1440 一只红眼树蛙栖息在哥斯达黎加云雾森林中一朵鲜红的凤梨科植物上,其霓虹绿色的身体与蓝色条纹的侧腹和橙色的脚形成对比,光滑皮肤上的水珠,使用环形闪光灯的极端微距摄影 Lens 图库样本 023 样本 023· 1248x1664 巨型石灰岩洞穴内部,古老的钟乳石和石笋连接形成石柱,地下河流像镜子一样倒映着这些结构,柔和的温暖光线照亮了数百万年的矿物沉积物,洞穴探险摄影
第 5 / 6 页 样本 024-029 Lens 图库样本 024 样本 024· 1664x1248 一个褪色的 1960 年代加油站,路边大型招牌上以复古圆角无衬线字体写着“ROUTE 66 GAS & GO”,红白配色,前景是带模拟表盘的复古加油泵,旁边停着一辆经典雪佛兰,美国怀旧风 Lens 图库样本 025 样本 025· 1664x1248 建筑工地围栏上覆盖着未经授权的街头艺术,用红、黄、蓝多种重叠颜色的大型手写大写字母喷绘着“ART IS EVERYWHERE”,每个字母都有颜料滴落,混乱而美丽的城市画布 Lens 图库样本 026 样本 026· 1664x1248 俯拍锦鲤池,数十条色彩鲜艳(红、白、橙、金)的观赏锦鲤在清澈的翡翠绿水中游动,水面上漂浮着飘落的樱花花瓣,日式花园航拍 Lens 图库样本 027 样本 027· 1664x1248 拉萨布达拉宫在繁星下,银河拱桥横跨头顶,前景是藏式转经筒和酥油灯,散发出温暖的金色光芒,巨大的红白宫墙在月光下闪烁,夜间摄影 Lens 图库样本 028 样本 028· 1248x1664 黄石国家公园的大棱镜温泉,无人机正上方拍摄,由嗜热细菌形成的鲜艳蓝色、蓝绿色、绿色、黄色和橙色的同心环,水面上蒸汽升腾,抽象的自然色彩调色板 Lens 图库样本 029 样本 029· 1664x1248 一群非洲大象排成一线穿过稀树草原,身后是乞力马扎罗山的雪顶,金色夕阳下的尘土被大象的脚步扬起,形成朦胧的氛围,长焦野生动物摄影展现巨大尺度
第 6 / 6 页 样本 030-031
https://huggingface.co/microsoft/Lens#installationInstallation
测试环境: Python 3.12 · CUDA 12.6 · PyTorch 2.11.0+cu126 · TorchVision 0.26.0+cu126
`` conda create -n lens python=3.12 -y conda activate lens
uv pip install torch==2.11.0+cu126 torchvision==0.26.0+cu126
–index-url https://download.pytorch.org/whl/cu126
uv pip install -r requirements.txt
``
默认的 GPT-OSS 编码器和 FLUX.2 VAE 从 Hugging Face 加载。请确保你的环境有权限访问你使用的任何门控模型仓库。
https://huggingface.co/microsoft/Lens#checkpointsCheckpoints
通过传递其仓库 ID 给 --repo_id(命令行)或 LensPipeline.from_pretrained(...)(Python)来选择变体。
https://huggingface.co/microsoft/Lens#inferenceInference
重要: 从克隆的仓库根目录运行,以便
from lens import LensPipeline能解析到此包——导入lens会将LensGptOssEncoder/LensTransformer2DModel注册到transformers和diffusers命名空间中,这些命名空间被model_index.json引用。
Python API:
`` import torch from lens import LensPipeline
pipe = LensPipeline.from_pretrained( “microsoft/Lens”, torch_dtype=torch.bfloat16 ).to(“cuda”)
image = pipe( prompt=“A cat holding a sign that says "hello world"”, base_resolution=1440, aspect_ratio=“1:1”, num_inference_steps=20, guidance_scale=5.0, generator=torch.Generator(“cuda”).manual_seed(0), ).images[0] image.save(“lens.png”) ``
要牺牲速度换取显存,可将 .to("cuda") 替换为 pipe.enable_model_cpu_offload()。
命令行——基本用法:
python inference.py \ --repo_id "microsoft/Lens" \ --prompt "A cinematic mountain lake at sunrise, soft mist, detailed reflections" \ --base_resolution 1440 --aspect_ratio 1:1 \ --steps 20 --cfg 5.0 --n 1 --seed 42 \ --out ./outputs
批量生成——用 | 连接多个提示:
python inference.py \ --repo_id "microsoft/Lens" \ --steps 20 --cfg 5.0 \ --prompt "a red fox in snow|a glass greenhouse at night"
A100 / V100(无 MXFP4 内核)——将 GPT-OSS 编码器反量化到 bf16:
python inference.py \ --repo_id "microsoft/Lens" \ --steps 20 --cfg 5.0 \ --prompt "a cat" \ --disable_mxfp4 --offload
https://huggingface.co/microsoft/Lens#options选项
| 标志 | 描述 | 默认值 |
|---|---|---|
--repo_id | HF 仓库 ID(或本地路径),指向组装好的 Lens 流程 | microsoft/Lens |
--base_resolution | 1024 或 1440 | 1440 |
--aspect_ratio | 宽高比,可选:1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9、2:1 | 1:1 |
--steps | 去噪步数 | 20 |
--cfg | 无分类器指导尺度 | 5.0 |
--n | 每个提示生成的图像数量 | 1 |
--seed | 随机种子(省略则以非确定性模式运行) | — |
--out | 输出目录 | ./outputs |
--dtype | 计算精度:bfloat16、float16、float32 | bfloat16 |
--disable_mxfp4 | 将 GPT-OSS 文本编码器反量化到 --dtype(在 A100/V100 上必需;Hopper+ 默认保留 MXFP4 以减少显存) | — |
--offload | 启用 diffusers CPU 卸载(text_encoder->transformer->vae)以降低峰值显存 | — |
--reasoner | 在生成前使用加载的 GPT-OSS 编码器优化提示 | — |
--api_url/--api_key/--api_model | 使用 OpenAI 兼容 API 进行提示优化(优先级高于 --reasoner) | — |
https://huggingface.co/microsoft/Lens#citationCitation
@article{zhao2026lens, title = {Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models}, author = {Guo, Baining and Luo, Chong and Chen, Dong and Chen, Dongdong and Wei, Fangyun and Li, Ji and Bao, Jianmin and Zhang, Jiawei and Zhao, Jinjing and Shi, Lei and Yang, Qinhong and Zhang, Sirui and Wu, Xiuyu and Feng, Xuelu and Lu, Yan and Dong, Yanchen and Yue, Yang and Wang, Yitong and Chen, Yunuo and Liang, Zhiyang and Wan, Ziyu}, journal = {arXiv preprint arXiv:2605.21573}, year = {2026} }
https://huggingface.co/microsoft/Lens#responsible-aiResponsible AI
该模型仅用于研究目的,不适用于产品或服务部署。负责任的 AI 考量贯穿了开发过程,包括数据选择、模型训练和评估。训练数据包含公开、授权和内部数据集的组合,这些数据经过处理,尽可能移除可明确识别个人信息并减少有害内容。然而,由于数据主要来自网络规模的集合,它可能包含偏见或不均匀的代表性。因此…
相似文章
microsoft/Lens-Turbo
微软发布了Lens,一个拥有38亿参数的基础文本到图像模型,具备高效的训练和快速的高分辨率生成能力,采用密集字幕预训练和混合分辨率学习。
@HuggingPapers:微软刚刚在Hugging Face上发布了Lens,一个38亿参数的文本到图像模型,提供高效训练和高…
微软在Hugging Face上发布了Lens,一个38亿参数的文本到图像模型,支持高效训练和高达1440×1440的高分辨率生成。
Lens:重新思考基础文本到图像模型的训练效率
Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。
microsoft/Mage-Flow
Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。
三个开源图像模型,一个平台。Microsoft Foundry 和 Hugging Face 为开发者带来的最大目录 f…
Microsoft Foundry 通过 Hugging Face 集成了三个开源图像模型(SDXL、FLUX.1-schnell 和 Z-Image-Turbo),为开发者提供了一个统一的 AI 图像生成平台。