文本到图像个性化模型中的潜在身份调优

Hugging Face Daily Papers 论文

摘要

本文提出了一种在文本到图像个性化模型中进行细粒度身份调优的方法。它探索了冻结编码器的潜在空间,以实现无需额外训练的局部、语义一致的面部编辑。

生成和编辑人脸需要高精度,因为即使是微小的修改也可能显著改变对象的感知身份。然而,当前基于通用文本到图像模型的个性化和编辑方法往往缺乏细粒度面部编辑所需的精度。我们提出了一种在文本到图像个性化模型中进行细粒度身份调优的方法。与标准图像编辑不同,标准图像编辑对给定图像进行操作,而身份调优修改特定身份的潜在表示,从而能够生成一致描绘同一编辑身份的多样化图像。为了实现细粒度的潜在身份调优,我们探索了用于文本到图像个性化的预训练冻结编码器的潜在空间。我们的方法不需要额外训练。相反,它利用冻结编码器的现有架构来揭示潜在的语义方向。该空间由一组潜在标记组成,这些标记在捕捉身份的不同方面中扮演不同角色,并且通常对应于特定的空间或语义面部区域。我们表明,在这个空间内以及由选定标记定义的子空间内可以识别出有意义的语义方向,从而实现局部、细粒度且语义一致的编辑。我们通过定性和定量实验验证了我们的方法,这些实验展示了多样化的局部面部编辑,同时保持了跨图像的身份一致性。项目页面:https://garibida.github.io/IdentityTuning/
查看原文
查看缓存全文

缓存时间: 2026/07/14 12:14

论文页面 - 文本到图像个性化模型中的潜在身份微调

来源:https://huggingface.co/papers/2607.11885

摘要

生成和编辑人脸需要极高的精度,因为即使是微小的修改也可能显著改变被识别主体的身份感知。然而,当前基于通用文本到图像模型构建的个性化与编辑方法,往往缺乏精细面部编辑所需的精度。我们提出了一种用于文本到图像个性化模型的细粒度身份微调方法。与在给定图像上操作的标准图像编辑不同,身份微调会修改特定身份的潜在表示,从而能够生成多样化的、一致呈现同一编辑后身份的图像。为了实现细粒度的潜在身份微调,我们探索了一个预训练冻结编码器用于文本到图像个性化的潜在空间。我们的方法无需额外训练——它利用冻结编码器的现有架构来发现潜在的语义方向。这个空间由一组潜在标记组成,这些标记在捕捉身份的不同方面扮演不同角色,并且通常对应特定的空间或语义面部区域。我们证明,在这个空间以及由选定标记定义的子空间内可以识别出有意义的语义方向,从而实现局部、细粒度且语义一致的编辑。我们通过定性和定量实验验证了该方法,展示了多样化的局部面部编辑,同时保持了跨图像的身份一致性。项目页面:https://garibida.github.io/IdentityTuning/

查看 arXiv 页面 (https://arxiv.org/abs/2607.11885) 查看 PDF (https://arxiv.org/pdf/2607.11885) 项目页面 (https://garibida.github.io/IdentityTuning/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11885)

引用该论文的模型0

没有模型链接该论文

请在模型的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。

引用该论文的数据集0

没有数据集链接该论文

请在数据集的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。

引用该论文的 Space0

没有 Space 链接该论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。

包含该论文的收藏集0

没有包含该论文的收藏集

请将该论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。

相似文章

TextLDM:利用连续潜在扩散进行语言建模

Hugging Face Daily Papers

本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。

LATTE: 预测同侪锚定的偏好轨迹以实现个性化LLM生成

arXiv cs.CL

Latte 提出了一种框架,将个性化表示为通过潜在轨迹预测同侪锚定的相对偏好状态,并向冻结的LLM注入一个软令牌以实现个性化生成。在Amazon Reviews 2023和MemoryCD数据集上,它优于现有的个性化方法。