文本到图像个性化模型中的潜在身份调优
摘要
本文提出了一种在文本到图像个性化模型中进行细粒度身份调优的方法。它探索了冻结编码器的潜在空间,以实现无需额外训练的局部、语义一致的面部编辑。
查看缓存全文
缓存时间: 2026/07/14 12:14
论文页面 - 文本到图像个性化模型中的潜在身份微调
来源:https://huggingface.co/papers/2607.11885
摘要
生成和编辑人脸需要极高的精度,因为即使是微小的修改也可能显著改变被识别主体的身份感知。然而,当前基于通用文本到图像模型构建的个性化与编辑方法,往往缺乏精细面部编辑所需的精度。我们提出了一种用于文本到图像个性化模型的细粒度身份微调方法。与在给定图像上操作的标准图像编辑不同,身份微调会修改特定身份的潜在表示,从而能够生成多样化的、一致呈现同一编辑后身份的图像。为了实现细粒度的潜在身份微调,我们探索了一个预训练冻结编码器用于文本到图像个性化的潜在空间。我们的方法无需额外训练——它利用冻结编码器的现有架构来发现潜在的语义方向。这个空间由一组潜在标记组成,这些标记在捕捉身份的不同方面扮演不同角色,并且通常对应特定的空间或语义面部区域。我们证明,在这个空间以及由选定标记定义的子空间内可以识别出有意义的语义方向,从而实现局部、细粒度且语义一致的编辑。我们通过定性和定量实验验证了该方法,展示了多样化的局部面部编辑,同时保持了跨图像的身份一致性。项目页面:https://garibida.github.io/IdentityTuning/
查看 arXiv 页面 (https://arxiv.org/abs/2607.11885) 查看 PDF (https://arxiv.org/pdf/2607.11885) 项目页面 (https://garibida.github.io/IdentityTuning/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11885)
引用该论文的模型0
没有模型链接该论文
请在模型的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。
引用该论文的数据集0
没有数据集链接该论文
请在数据集的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。
引用该论文的 Space0
没有 Space 链接该论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。
包含该论文的收藏集0
没有包含该论文的收藏集
请将该论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。
相似文章
InsightTok:在离散标记化中提升文本与人脸保真度以改进自回归图像生成
InsightTok 引入内容感知的感知损失,改进离散视觉标记化以更好地重建文本和人脸,从而提升自回归图像生成质量。
自我识别微调可以预防和逆转涌现性对齐失调
本文提出自我识别微调作为一种干预措施,用于预防和逆转大语言模型中的涌现性对齐失调,表明它稳定了模型的对齐特征,而非采用失调的角色。
TextLDM:利用连续潜在扩散进行语言建模
本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。
LATTE: 预测同侪锚定的偏好轨迹以实现个性化LLM生成
Latte 提出了一种框架,将个性化表示为通过潜在轨迹预测同侪锚定的相对偏好状态,并向冻结的LLM注入一个软令牌以实现个性化生成。在Amazon Reviews 2023和MemoryCD数据集上,它优于现有的个性化方法。
从方向到幅度:多模态指令调优如何重新组织Transformer隐藏状态中身份指定提示的几何编码
本文研究了多模态指令调优如何重新组织Transformer隐藏状态中身份指定提示的几何编码,发现指令调优后编码从基于方向转变为基于幅度。