文本到图像个性化模型中的潜在身份调优
摘要
本文提出了一种在文本到图像个性化模型中进行细粒度身份调优的方法。它探索了冻结编码器的潜在空间,以实现无需额外训练的局部、语义一致的面部编辑。
查看缓存全文
缓存时间: 2026/07/14 12:14
论文页面 - 文本到图像个性化模型中的潜在身份微调
来源:https://huggingface.co/papers/2607.11885
摘要
生成和编辑人脸需要极高的精度,因为即使是微小的修改也可能显著改变被识别主体的身份感知。然而,当前基于通用文本到图像模型构建的个性化与编辑方法,往往缺乏精细面部编辑所需的精度。我们提出了一种用于文本到图像个性化模型的细粒度身份微调方法。与在给定图像上操作的标准图像编辑不同,身份微调会修改特定身份的潜在表示,从而能够生成多样化的、一致呈现同一编辑后身份的图像。为了实现细粒度的潜在身份微调,我们探索了一个预训练冻结编码器用于文本到图像个性化的潜在空间。我们的方法无需额外训练——它利用冻结编码器的现有架构来发现潜在的语义方向。这个空间由一组潜在标记组成,这些标记在捕捉身份的不同方面扮演不同角色,并且通常对应特定的空间或语义面部区域。我们证明,在这个空间以及由选定标记定义的子空间内可以识别出有意义的语义方向,从而实现局部、细粒度且语义一致的编辑。我们通过定性和定量实验验证了该方法,展示了多样化的局部面部编辑,同时保持了跨图像的身份一致性。项目页面:https://garibida.github.io/IdentityTuning/
查看 arXiv 页面 (https://arxiv.org/abs/2607.11885) 查看 PDF (https://arxiv.org/pdf/2607.11885) 项目页面 (https://garibida.github.io/IdentityTuning/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11885)
引用该论文的模型0
没有模型链接该论文
请在模型的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。
引用该论文的数据集0
没有数据集链接该论文
请在数据集的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。
引用该论文的 Space0
没有 Space 链接该论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2607.11885,以便从此页面链接。
包含该论文的收藏集0
没有包含该论文的收藏集
请将该论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以便从此页面链接。
相似文章
定位与控制大型语言模型中的隐式个性化
本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。
InsightTok:在离散标记化中提升文本与人脸保真度以改进自回归图像生成
InsightTok 引入内容感知的感知损失,改进离散视觉标记化以更好地重建文本和人脸,从而提升自回归图像生成质量。
无权重微调:通过Logit空间传输实现LLM个性化
本文介绍了无权重微调(WFT),一种无需训练的解码时方法,通过logit空间传输近似监督微调效果,以不到7%的计算量实现了具有竞争力的个性化性能。
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
自我识别微调可以预防和逆转涌现性对齐失调
本文提出自我识别微调作为一种干预措施,用于预防和逆转大语言模型中的涌现性对齐失调,表明它稳定了模型的对齐特征,而非采用失调的角色。