Alissonerdx/LTX-Best-Face-ID
摘要
一个用于LTX-2(22B)的LoRA,通过重叠参考条件化、TASS-RoPE和ArcFace身份损失实现身份保持的参考到视频生成,可通过BFS节点在ComfyUI中使用。
查看缓存全文
缓存时间: 2026/07/10 18:09
Alissonerdx/LTX-Best-Face-ID · Hugging Face
来源:https://huggingface.co/Alissonerdx/LTX-Best-Face-ID
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#ltx-best-face-id–ltx-2-identity-lora-reference-to-video–ipt2vLTX-Best-Face-ID — LTX-2 Identity LoRA(参考到视频 / IPT2V)
这是一个用于LTX-2 (22B) 的、保持身份的参考到视频LoRA。提供一张人物的参考照片 + 一段文本提示词,它就能生成一段视频,并保持该人物的身份。
基于重叠参考条件化 + TASS-RoPE(源相位RoPE) 以及可微分的ArcFace身份损失构建。在ComfyUI中通过配套的BFS Nodes运行。
状态: 现在有两种参考模式来自同一个配方:原始的面部特写参考,以及较新的角色表参考(面部 + 全身视图),还携带了服装/外观一致性——参见下面的Character-Sheet Reference(https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#character-sheet-reference-new)。其他实验性变体(原生Gemma视觉条件化、时间步分割纹理注入)如果验证有效,可能会在后续发布。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#%F0%9F%8E%AC-examples🎬 示例
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#with-2-pass-upscaled带2遍升频(放大)
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#what-it-does功能
- 参考到视频(ref_t2v): 一张参考图像 → 该身份执行提示词中动作的视频。
- 身份通过将参考潜变量放置在目标的第0帧RoPE网格(重叠)中,并为其标记一个独特的源相位,使模型知道它是一个参考,而不是要生成的第一帧。
- 一个辅助的ArcFace面部相似度损失作用于解码后的预测,使身份更加清晰。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#how-it-works-technique工作原理(技术细节)
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#overlap-reference–tass-rope-source-phase重叠参考 + TASS-RoPE(源相位)
参考潜变量被拼接(concatenate)到共享第0帧网格的视频序列中(经典的IC-LoRA“重叠”)。为了防止参考泄漏到/与生成的第一帧混淆,每个源都会获得一个不同的乘法RoPE相位:
phase[d] = source_id · phase_scale · θ^(−d/L) (θ = 10000) 目标token: source_id = 0 (phase 0, exact no-op) 参考: source_id = 2 (distinct rotary "tag")
这个“源标签”让模型能够区分序列中谁是谁,并显著提高身份迁移效果。由于该标签是位置性的,相同的机制可以推广到多个参考(source_id = 2, 3, 4, …),用于多主题条件化。
TASS-RoPE(时间相邻空间移位RoPE)来自ST-DRC,Chen等人,《时空解耦参考条件化用于保持身份的文生视频》——arXiv:2606.02441 (https://arxiv.org/abs/2606.02441)。该LoRA使用了该思想的一种重叠 + 每源RoPE相位变体。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#arcface-identity-lossArcFace身份损失
在训练过程中,流匹配预测被解码为像素,面部被对齐并通过ArcFace(buffalo_l中的w600k_r50)处理,然后一个余弦身份损失将生成的面部拉向参考嵌入——与用于评估身份的同一个识别空间。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#character-sheet-reference-new角色表参考(新功能)
上面的基础模型(以及更下方的指导)是在面部特写裁剪上训练的——这对身份很好,但模型从未见过人物的实际服装或身体,因此它必须发明一套装扮,而不是重现特定的服装。
我们随后训练了一个延续检查点,使用角色表参考:一张包含并排4个面板的图像——一个面部特写,然后是同一个人的正面/侧面/背面全身视图,全部在白色背景上。它使用完全相同的机制(source_id=2,layout=overlap)——只是一个不同、更丰富的参考图像,因此模型学会重现参考的服装和体型,而不仅仅是面部。
此检查点从上面的面部特写FaceID LoRA继续训练,而不是替换它——在我们的测试中,组合(面部特写身份基础 + 角色表延续)比单独使用任何一种配方都产生了明显更好且更一致的结果。如果你只有一张普通的头部照片,原始的面部特写模型仍然效果良好;角色表检查点适用于你希望生成的视频也匹配特定服装/体型的情况。
文件:Best_FaceID_CharacterSheet_v1.0_LoRA.safetensors (https://huggingface.co/Alissonerdx/LTX-Best-Face-ID/blob/main/Best_FaceID_CharacterSheet_v1.0_LoRA.safetensors)——像上面的基础LoRA一样使用(相同节点,相同source_id=2/layout=overlap),只需将参考图像替换为4面板角色表而不是头部照片,并将ref_resize_mode设置为native_resolution(见下文)。此检查点没有ArcFace投影器——其身份/外观完全来自重叠参考潜变量,因此将该下拉菜单保留为None。
💡**身份输出较弱?**将基础
Best_FaceID_v1.0_LoRA.safetensors(https://huggingface.co/Alissonerdx/LTX-Best-Face-ID/blob/main/Best_FaceID_v1.0_LoRA.safetensors)与此LoRA以较低的强度(约0.2或更高)一起加载——混合一些基础面部特写LoRA可以加强身份,同时角色表LoRA继续处理服装/身体。
**如何构建角色表(现阶段):**获取(或生成)一张普通的参考照片,然后使用ChatGPT(或其他图像编辑模型,例如Nano-Banana)并配上这个提示词:
“将照片中的人物转换为一张角色参考表,从左到右排列四个面板:面部特写,然后是正面、侧面和背面的全身视图,放在白色背景上。”
完整说明(较长的提示词变体、注意事项)见character_sheet_prompt.md (https://huggingface.co/Alissonerdx/LTX-Best-Face-ID/blob/main/character_sheet_prompt.md)。
🛠️ 我们正在训练一个专用的Flux Klein 9B LoRA来直接生成这些角色表(更一致,无需API)——**仍在训练中,尚未发布。**在发布之前,请使用上述提示词配合ChatGPT/gpt-image以获得最忠实于原始角色的角色表。
与面部特写模型的使用区别:角色表参考必须精确为1536×1024——这是它训练时的固定分辨率,与输出视频的分辨率无关。当在此检查点上使用LTX Identity Transfer节点时,请将**ref_resize_mode设置为native_resolution**(不是默认的match_target)——否则节点会将角色表缩小到视频的分辨率,从而破坏模型所依赖的面部/服装细节。这个设置对于普通面部特写参考无关紧要,因为参考和视频共享相同的分辨率桶。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#character-sheet-examples角色表示例
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#training-details训练细节
基础模型|LTX-2 (22B)
方法|LoRA(秩128,alpha 128)
条件化|重叠参考潜变量 + TASS-RoPE源相位(source_id=2,phase_scale=1.0)
辅助损失|ArcFace身份损失(+ 时序身份一致性)
数据|参考图像 ↔ 视频对(OpenS2V子集 + HuMoSet),特写/正面身份
角色表延续|相同配方,从面部特写检查点继续训练,使用4面板角色表参考(面部 + 正面/侧面/背面)
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#reference-image–what-works-best参考图像——什么效果最好
该模型是在以面部为中心的参考图像上训练的。查看训练数据,每个参考都遵循相同的模式:
- 特写/半身裁剪——大约胸部以上,面部巨大且清晰可见。
- 单个主体,居中在画面中。
- 正面或接近正面(轻微的3/4角度没问题,但面部总是充分曝光)。
- 紧密裁剪在面部/上半身——训练裁剪大约是460×406(接近正方形)。
建议:为了获得最佳的身份迁移效果,给模型提供一个看起来像这样的参考——将图像裁剪到面部/上半身。全身镜头、广角镜头或面部很小且距离较远的图像效果明显较差,因为模型在训练期间从未见过这样的参考。
简而言之:干净、正面、光线良好的面部特写是最理想的参考。
**使用全身参考代替?**请参阅上面的Character-Sheet Reference (https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#character-sheet-reference-new)——本页面上的特写指导专门针对基础检查点。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#captions-important标题(重要)
该模型是在**ref_t2v:格式的标题上训练的,这些标题描述场景和人物的动作**(不仅仅是“一个人”)。在LTX中,身份强烈受提示词驱动——提示词描述得越多,身份保持得越好。为获得最佳效果:
- 在提示词前加上**
ref_t2v:**。 - 用现在进行时描述动作、场景、取景、摄像机。
- 描述参考人物的身份属性(肤色、头发、眼睛、面部毛发、眼镜、脸型)能显著改善结果。
共享的ComfyUI工作流包含一个提示词增强器,它会查看参考图像(通过模型自身的多模态Gemma-3文本编码器)并自动用该人物的身份属性丰富你的提示词——这样你就不必手动描述它们。
示例(增强后):
ref_t2v: 一个浅肤色、深棕色长发及肩、戴着窄长方形金属框眼镜、浅蓝灰色眼睛、有轻微胡茬的男人,在洗衣房里叠衣服,中景镜头。他把叠好的衣服放进篮子里,然后端着篮子穿过房间。中性室内光线,简单的居家环境。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#usage-comfyui使用方式(ComfyUI)
**需要BFS Nodes:**https://github.com/alisson-anjos/ComfyUI-BFSNodes
- 安装ComfyUI-BFSNodes(ComfyUI Manager → 通过Git URL安装,或克隆到
custom_nodes/)。依赖项(insightface、transformers等)会自动安装。 - 像往常一样加载LTX-2(检查点 + Gemma-3文本编码器/CLIP)。
- 添加LTX Identity Transfer(重叠 + 源相位)节点;向它输入参考图像。使用了角色表检查点?将**
ref_resize_mode设置为native_resolution**(参见Character-Sheet Reference (https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#character-sheet-reference-new))。 - 在MODEL路径上加载此LoRA。
- 使用共享的工作流(它将提示词增强器 → 身份节点 → 采样器连接在一起)。
模型旁边附带了一个现成的工作流JSON。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#about-the-arcface-projector-optional–you-dont-need-it关于ArcFace投影器(可选——不需要它)
身份节点有一个可选的ArcFace投影器下拉菜单(它将面部嵌入投影为额外的条件化token)。你可以将它保留为None。在我们的实验中,投影器的效果微乎其微——身份几乎完全由重叠参考潜变量(和提示词)承载,因此投影器在上层添加的内容很少,此模型不需要它。它仅作为可选的额外功能保留;跳过它可以简化图,而不会有明显的质量损失。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#tips-for-best-results获得最佳结果的技巧
- 使用干净、正面、光线良好的面部特写作为参考——身份质量与参考质量息息相关。还需要服装/体型一致性?请使用角色表检查点 (https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#character-sheet-reference-new) 而不是普通的特写。
- 让提示词增强器添加身份属性(或自己编写)。
- 保持参考取景简单;杂乱/有遮挡的参考面部会降低身份质量。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#limitations局限性
- **第一帧/“遮罩”倾向:**由于身份来自原始的参考潜变量,参考的外观(以及取景和眼镜等配饰)可能会部分复制到视频中——看起来像是参考被“粘贴”/遮罩,而不是新生成的。使用干净的正脸参考和修剪第一帧节点可以缓解这个问题。
- **依赖提示词:**当提示词描述人物时,身份要强得多。空洞、通用的提示词会导致身份较弱——请使用提示词增强器。
- **特写偏差(基础检查点):**基础训练数据偏向特写/正面面孔,因此使用基础检查点时,全身镜头或大角度镜头保持身份的效果较差——对于这些情况,请改用角色表检查点。
- **指标注意事项:**ArcFace相似度在面部较小/转向/被遮挡的情况下不可靠——请通过肉眼判断,而不仅仅是依据分数。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#citation引用
如果你使用此模型,请引用基础模型和技术:
@misc{ltx_best_face_id, title = {LTX-Best-Face-ID: LTX-2 Identity LoRA (Reference-to-Video)}, author = {Alissonerdx}, year = {2026}, howpublished = {\url{https://huggingface.co/Alissonerdx/LTX-Best-Face-ID}} }
- **基础模型:**LTX-2(Lightricks)。
- TASS-RoPE / 参考条件化——ST-DRC:
@article{chen2026stdrc, title = {Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation}, author = {Chen, Yuheng and Hu, Teng and Wang, Yuji and He, Qingdong and Ma, Lizhuang and Zhang, Jiangning}, journal = {arXiv preprint arXiv:2606.02441}, year = {2026} }
- **身份损失:**ArcFace(Deng等人,2019)通过InsightFace的
buffalo_l。 - **工具:**ComfyUI-BFSNodes (https://github.com/alisson-anjos/ComfyUI-BFSNodes)。
https://huggingface.co/Alissonerdx/LTX-Best-Face-ID#acknowledgements致谢
基于LTX-2训练。身份监督通过InsightFace ArcFace。ComfyUI集成通过BFS Nodes。
相似文章
Lightricks/LTX-2.3-22b-IC-LoRA-LipDub
这个Hugging Face模型页面介绍了一个基于LTX-2.3-22b训练的IC-LoRA,用于唇语同步配音,包含项目页面、论文和推理流程。
Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt
一个用于LTX-Video 2.3的概念验证型上下文LoRA适配器,能够通过固定词汇提示从新相机视角重新渲染视频场景,基于合成多视角数据训练而成。
LiconStudio/Ltx2.3-VBVR-lora-I2V
LiconStudio 发布了一个针对 LTX-2.3 的 LoRA 适配器,该适配器在 VBVR 数据集上进行了微调,以增强视频生成能力,改善提示理解、运动动态和时间一致性,用于复杂的视频推理任务。
TenStrip/LTX2.3-10Eros
本文介绍了 TenStrip/LTX2.3-10Eros,这是一款托管在 Hugging Face 上的微调 AI 视频模型,旨在提升图像到视频生成的效果及对提示词的遵循度。文章提供了有关文件格式、与 ComfyUI 节点的兼容性以及实现最佳效果的特定提示词策略等技术细节。
fal/LTX-2.3-3DREAL-LoRA
针对LTX-2.3的LoRA适配器,能将粗糙的3D视口动画(来自Blender、游戏引擎)转换为逼真的视频,同时保留构图和相机运动。