Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt
摘要
一个用于LTX-Video 2.3的概念验证型上下文LoRA适配器,能够通过固定词汇提示从新相机视角重新渲染视频场景,基于合成多视角数据训练而成。
查看缓存全文
缓存时间: 2026/07/16 22:24
Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt · Hugging Face
来源: https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#ltx-video-23-22b–ic-lora-crossview-prompt-v09LTX-Video 2.3 22B — IC-LoRA:CrossView Prompt v0.9
一个针对 LTX-Video 2.3(22B)微调后的上下文内 LoRA(IC-LoRA)适配器,其作用相当于虚拟的第二台摄像机:给它提供一段参考视频和一个简短的摄像机角度提示词,它就能从请求的新视角重新渲染同一场景,保持主体和内容不变,仅改变摄像机的位置。
v0.9 — 概念验证版。 在合成多视角数据上训练;可泛化至真实视频素材,但存在明显限制(参见限制部分)。欢迎提供反馈。
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#example-outputs示例输出
每个视频展示了参考视频(上方)和生成的摄像机新视角(下方),以及对应的提示词。
提示词 crossview. new camera angle: to the right, lower, closer.
提示词 crossview. new camera angle: to the right, lower, further.
提示词 crossview. new camera angle: to the right, lower, closer.
提示词 crossview. new camera angle: to the left, higher, further.
提示词 crossview. new camera angle: to the left, higher, further.
提示词 crossview. new camera angle: to the left, higher, further.
提示词 crossview. new camera angle: to the left, higher, closer.
提示词 crossview. new camera angle: to the left, higher, further.
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#usage-comfyui使用方式(ComfyUI)
我仅在 ComfyUI 中测试过此 LoRA,使用视频到视频(IC-LoRA)工作流。示例工作流在此:https://huggingface.co/datasets/Cseti/ComfyUI-Workflows/blob/main/ltx/2.3/ic-lora-crossview-v1-pilot/README.md
工作原理:
- 加载
LTX2.3-22B_IC-LoRA-CrossView-Prompt_v0.9_13700.safetensors作为 LoRA。 - 提供一段参考视频——你想从新角度重新拍摄的场景。
- 提供一个摄像机角度提示词(参见下方词汇表)。无需起始图像。
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#prompt-vocabulary-important提示词词汇表(重要)
与自由文本 LoRA 不同,此模型基于固定、离散的摄像机词汇表进行训练。每个提示词必须以触发词 crossview. 开头,后接模板:
crossview. new camera angle: {方位角}, {仰角}, {距离}.
| 轴 | 允许的短语 |
|---|---|
| 方位角(围绕主体旋转) | same angle · slightly to the left · slightly to the right · to the left · to the right · far to the left · far to the right |
| 仰角(摄像机高度) | lower · same height · higher |
| 距离(与主体距离) | closer · same distance · further |
- left / right = 新摄像机向该侧围绕主体移动。
- higher = 摄像机从上方向下看;lower = 从下方向上仰视。
- closer / further = 摄像机与主体的距离。
所有 63 种有效组合均列于 captions_all_63.txt(https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt/blob/main/captions_all_63.txt)。请使用这些精确短语——该模型专门学习了此词汇表,因此同义词(如“向左45度”、“稍微向左”)效果不太可靠。
示例提示词:
crossview. new camera angle: to the right, lower, closer.
crossview. new camera angle: to the left, higher, further.
crossview. new camera angle: same angle, same height, closer.
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#tips使用技巧
- 角度大小与链式操作: 该模型在小幅度、单步角度变化时最可靠。若需要较大的视角偏移,建议分若干小步链式操作——将生成的视角作为新的参考视频反馈回去,再施加另一个小角度变化。
- 完整提示词列表: 训练此模型所用的每个提示词均列于
captions_all_63.txt(https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt/blob/main/captions_all_63.txt)——请使用这些精确短语。 - 蒸馏模型: 该 LoRA 在完整(非蒸馏)LTX-2.3 上训练。在蒸馏的少步工作流中效果较弱——可尝试将 LoRA 强度设为 1.2–1.5,和/或在第一次(非蒸馏)推理中运行。
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#training-details训练细节
此 IC-LoRA 在 RunPod 云 GPU(https://runpod.io/?ref=vpp0cion)(NVIDIA RTX PRO 6000 Blackwell,96 GB)上训练。
| 参数 | 值 |
|---|---|
| 基础模型 | LTX-Video 2.3 (22B) |
| 训练框架 | ltx-trainer (Lightricks) |
| 训练策略 | IC-LoRA(灵活,参考条件化) |
| 发布检查点 | step 13,700(12k 线性 + 1.7k 热启动延续) |
| LoRA rank / alpha | 16 / 16 |
| 目标模块 | attn1, attn2 (to_k/q/v/out) — 仅注意力层 |
| 优化器 | AdamW — 2e-4 线性衰减(主训练),1e-4 恒定(延续训练) |
| 时间步采样 | 均匀 sigma [0.4, 1.0] |
| 混合精度 | bf16 |
| 批次大小 | 1(启用梯度检查点) |
| 条件化 | reference p=1.0 + first_frame p=0.2 |
| 训练数据集 | 294 对 |
| 分辨率 | 768x768x81 @ 15fps |
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#dataset数据集
训练于 SynCamVideo(https://huggingface.co/datasets/KlingTeam/SynCamVideo-Dataset)(KlingTeam,Apache-2.0)——在 Unreal Engine 5 中渲染的合成多摄像机数据集,每个场景在主体周围的半球上采样 10 个静态摄像机。精选了 294 对参考/目标摄像机对,并在描述词汇表中保持平衡:
| 方位角区间 | 对数量 |
|---|---|
| same angle | 42 |
| slightly to the left / right | 42 / 42 |
| to the left / right | 42 / 42 |
| far to the left / right | 42 / 42 |
仰角和距离在每个方位角区间内大致均匀混合。描述仅包含摄像机角度差异(无场景描述)。
训练此 LoRA 所用的精确配对、描述和视频片段已作为配套数据集发布:CrossView Prompt Dataset(https://huggingface.co/datasets/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt-Dataset)。
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#limitations限制
- 视角范围: 训练摄像机的前方扇区(最大约 ±60° 方位角)——“从背后看”的视角超出范围。
- 蒸馏模型: 在蒸馏的少步模型上效果较弱(参见使用技巧)。
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#license许可
此 LoRA 根据 Apache License 2.0 发布。它完全使用 SynCamVideo(https://huggingface.co/datasets/KlingTeam/SynCamVideo-Dataset)数据集进行训练,该数据集本身也采用 Apache-2.0 许可,因此训练数据对此适配器不施加额外限制,可在此相同宽松条款下发布。
注意:使用此 LoRA 需要 LTX-Video 2.3 基础模型,该模型受其自身许可约束——请另行查阅 Lightricks 关于基础权重的条款。
https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#support支持
制作和分享此类开源工作需要租用云 GPU,这会迅速增加成本。如果您觉得它有用并希望我继续贡献,您的支持将非常感谢:
Ko-fi(https://ko-fi.com/chetyart)
Liberapay(https://liberapay.com/chetyart/donate)
相似文章
LiconStudio/Ltx2.3-VBVR-lora-I2V
LiconStudio 发布了一个针对 LTX-2.3 的 LoRA 适配器,该适配器在 VBVR 数据集上进行了微调,以增强视频生成能力,改善提示理解、运动动态和时间一致性,用于复杂的视频推理任务。
fal/LTX-2.3-3DREAL-LoRA
针对LTX-2.3的LoRA适配器,能将粗糙的3D视口动画(来自Blender、游戏引擎)转换为逼真的视频,同时保留构图和相机运动。
Lightricks/LTX-2.3-22b-IC-LoRA-LipDub
这个Hugging Face模型页面介绍了一个基于LTX-2.3-22b训练的IC-LoRA,用于唇语同步配音,包含项目页面、论文和推理流程。
Alissonerdx/LTX-Best-Face-ID
一个用于LTX-2(22B)的LoRA,通过重叠参考条件化、TASS-RoPE和ArcFace身份损失实现身份保持的参考到视频生成,可通过BFS节点在ComfyUI中使用。
Video2LoRA: 视觉-语言模型的参数化视频内化
本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。