Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt

Hugging Face Models Trending 模型

摘要

一个用于LTX-Video 2.3的概念验证型上下文LoRA适配器,能够通过固定词汇提示从新相机视角重新渲染视频场景,基于合成多视角数据训练而成。

标签:视频生成, LoRA, IC-LoRA, LTX-Video, 新视角合成, 相机视角, Lightricks, base_model:Lightricks/LTX-2.3, base_model:adapter:Lightricks/LTX-2.3, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/16 22:24

Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt · Hugging Face

来源: https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#ltx-video-23-22b–ic-lora-crossview-prompt-v09LTX-Video 2.3 22B — IC-LoRA:CrossView Prompt v0.9

一个针对 LTX-Video 2.3(22B)微调后的上下文内 LoRA(IC-LoRA)适配器,其作用相当于虚拟的第二台摄像机:给它提供一段参考视频和一个简短的摄像机角度提示词,它就能从请求的新视角重新渲染同一场景,保持主体和内容不变,仅改变摄像机的位置。

v0.9 — 概念验证版。 在合成多视角数据上训练;可泛化至真实视频素材,但存在明显限制(参见限制部分)。欢迎提供反馈。

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#example-outputs示例输出

每个视频展示了参考视频(上方)和生成的摄像机新视角(下方),以及对应的提示词。

提示词 crossview. new camera angle: to the right, lower, closer.
提示词 crossview. new camera angle: to the right, lower, further.
提示词 crossview. new camera angle: to the right, lower, closer.
提示词 crossview. new camera angle: to the left, higher, further.
提示词 crossview. new camera angle: to the left, higher, further.
提示词 crossview. new camera angle: to the left, higher, further.
提示词 crossview. new camera angle: to the left, higher, closer.
提示词 crossview. new camera angle: to the left, higher, further.

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#usage-comfyui使用方式(ComfyUI)

我仅在 ComfyUI 中测试过此 LoRA,使用视频到视频(IC-LoRA)工作流。示例工作流在此:https://huggingface.co/datasets/Cseti/ComfyUI-Workflows/blob/main/ltx/2.3/ic-lora-crossview-v1-pilot/README.md

工作原理:

  • 加载 LTX2.3-22B_IC-LoRA-CrossView-Prompt_v0.9_13700.safetensors 作为 LoRA。
  • 提供一段参考视频——你想从新角度重新拍摄的场景。
  • 提供一个摄像机角度提示词(参见下方词汇表)。无需起始图像。

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#prompt-vocabulary-important提示词词汇表(重要)

与自由文本 LoRA 不同,此模型基于固定、离散的摄像机词汇表进行训练。每个提示词必须以触发词 crossview. 开头,后接模板:

crossview. new camera angle: {方位角}, {仰角}, {距离}.
允许的短语
方位角(围绕主体旋转)same angle · slightly to the left · slightly to the right · to the left · to the right · far to the left · far to the right
仰角(摄像机高度)lower · same height · higher
距离(与主体距离)closer · same distance · further
  • left / right = 新摄像机向该侧围绕主体移动。
  • higher = 摄像机从上方向下看;lower = 从下方向上仰视。
  • closer / further = 摄像机与主体的距离。

所有 63 种有效组合均列于 captions_all_63.txt(https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt/blob/main/captions_all_63.txt)。请使用这些精确短语——该模型专门学习了此词汇表,因此同义词(如“向左45度”、“稍微向左”)效果不太可靠。

示例提示词:

crossview. new camera angle: to the right, lower, closer.
crossview. new camera angle: to the left, higher, further.
crossview. new camera angle: same angle, same height, closer.

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#tips使用技巧

  • 角度大小与链式操作: 该模型在小幅度、单步角度变化时最可靠。若需要较大的视角偏移,建议分若干小步链式操作——将生成的视角作为新的参考视频反馈回去,再施加另一个小角度变化。
  • 完整提示词列表: 训练此模型所用的每个提示词均列于 captions_all_63.txt(https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt/blob/main/captions_all_63.txt)——请使用这些精确短语。
  • 蒸馏模型: 该 LoRA 在完整(非蒸馏)LTX-2.3 上训练。在蒸馏的少步工作流中效果较弱——可尝试将 LoRA 强度设为 1.2–1.5,和/或在第一次(非蒸馏)推理中运行。

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#training-details训练细节

此 IC-LoRA 在 RunPod 云 GPU(https://runpod.io/?ref=vpp0cion)(NVIDIA RTX PRO 6000 Blackwell,96 GB)上训练。

参数
基础模型LTX-Video 2.3 (22B)
训练框架ltx-trainer (Lightricks)
训练策略IC-LoRA(灵活,参考条件化)
发布检查点step 13,700(12k 线性 + 1.7k 热启动延续)
LoRA rank / alpha16 / 16
目标模块attn1, attn2 (to_k/q/v/out) — 仅注意力层
优化器AdamW — 2e-4 线性衰减(主训练),1e-4 恒定(延续训练)
时间步采样均匀 sigma [0.4, 1.0]
混合精度bf16
批次大小1(启用梯度检查点)
条件化reference p=1.0 + first_frame p=0.2
训练数据集294 对
分辨率768x768x81 @ 15fps

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#dataset数据集

训练于 SynCamVideo(https://huggingface.co/datasets/KlingTeam/SynCamVideo-Dataset)(KlingTeam,Apache-2.0)——在 Unreal Engine 5 中渲染的合成多摄像机数据集,每个场景在主体周围的半球上采样 10 个静态摄像机。精选了 294 对参考/目标摄像机对,并在描述词汇表中保持平衡:

方位角区间对数量
same angle42
slightly to the left / right42 / 42
to the left / right42 / 42
far to the left / right42 / 42

仰角和距离在每个方位角区间内大致均匀混合。描述仅包含摄像机角度差异(无场景描述)。

训练此 LoRA 所用的精确配对、描述和视频片段已作为配套数据集发布:CrossView Prompt Dataset(https://huggingface.co/datasets/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt-Dataset)。

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#limitations限制

  • 视角范围: 训练摄像机的前方扇区(最大约 ±60° 方位角)——“从背后看”的视角超出范围。
  • 蒸馏模型: 在蒸馏的少步模型上效果较弱(参见使用技巧)。

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#license许可

此 LoRA 根据 Apache License 2.0 发布。它完全使用 SynCamVideo(https://huggingface.co/datasets/KlingTeam/SynCamVideo-Dataset)数据集进行训练,该数据集本身也采用 Apache-2.0 许可,因此训练数据对此适配器不施加额外限制,可在此相同宽松条款下发布。

注意:使用此 LoRA 需要 LTX-Video 2.3 基础模型,该模型受其自身许可约束——请另行查阅 Lightricks 关于基础权重的条款。

https://huggingface.co/Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt#support支持

制作和分享此类开源工作需要租用云 GPU,这会迅速增加成本。如果您觉得它有用并希望我继续贡献,您的支持将非常感谢:

Ko-fi(https://ko-fi.com/chetyart)
Liberapay(https://liberapay.com/chetyart/donate)

相似文章

LiconStudio/Ltx2.3-VBVR-lora-I2V

Hugging Face Models Trending

LiconStudio 发布了一个针对 LTX-2.3 的 LoRA 适配器,该适配器在 VBVR 数据集上进行了微调,以增强视频生成能力,改善提示理解、运动动态和时间一致性,用于复杂的视频推理任务。

fal/LTX-2.3-3DREAL-LoRA

Hugging Face Models Trending

针对LTX-2.3的LoRA适配器,能将粗糙的3D视口动画(来自Blender、游戏引擎)转换为逼真的视频,同时保留构图和相机运动。

Lightricks/LTX-2.3-22b-IC-LoRA-LipDub

Hugging Face Models Trending

这个Hugging Face模型页面介绍了一个基于LTX-2.3-22b训练的IC-LoRA,用于唇语同步配音,包含项目页面、论文和推理流程。

Alissonerdx/LTX-Best-Face-ID

Hugging Face Models Trending

一个用于LTX-2(22B)的LoRA,通过重叠参考条件化、TASS-RoPE和ArcFace身份损失实现身份保持的参考到视频生成,可通过BFS节点在ComfyUI中使用。

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。