joyfox/LTX2.3-ICEdit-Insight
摘要
JoyFox Lab 发布了 LTX2.3-ICEdit-Insight,这是一个基于 LTX-2.3 构建的任务感知型视频恢复与编辑模型系列,支持视频恢复、高清增强、水印去除和字幕去除。
查看缓存全文
缓存时间: 2026/05/15 06:17
joyfox/LTX2.3-ICEdit-Insight · Hugging Face
来源: https://huggingface.co/joyfox/LTX2.3-ICEdit-Insight
LTX2.3-ICEdit-Insight 是由 JoyFox Lab 开发的一系列任务感知型视频修复与编辑模型,基于 LTX-2.3 DiT 音频-视频基础模型 构建。
本次发布聚焦于四个实用的视频编辑方向:
- 视频修复:退化恢复、压缩清理、模糊与降噪处理、损坏细节修复。
- 视频高清增强:超分辨率、细节重建、纹理锐化、感知质量提升。
- 水印去除:Logo 清理、半透明叠加层去除、遮挡感知背景重建。
- 字幕去除:硬字幕去除、字幕清理、文字叠加层去除、时序稳定的修复。
与传统的逐帧增强流程不同,该模型系列作为生成式视频修复系统在潜在视频空间中运行。它旨在保留全局结构、相机运动、对象身份和时间一致性,同时重建缺失或退化的视觉内容。
项目链接: GitHub 项目 | JoyFox on Hugging Face
📦 模型文件
| 文件 | 用途 |
|---|---|
ltx-2.3-edit-insight-dev-fp8.safetensors | LTX-2.3 编辑的统一 Insight 基础检查点 |
ltx2.3-video-restoration-general.safetensors | 视频修复、伪影清理、模糊和噪声恢复 |
ltx2.3-ic-video-upscale-general.safetensors | 视频高清增强、超分辨率与细节恢复 |
ltx2.3-ic-watermark-remove-general.safetensors | 水印去除与遮挡感知重建 |
ltx2.3-ic-subtitles-remove-general.safetensors | 字幕去除与文字叠加层清理 |
🎬 展示
🚀 脚本使用
所有脚本从项目根目录运行。
bash run_restoration.sh
bash run_hd.sh
bash run_hd.sh /path/to/input.mp4
bash run_watermark_rm.sh
bash run_watermark_rm.sh /path/to/input.mp4
bash run_subtitle_rm.sh
bash run_subtitle_rm.sh /path/to/input.mp4
💻 命令示例
视频修复
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
python run_pipeline.py \
--mode restoration \
--video ./inputs/input_480p.mp4 \
--prompt "Convert the video to ultra-high-definition quality while removing artifacts and rebuilding high-frequency details." \
--output ./outputs/output_restoration.mp4 \
--height 1184 --width 704 --num-frames 97 \
--fps 24.0 --seed 42 \
--sigma-profile workflow \
--streaming-prefetch-count 2 \
--model-checkpoint ./models/checkpoints/ltx-2.3-edit-insight-dev-fp8.safetensors \
--lora ./models/loras/ltx2.3-train/ltx2.3-video-restoration-general.safetensors
视频高清增强
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
python run_pipeline.py \
--mode hd \
--video ./inputs/input_480p.mp4 \
--prompt "Convert the video to ultra-high-definition quality, significantly improving clarity, fine detail richness, texture fidelity, and overall perceptual sharpness." \
--output ./outputs/output_hd.mp4 \
--height 1184 --width 704 --num-frames 97 \
--fps 24.0 --seed 42 \
--sigma-profile workflow \
--streaming-prefetch-count 2 \
--model-checkpoint ./models/checkpoints/ltx-2.3-edit-insight-dev-fp8.safetensors \
--lora ./models/loras/ltx2.3-train/ltx2.3-ic-video-upscale-general.safetensors
水印去除
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
python run_pipeline.py \
--mode watermark_rm \
--video ./inputs/input_480p.mp4 \
--prompt "Remove short-video platform watermarks and related occlusions from the video, restoring a clean, clear, and natural original image." \
--output ./outputs/output_watermark_rm.mp4 \
--height 1184 --width 704 --num-frames 97 \
--fps 24.0 --seed 1546 \
--sigma-profile workflow \
--streaming-prefetch-count 2 \
--model-checkpoint ./models/checkpoints/ltx-2.3-edit-insight-dev-fp8.safetensors \
--lora ./models/loras/ltx2.3-train/ltx2.3-ic-watermark-remove-general.safetensors
字幕去除
PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \
python run_pipeline.py \
--mode subtitle_rm \
--video ./inputs/input_480p.mp4 \
--prompt "Remove subtitles, captions, and related text occlusions from the video, restoring a clean and natural underlying image." \
--output ./outputs/output_subtitle_rm.mp4 \
--height 1184 --width 704 --num-frames 97 \
--fps 24.0 --seed 42 \
--sigma-profile workflow \
--streaming-prefetch-count 2 \
--model-checkpoint ./models/checkpoints/ltx-2.3-edit-insight-dev-fp8.safetensors \
--lora ./models/loras/ltx2.3-train/ltx2.3-ic-subtitles-remove-general.safetensors
✨ 关键改进
任务感知 IC-Edit 框架
我们为 LTX-2.3 引入了任务感知的 IC-Edit 训练框架,其中每个修复方向都通过专用的指令条件和任务特定的 IC-LoRA 适配器进行优化。
该模型不仅训练用于提升视觉质量,还能理解不同修复任务背后的编辑目标,包括水印去除、字幕清理、损坏区域恢复和高清增强。
LTX-2.3 DiT 骨干网络适配
该模型系列基于 LTX-2.3 基础架构构建,这是一个专为高保真图像到视频和视频生成工作流设计的扩散变换器视频模型。
我们的适配针对视频修复进行改进:
- 潜在空间可编辑性
- 指令遵循行为
- 帧间稳定性
- 高频细节恢复
- 退化或遮挡区域的局部重建
时空一致性优化
视频修复不仅需要强大的单帧质量。我们优化了时序一致性,使修复区域在相邻帧之间保持稳定。
这减少了常见的伪影,例如:
- 闪烁纹理
- 不稳定的重建背景
- 不一致的水印去除
- 字幕鬼影
- 逐帧颜色偏移
- 运动过程中细节突然出现
退化感知训练课程
训练课程涵盖了现实视频缺陷,包括:
- 压缩伪影
- 运动模糊
- 传感器噪声
- 低比特率视频
- 文字叠加
- 硬字幕
- 半透明水印
- 平台 Logo
- 局部遮挡
- 低分辨率输入
这提高了在短视频、社媒片段、手机素材、下载视频和压缩制作材料上的泛化能力。
遮挡感知重建
对于水印和字幕去除,模型经过优化,能够重建遮挡区域背后的隐藏视觉内容。
它不会涂抹或模糊目标区域,而是利用周围空间上下文和时间线索推断合理的背景结构、对象边界、光照和纹理连续性。
频率增强高清修复
对于高清增强,模型通过频率感知修复训练提升了感知锐度和精细视觉细节。
这尤其有助于恢复:
- 发丝
- 织物纹理
- 皮肤细节
- 产品边缘
- 背景图案
- 类字体精细结构
- 自然图像清晰度
🧠 推理笔记
- 大多数编辑任务建议使用单阶段推理。
- 两阶段精炼可以提升视觉抛光效果,但可能削弱任务特定的 LoRA 约束。
- 水印和字幕去除在遮挡区域稳定且不太大时表现最佳。
- 高清增强质量取决于输入分辨率、运动复杂度和压缩程度。
- 更高的输出分辨率可以提升细节,但需要更多 VRAM。
- 对于强运动视频,建议使用保守去噪设置以保留时序结构。
- 帧数应遵循
8k + 1规则。 - 输出高度和宽度在单阶段推理中应为
32的倍数。
🏗️ 训练
该模型系列由 JoyFox Lab(成都玄狐科技有限公司)训练和优化。
训练流程包括:
- 任务感知视频修复数据构建
- 退化合成与课程训练
- 针对四个编辑方向的 IC-LoRA 特化
- 时序一致性正则化
- 遮挡感知重建训练
- 高频感知增强
- 指令引导的视频编辑优化
📬 联系方式
如需研究合作、商业许可或工作流集成,请联系:
📜 许可证
基于 Apache 2.0 许可证。
使用或重新分发衍生检查点时,请同时查看上游 LTX-2.3 基础模型的许可证条款。
相似文章
Lightricks/LTX-2.5
Lightricks releases LTX-2.5, an open-weights world model for generating synchronized video and audio from text, image, and video inputs, with features like native multishot generation and a new diffusion video decoder.
Lightricks/LTX-2
LTX-2 是 Lightricks 推出的首个基于 DiT 的音频-视频基础模型,提供同步音频和视频生成、高保真度以及可投入生产的输出,并附带开源代码和开放模型权重。
LiconStudio/Ltx2.3-VBVR-lora-I2V
LiconStudio 发布了一个针对 LTX-2.3 的 LoRA 适配器,该适配器在 VBVR 数据集上进行了微调,以增强视频生成能力,改善提示理解、运动动态和时间一致性,用于复杂的视频推理任务。
Cseti/LTX2.3-22B_IC-LoRA-CrossView-Prompt
一个用于LTX-Video 2.3的概念验证型上下文LoRA适配器,能够通过固定词汇提示从新相机视角重新渲染视频场景,基于合成多视角数据训练而成。
Lightricks/LTX-2.3-22b-IC-LoRA-LipDub
这个Hugging Face模型页面介绍了一个基于LTX-2.3-22b训练的IC-LoRA,用于唇语同步配音,包含项目页面、论文和推理流程。