标签
SwiftI2V 是一个新颖的高效框架,用于高分辨率图像到视频的生成,它采用条件分段生成技术,在显著降低计算成本的同时实现了 2K 分辨率的合成。该框架使得在单个消费级或数据中心 GPU 上进行实用的生成成为可能,同时保持了输入的保真度。
本文介绍了 TenStrip/LTX2.3-10Eros,这是一款托管在 Hugging Face 上的微调 AI 视频模型,旨在提升图像到视频生成的效果及对提示词的遵循度。文章提供了有关文件格式、与 ComfyUI 节点的兼容性以及实现最佳效果的特定提示词策略等技术细节。
Seedance 2.0 turns static GPT Image 2 frames into a playable ARPG game based on Jin Ping Mei, adding UI and scene transitions.
Google 更新 Veo 3.1,提升角色与物体的一致性,支持竖屏视频生成,并支持上采样至 1080p/4K 分辨率。
PersonaLive 是一个基于扩散模型的框架,用于直播中的实时生动肖像动画,通过混合隐式信号和自回归流式生成实现了显著的速度提升。
LongCat-Video 是一个基于 Diffusion Transformer 的 13.6B 参数视频生成模型,支持文生视频、图生视频和视频续写任务,通过粗细粒度结合与分块稀疏注意力实现高效的长视频生成。
A 2026 tutorial outlines a 15-minute image-to-video workflow using Higgsfield Cinema Studio to create cinematic AI shorts by first generating a Hollywood-grade keyframe and then animating it with consistent characters and cinematic principles.