标签
Surg-UniWorld 是一个具有多模态控制专家的统一手术世界模型,支持利用边缘、深度和光流输入可控地生成连贯的器械-组织交互视频。它引入了一个新基准(Cholec80-SurgWAM),并且优于现有的可控视频生成方法。
MiniMax H3 官方发布了 9 个可安装的视频生成 Skills,本文详细介绍了这些技能的功能、安装方法和使用流程,帮助用户将专业视频制作流程产品化。
ByteDance 为其 Seedance 2.5 视频生成模型发布了官方提示词指南,帮助用户编写更好的提示词。
介绍了一套手绘风视频生成skill:story-to-handdrawn-video,适用于儿童睡前故事、古诗词、科普等场景,支持文案自动分句分镜或按顺序传图,输出3:4竖屏画面轨,内置20种手绘风格。
Seedance 2.5 引入了30秒视频生成、多模态参考、多语言创作和定向编辑,面向开发者和企业的API访问即将在BytePlus上线。
Topview 推出年度套餐,将 Seedance 2.5 和 Wan 3.0 两款最新 AI 视频模型打包为不限量使用,Seedance 2.5 价格低至 $0.12/秒,宣称全网最低,适合大量生成视频内容的用户。
Seedance 2.5 现已集成到 Arcads,使用户能够从研究阶段直接进入成片制作,并在限定时间内享受无限访问。
Wan-Animate-2 是一个全新的端到端角色动画框架,它在重新设计的 Diffusion Transformer 中直接输入驱动视频,实现高保真动作生成和身份保持。它还推出了一个轻量级变体,用于实时流式动画,并已发布开源权重。
字节跳动正在训练一个大规模AI模型,旨在与Anthropic抗衡,其独立开发方法由前谷歌DeepMind科学家吴永辉领导的Seed团队负责,而其豆包模型以3.24亿月活跃用户领跑中国。
一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。
用户分享了 Seedance 2.5 与 Seedance 2.0 在四种电影类型上的正面比较,指出输出质量存在显著差异。
面向 Minimax-h3-Turbo 视频生成模型的 Hugging Face 页面,提供通过 Diffusers 及 Colab/Kaggle 笔记本使用该模型的说明。
Seedance 2.5 在 Lovart 上线,提供原生30秒4K视频输出,并支持多达50个参考素材以提升一致性,这可能是AI视频生成领域的重要一步。
Seedance 2.5 已发布,支持 30 秒单次生成视频、音频参考口型同步,以及异步任务和 webhooks 等 API 功能。其突出之处在于失败生成不收费,且参考视频可获得更低的 token 费率,但输出最高仅为 720p。
Olivia Moore 指出AI视频广告已经跨越了鸿沟,她自2023年起跟踪该领域,如今已难以一眼分辨AI生成的广告。
一部完全由AI制作的95分钟电影《Hell Grind》在戛纳上映,Higgsfield现在开源了全部提示词和资产,可供直接使用。
Seedance 2.5 已在 CapCut 上全球发布,提供更少的重新生成次数,并支持最多 50 个多模态参考,以改善创意方向并简化从提示到最终视频的路径。
MiniMax-H3 的早期预览版 LoRA 支持 4 步音视频生成,取代约 20 步,采样速度大约提升 5 倍,但质量仍不成熟。
MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。
这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。