标签
WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。
生物计算公司与 AWS 合作,商业化一种神经元衍生 AI 视频模型,该模型利用生物数据优化文本到视频生成,在标准硬件上提供更快更便宜的推理。
H3 Max Director AI 模型可以从文本输入中生成互动场景和剧情,使其在短剧和实时游戏中的应用成为可能。这一进步突显了 AI 在动态内容创作方面的潜力。
本文对比了使用fal和Seedance进行AI直播的日均成本,指出fal便宜约10倍,并且在文生视频性能上表现优异。
FastVideo 发布了一款开源的、经过后训练的 Minimax H3 模型,它能以50倍的速度生成视频,仅需3秒计算时间即可输出5秒的视频内容,适用于文本到音频视频的生成。
MiniMax H3 Max 由 fal 在 MiniMax H3 上进行后训练,为视频生成树立了新的 Pareto Frontier,生成时间比基础模型快近50倍,在 image-to-video 和 text-to-video 任务中分别实现了18倍和24倍的速度提升。
FIRM-Video 介绍了一种基于检查表驱动的验证框架,用于构建文本到视频任务中的可靠奖励模型,利用时间视觉证据来改进评估和对齐。
本文应对由文本生成视频(T2V)模型生成的纯合成假新闻视频日益增长的威胁,提出了一项新的三元分类任务和首个纯合成假新闻视频数据集(PS-FNVD),以及一个推理引导框架(R-T2V),该框架实现了最先进的检测准确率。
本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。
LightX2V releases an open, local LoRA prompt rewriter for MiniMax-H3 text-to-audio-video generation, fine-tuned on Qwen3.6-27B to expand short prompts into structured audio-video descriptions.
文章介绍了开源工具MoneyPrinterTurbo,它通过输入主题或关键词即可自动完成短视频的脚本生成、素材匹配、配音、字幕和背景音乐合成,支持多种大模型和语音接口。
作者开源了 SARAS,一个 AI 视频平台,能从简单主题生成完整视频(脚本、配音、画面、剪辑、字幕),支持 24 种语言和多种风格,包含后端功能如认证、支付和 270+ 测试。
MiniMax发布了开放权重的H3视频模型,这是首个登顶AI视频排名的开放模型,在视频编辑中排名第一,在文本生成视频中排名第二。该33B参数模型可处理文本、图像、视频和音频,但部分组件如2K分辨率和H3-Context-IR仍未开放。
MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。
该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。
Pippa是一家AI视频初创公司,试图通过在使用艺术家风格时向其支付版税来使自己与众不同,但它面临艺术家的质疑,同时其模型与其他文生视频服务仍相似。
Dreamina Seedance 2.5 已发布,支持原生30秒视频生成、长达3分钟的一致片段、精确的帧编辑、50个多模态参考、3D模型和绿幕支持,以及Maya和Blender插件,定位为高度可控的AI视频工作流。
MiniMax H3 在 Artificial Analysis 视频编辑排行榜上位居榜首,提供基于指令的多模态输入编辑现有片段,并具有竞争力的定价,同时计划开源权重供商业使用。