标签
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
Comfy-Org 为 ComfyUI 重新打包了 MiniMax-H3 模型文件,包括扩散模型、文本编码器和 VAE,并提供了用于文本生成视频、图像生成视频和参考生成视频的工作流模板。
FilmBench是一个面向电影级视频生成的新基准,其提示源自跨越20种类型的获奖影片,并采用包含35+子指标的三级电影级分类体系。它包含一个开源自动化评估代理(FilmOps),该代理以高相关性复现人工模型排名,揭示了动态美学和多镜头表现方面的显著差距,相较于以往的网页风格基准。
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,能够共同从图像、视频和音频中学习,实现跨模态的统一生成和理解,现已开放早期访问。
Lightricks releases LTX-2.5, an open-weights world model for generating synchronized video and audio from text, image, and video inputs, with features like native multishot generation and a new diffusion video decoder.
Neill Blomkamp发布了一部13分钟的科幻短片《Nightborne》,完全使用字节跳动的Seedance 2.0文本生成视频AI制作。《The Verge》批评其质量低劣,指出AI的局限性及缺乏创作力。
本文介绍了移动字母(Moving Alphabet),一个用于受控实验的程序化测试平台,研究数据分布和字幕质量如何影响文本到视频模型,揭示了数据整理的关键见解。
日本AIdea Labs发布了AnimeGen,一款免费的动漫风格视频生成AI模型,支持文本到视频和图像到视频,允许商业使用。
字节跳动即将推出Seedance 2.5,这是一款能够生成最长3分钟视频的AI视频模型,具备30秒场景、多模态参考等特性,并已集成至Dreamina和CapCut。
这是一个关于如何使用Claude Code和Remotion框架制作中文自媒体视频的详细教程,用户只需提供想法和提示词,AI负责搭建环境、写代码、生成配音并渲染成MP4视频。教程涵盖从流水线搭建、脚本撰写到视频生成和调整的完整流程。
在Codex平台上通过HyperFrames、ElevenLabs配音、Remotion动画和Captions字幕等插件,实现从文本到视频的自动化制作流水线。
物理问题场景图(PQSG)是一种基于层次化问题的评估流程,利用视觉语言模型(VLM)对视频生成模型的物理合理性进行细粒度的违规检测。该工作引入了FinePhyEval数据集,并显示出比以往工作更高的与人类判断的相关性。
DomainShuttle 提出了一种开放域主题驱动的文本到视频生成方法,通过领域感知建模和双RoPE方案,在域内和跨域场景下实现了高保真度和灵活性。
MaineCoon是一款22B参数的实时文生音频视频模型,在单张H100 GPU上可达47.5 FPS,支持低成本、长时长的流式生成,同步语音与画面,用于实时AI角色。
LooseControlVideo 提出了一种框架,用于在文本生成视频中实现直观的3D空间控制,利用稀疏的有向3D框作为代理,实现了卓越的轨迹准确度和遮挡处理。它微调了Wan 2.2骨干网络,并在多个基准上展示了相较于现有方法的显著改进。
介绍开源项目Pixelle-Video:一个全自动AI短视频引擎,输入主题即可自动生成带文案、配图、语音和背景音乐的视频,支持本地和云端模型,模块化设计可灵活替换各环节模型。
ElevenLabs 在 ElevenCreative 中引入虚拟化身功能,这是一个专用的入口,用于生成人物说话头像视频,让用户能够创建由 AI 驱动的虚拟人物视频,实现逼真的语音和口型同步。