标签
这是 MiniMax-H3 的早期预览版 LoRA,支持在 4 步采样(而非约 20 步)内联合生成视频和同步音频,采样速度约提升 5 倍,并附带 ComfyUI 自定义节点和三个 bf16 检查点。
作者开源了 SarasFlow,这是一个 AI 流水线,能够根据主题生成教育视频:编写脚本、生成旁白、制作视觉内容、添加字幕并组装最终视频,所有组件都是模块化且可替换的。
ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。
WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。
Simon Willison 重点介绍了 PipeNetwork/minimax-h3-mlx,这是一个将 MiniMax-H3 移植到 Apple Silicon 上的 MLX 的 Python 包,并演示了在 M5 Max MacBook Pro 上运行它,从文本提示生成视频。
详解如何在 RTX 4080 16GB 上通过 ComfyUI 原生工作流本地运行 MiniMax H3 视频生成模型,包含模型下载、目录配置、参数调优及常见坑点。
作者开源了多个用于内容创作的SKILL,包括视频生产流水线、读书短视频、小红书美食卡片和视频下载工具。
有人仅凭一张 Rare Beauty 睫毛膏照片,用 Seedance 2.5 生成了网红试用视频,产品外观一致且上妆动作准确,被认为攻克了AI广告的难点。
作者开源了 SARAS,一个 AI 视频平台,能从简单主题生成完整视频(脚本、配音、画面、剪辑、字幕),支持 24 种语言和多种风格,包含后端功能如认证、支付和 270+ 测试。
MiniMax发布了开放权重的H3视频模型,这是首个登顶AI视频排名的开放模型,在视频编辑中排名第一,在文本生成视频中排名第二。该33B参数模型可处理文本、图像、视频和音频,但部分组件如2K分辨率和H3-Context-IR仍未开放。
作者使用 MiniMax 的 H3 模型构建了一个本地视频生成工作室,并感谢 MiniMax 提供的最先进模型。
一位用户表达了对MinMax-H3的兴奋,强调现在可以100%本地实现这种视频质量。
Higgsfield宣布推出11天无限量Seedance使用活动,其中前4天可使用4K版Seedance 2.0,其余7天可使用任意其他Seedance模型,为即将发布的Seedance 2.5预热。
MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。
作者在 DGX Spark 上对 MiniMax H3 与 LTX 2.3 Eros 视频生成模型进行了同条件实测,结果显示 H3 在叙事和指令遵循上更强且带音频,LTX 速度约快 1.76 倍。
Seedance 2.5 和 Minimax H3 这两款最先进的多模态视频生成器的上手对比。Seedance 在高动作编排、角色一致性和指令遵循方面胜出,而 Minimax 在音乐视频风格输出、价格、分辨率和开放权重可用性方面占优。
WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。
Google正在测试未发布的变化,以缩小Gemini桌面应用与其网页版之间的功能差距,包括专用于图像/视频生成的标签页、相机拍摄以及针对Spark的自定义MCP服务器支持。
MiniMAx H3 的开放权重今天发布了;作者想了解是否有人尝试用它来在关键帧之间生成中间帧。
VideoAgent 是一个一体化的开源框架,用于全面视频智能,通过统一的智能体工作流结合理解、编辑和创意生成。