Seedance 2.5 对比 Minimax H3(开放权重)。出色的输出对比!

Reddit r/LocalLLaMA 新闻

摘要

Seedance 2.5 和 Minimax H3 这两款最先进的多模态视频生成器的上手对比。Seedance 在高动作编排、角色一致性和指令遵循方面胜出,而 Minimax 在音乐视频风格输出、价格、分辨率和开放权重可用性方面占优。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/03 05:34

TL;DR:Seedance 2.5 和 Minimax H3 都是当前最先进的多模态视频生成器。Seedance 在高动态动作编排、角色一致性和指令跟随方面胜出;Minimax 则在音乐视频风格输出、价格、分辨率和开放权重可用性方面更胜一筹。 ## 概述 最近发布了两款新的最先进视频生成器:Seedance 2.5 和 Minimax H3。两者都是多模态模型,即它们可以接受文本提示,也可以接受图像、视频和音频作为参考。两者都能处理常见任务,如绿幕替换、在现有视频中添加或替换角色,以及改变天气、光照或摄像机角度。本评测中的测试侧重于更极端、更具挑战性且更实用的用例。 ## 打斗场景与高动态测试 第一个测试使用了粗略的 3D 动画加上两张角色参考图。提示词是: > 这个角色和这个角色在古代寺庙中打斗。参考这段视频的动作和运动。 该测试在 BytePlus 的 Lumina 上运行,这是一个集成 ByteDance 及其他提供商生成模型的一站式平台。 **Seedance 2.5** 生成了一个 13 秒、720p 的片段。角色一致性非常出色,物理效果和运动几乎无懈可击。有一个瞬间它插入了一个原始 3D 视频中没有的角色脸部特写对峙,但整体输出与参考动作非常连贯。 **Minimax H3** 使用了相同的提示词和一个 14 秒的 2K 参考视频。它无法很好地跟随 3D 参考,整个打斗场景中出现了明显的噪点和伪影。 高动态/打斗场景胜者:Seedance。 关于创建 3D 资产,文中提到了 Mixamo(预制角色动画)和 Nvidia Arty(文本提示动画创建)等免费资源作为实用工具。 ## 复杂指令跟随 下一个测试使用了一个长且多步骤的提示词: > 一部 3D 皮克斯风格动画:一位身穿闪亮白色连衣裙的公主在森林中逃离一只眼睛发红光、体型巨大的龙。龙喷出火焰,点燃了她身后的地面和植被。她蹲在一棵倒下的树下,龙撞碎了树。一群发光的蓝色鸟突然扑向龙的脸。公主抓住一根悬挂的藤蔓荡过去,落进一个废弃的金色浴缸里。浴缸载着她滚下山坡。她在浴缸撞上巨石前一刻跳了出来。到达河边后,她跳上漂浮的碎片过河。她从一扇破门跳到漂浮的木桶上,然后跳上一只困惑的巨型乌龟的背上。她回头看,只见巨龙在岸边愤怒地咆哮,因为无法过河。 **Seedance** 允许生成最长 30 秒,并且几乎完美地遵循了提示词中的所有内容。 **Minimax** 被限制为 15 秒,但仍然设法把提示词压缩到该时长内,并且大部分细节都正确。唯一遗漏的是:公主在跳上漂浮木桶之前没有跳上破门。不过两者都非常令人印象深刻。 ## 草图动画到可交付成品片段 针对动画工作室工作流,测试是看粗略的草图动画能否被转换成完全着色、可交付生产的成品片段。提示词要求生成一段逼真的高动态电影感视频,内容是日本女巫与巨型岩石魔像战斗,使用参考视频中的精确姿势、动画和摄像机角度。 **Seedance** 在场景着色和使其看起来像精良的、可交付生产的动画方面做得更好。**Minimax** 则倾向于保留一些原始草图元素。 得分:Seedance。 ## 故事板和 Logo 到商业广告 两个模型都被给予一个故事板和一个 logo,用于制作一条豪华手袋广告,并配有英语配音。 **Seedance** 生成了这段配音: > 无限。一个关于永恒优雅的故事。承载无尽。 **Minimax** 生成了: > 在一个瞬息万变的世界里,真正的优雅永存。一种安静的自信。一场没有边界的旅程。无限。超越时间。 两条商业广告都非常出色——可以说是目前该用例下最好的模型。评测者指出很难选出胜者。 ## UI 截图到动态图形广告 接下来,使用一个应用的简单 UI 截图加一个 logo 来制作一条完整的动态图形商业广告。该应用名为 Artisan Crafts,是一个本地手工制品市场。提示词要求使用英国女性配音、扁平矢量动态图形风格,并且只能使用所附图片中的元素。 两个模型都产出了不错的广告,只有轻微的文字错误。评测者请观众自行判断更喜欢哪个。 ## 音乐视频生成 两个模型都是多模态的,可以接受音频参考。在本次测试中,上传了一段由开源音乐生成器 A-Step 生成的 15 秒音轨,以及一张虚构 K-pop 乐队的图片和字体排版参考。提示词要求制作一支包含演唱/舞蹈、粗颗粒、故障和邋遢效果、3 秒内快速硬切、剪辑与节拍同步,以及使用参考图片中字体排版的 MV。 **Minimax** 表现出色:歌曲与上传的音频完全匹配,动画和剪辑与节拍同步,角色看起来像是在跟着唱,字体排版也很棒。 相比之下,**Seedance** 生成了一个奇怪的产物。 音乐视频/文字叠加胜者:Minimax。 ## 赞助商:Abacus AI 的 Chat LLM 本视频由 Chat LLM 赞助,这是一个使用顶级 AI 模型的一站式平台。它支持在聊天中切换模型,并集成了顶级图像和视频生成器。它还具备智能体功能,能够自主创建 PowerPoint、网站和研究报告。访问所有模型、图像/视频生成器和智能体功能的费用为每月 10 美元。 ## 多语言测试 两个模型都声称支持多种语言。测试包括一名中国男性、一名印度女性、一名西班牙女性,以及德语、法语、阿拉伯语、韩语、俄语和波兰语。两个模型的结果都已展示;评测者表示他听不懂其中大部分语言,并请观众评论是否有模型在某种语言上出错。 ## 极具挑战性的提示词 这些提示词旨在推动模型超越当前能力边界。 ### 维瓦尔第《夏》小提琴独奏 提示词:一名小提琴独奏者演奏维瓦尔第《夏》第一乐章的独奏部分。这考验小提琴演奏的准确性(弓法、指位)以及模型是否熟悉这首乐曲。 **Seedance** 看起来非常逼真:弓法和手指大多与声音同步,但音乐实际上并不是维瓦尔第的《夏》。

相似文章

Seedance 2.5 宣传视频

Reddit r/singularity

一段展示Seedance 2.5(一款AI视频生成模型)能力的宣传视频。

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。