100美元AI音乐视频:Claude Fable 5 vs. GPT-5.6 Sol

Hacker News Top 新闻

摘要

一项实验让Claude Fable 5与GPT-5.6 Sol在预算内自主制作音乐视频,每个模型均使用工具进行研究、生成片段和编辑。结果显示不同的策略和质量,其中Claude Fable 5在100美元预算下生成了更高分辨率的输出。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/17 01:54

# $100 AI音乐视频:Claude Fable 5 vs. GPT-5.6 Sol 来源:<https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6> 我们构建了一个小型自主功能框架,任务只有一个:将一首歌、一个严格的美元预算和一套工具交给模型,然后不干预,让它自行制作一部完整的音乐视频。模型会研究有哪些视频模型可用,生成片段,观看自己的素材,用 ffmpeg 剪辑,并组装成最终成片。 我们上一场对决(<https://www.tryai.dev/blog/gpt-5.6-build-off-12-models>)的一些读者表示,希望看到工具使用在不同模型间的实际差异,因此我们给前沿模型一个开放式、长周期的任务,让每个模型自行决定研究什么、生成什么以及如何剪辑。我们记录了每一次工具调用,因此你可以确切看到每个模型的工作过程(完整日志见下文)。 我们运行了两个模型——**Claude Fable 5**(<https://www.tryai.dev/models/claude-fable-5>)和 **GPT-5.6 Sol**(<https://www.tryai.dev/models/gpt-5.6-sol>),每个模型有两个预算档位($25 和 $100),共四次运行。每次运行使用相同的歌曲(Bruno Mars 和 Mark Ronson 的“Uptown Funk”)、一段简短文字描述以及带时间戳的歌词文本。 ## 设置 每个模型在自主工具调用循环中使用六个工具: - **plan**:用于思考(无成本、无操作)。 - **web\_search**:用于研究生成模型及其 API,获取关于音乐视频的信息(若需要)。 - **get\_budget**:检查剩余预算。 - **generate\_image** 和 **generate\_video**:唯一会消耗预算的工具。模型可以任意选择 FAL 或 Replicate 上的模型并传递自己的参数。 - **run\_command**:本地 shell,可使用 ffmpeg/ffprobe,用于分析音频、剪切和拼接片段,以及混合最终视频。 一旦预算归零,付费生成会被拒绝,但模型可以继续剪辑。每条模型消息、工具调用、扣费和错误都被记录。整个框架是开源的,位于 **github.com/hershalb/music-video-arena**(<https://github.com/hershalb/music-video-arena>),你可以自行运行。 ## 四个视频 下面的每个片段都是模型最终的、自行组装的输出 .mp4,全长,并混入了原始歌曲。 | **Claude Fable 5 · $25** | **GPT-5.6 Sol · $25** | |------------------------|------------------------| | (视频嵌入区域) | (视频嵌入区域) | | **Claude Fable 5 · $100** | **GPT-5.6 Sol · $100** | |-------------------------|-------------------------| | (视频嵌入区域) | (视频嵌入区域) | ## 数据 所有四次运行均自行完成(未触及步骤数或时间限制),并均生成了一段有效的全长视频,其中混入了原歌曲。 | 模型 | 预算 | 实际时长 | 提示词 | 工具调用 | 失败调用 | 视频生成花费 | 分辨率 | |------|------|----------|--------|----------|----------|--------------|--------| | **Claude Fable 5** | $25 | 39m10s | 250 | 54 | 1 | $24.30 | 1280x720 | | **GPT-5.6 Sol** | $25 | 42m52s | 386 | 146 | 10 | $23.18 | 1280x720 | | **GPT-5.6 Sol** | $100 | 49m39s | 340 | 70 | 2 | $36.57 | 1280x720 | | **Claude Fable 5** | $100 | 38m56s | 280 | 80 | 0 | $48.60 | 1920x1080 | “视频生成花费”是指按 FAL 计费的价格,也就是预算上限。在 $25 预算下,两个模型几乎用尽。在 $100 预算下,它们分别花了 $36.57(Sol)和 $48.60(Fable),可见更多预算确实转化成了更多素材。这不包括运行模型本身的开销,我们在后文会加上。 ## 完成视频所需时间 (柱状图,显示四个运行的耗时对比) ## 每个模型使用了什么工具 模型可以自由选择工具,结果出现了分化。四次运行中有三次只用了纯文本到视频。只有 GPT-5.6 Sol($25)使用了图像到视频的流程(先生成静态帧,再将其动画化)。GPT-5.6 Sol($100)在一次运行中混合使用了三种不同的视频模型。 | 运行 | 图像模型 | 视频模型 | 方法 | |------|----------|----------|------| | **Fable 5 · $25** | 无 | Wan 2.5 t2v($0.05/秒) | 仅文本到视频 | | **Sol · $25** | FLUX schnell($0.003/张) | Wan 2.2-5b i2v($0.10/秒) | 关键帧,然后图像到视频 | | **Sol · $100** | 无 | Wan 2.5($0.05/秒)、Veo 3.1 Lite($0.10/秒)、Hailuo 2.3 Standard($0.28/视频) | 文本到视频,混合模型 | | **Fable 5 · $100** | 无 | Seedance 1.0 Pro t2v(约 $0.12/秒,1080p) | 仅文本到视频 | 价格为 FAL 公布的费率,除注明外均按每秒钟输出视频计算。Hailuo 2.3 Standard 按每个视频定价(约 $0.28/6秒片段),Seedance 1.0 Pro 按 token 定价(约 $0.62/5秒 1080p 片段,上表按每秒有效费率显示)。每次运行生成的独立片段数量从 46 到 80 不等。 ## 每次运行的工具调用分布 (饼图显示四个运行中计划、搜索、预算、图像生成、视频生成、命令等调用次数) ### 各运行完整日志 点击查看完整记录,包括每次 plan、工具调用和命令: - **Fable 5 · $25**(<https://d1md4c6gq9re9p.cloudfront.net/blog/music-video-arena/transcripts/fable-25.txt>) - **Sol · $25**(<https://d1md4c6gq9re9p.cloudfront.net/blog/music-video-arena/transcripts/sol-25.txt>) - **Sol · $100**(<https://d1md4c6gq9re9p.cloudfront.net/blog/music-video-arena/transcripts/sol-100.txt>) - **Fable 5 · $100**(<https://d1md4c6gq9re9p.cloudfront.net/blog/music-video-arena/transcripts/fable-100.txt>) ## 过程中的错误 “失败调用”是指生成请求返回错误(多数是向服务商发送时出现的临时网络故障)。这些调用不会被收费,但模型会花步骤重试。 (柱状图显示每个运行的失败调用次数) ## Token 使用量 | 运行 | 输入 Token | 输出 Token | 推理 Token | 缓存输入 | |------|------------|-------------|------------|-----------| | **Fable 5 · $25** | 1,476,900 | 44,341 | n/a | 0 | | **Sol · $25** | 2,956,270 | 33,220 | 9,656 | 2,558,029 | | **Sol · $100** | 2,097,572 | 31,715 | 12,330 | 1,819,050 | | **Fable 5 · $100** | 2,264,610 | 48,029 | n/a | 0 | ## 每次运行的总成本 预算只计量生成(FAL)花费。加上 **Claude Fable 5**(<https://www.tryai.dev/models/claude-fable-5>)的 LLM Token 成本(输入 $10/百万 Token,输出 $50/百万 Token)和 **GPT-5.6 Sol**(<https://www.tryai.dev/models/gpt-5.6-sol>)的 LLM Token 成本($5 / $30),可以得出每次运行的总成本。 | 运行 | 生成花费 | LLM Token 成本 | 总成本 | |------|----------|----------------|--------| | **Fable 5 · $25** | $24.30 | $16.99 | $41.29 | | **Sol · $25** | $23.18 | $4.27 | $27.45 | | **Sol · $100** | $36.57 | $3.25 | $39.82 | | **Fable 5 · $100** | $48.60 | $25.05 | $73.65 | 对于 Claude Fable 5,仅 Token 一项就花了 $16.99 到 $25.05,约占总成本的 30-40%。GPT-5.6 Sol 的 Token 成本虽然 Token 数量相似,但保持在 $3-4 左右。 ## 方法说明 - 所有四次运行使用相同的输入:歌曲、一段简短文字描述以及带时间戳的歌词文本。每个模型在 FAL 上自行选择生成模型,并自行用 ffmpeg 剪辑。 - 实际耗时包括模型自身的重试以及在服务商队列中等待的时间。 - 生成花费是基于每个模型价格表的最佳估算。 ## 自己尝试 该对决框架是开源的:**github.com/hershalb/music-video-arena**(<https://github.com/hershalb/music-video-arena>)。指向你自己的歌曲和预算,换成你想要对比的任何模型,看看它们能制作出什么。欢迎提交 Issues 和 PR,我们非常希望得到关于这个设置的反馈。 ## 我们的看法 这些音乐视频没有一个称得上优秀,但观察模型如何完成这个过程却相当有趣,也清楚地展示了前沿模型仍然存在的差距。几点观察: - **角色和故事连续性对所有四次运行都是难题。** 重复出现的角色在不同镜头间发生变化,而且没有一个视频能从头到尾保持连贯的故事情节。 - **模型对歌词的理解非常字面化。** “让一条龙想退休,伙计” 就真的给你一条龙出现在屏幕上。一开始几个镜头还挺有趣,但时间久了就有点奇怪。 - **节奏匹配较弱。** 剪切能落在节拍上(它们都运行了 ffmpeg 节拍检测),但片段内部的运动——舞蹈、镜头移动——很少能与歌曲的节奏匹配,因此常常感觉有点不协调。例如一句歌词“我太漂亮了必须亲亲自己”中,主角做出亲吻动作的速度过慢。 - **GPT-5.6 Sol 在 $25 预算下是最有创意的剪辑者。** 它叠加了文字和动画静态图片,并使用了视频特效,这些技巧其他运行都没有尝试。其他运行大多只是拼接生成的片段。GPT-5.6 Sol 在 $100 预算下还尝试了多种视频模型,而不是像 Fable 那样只坚持使用一个。 - **没有人真正迭代剪辑。** 一旦片段生成,模型就拼接并混音,但很少回头重新剪辑或添加效果,也没有认真地检查自己的片段以确认它们质量如何。GPT-5.6 Sol 的 $100 运行中放入了几个质量极低的 AI 片段,而 Claude Fable 5 恰好选了个输出更连贯的模型。这有一部分可能是模型自身的局限,但缺乏自我审查是值得注意的。 - **两个模型都没有使用 Replicate。** 尽管 FAL 和 Replicate 的密钥都可用,但所有四次运行都只用 FAL。 - **Claude Fable 5 是更贵的选择。** 尽管完成速度比 GPT-5.6 Sol 快,但每次运行的成本更高(总计最高达到 $73.65)。主观上,我们略偏向 Fable 的 $100 视频,但也没有哪个让我们惊艳。 - **$100 预算可能太多了。** 两个模型都不愿意花到上限,并且都保持了较少的步骤数。有了这样的余量,它们本可以例如预先生成一致的角色的图像,然后基于这些图像生成动画,但两个模型都没有选择这样做。 我们将会观察模型在更主观/风格化的任务上是否能够随着它们变得更智能而进步,但目前来看仍有很大的改进空间。 ## 自己尝试 本文提到的所有模型均可通过 **TryAI** 使用,一个账户,按量付费,无需订阅。 **免费开始**(<https://www.tryai.dev/chat>)

相似文章

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。

Good example of the gap between Fable and Sol

Reddit r/singularity

文章对比了OpenAI GPT-5.6 Soul和Anthropic Claude Fable 5在物理3D打印零件复制和自主杂志制作中的表现,Soul在速度和设计精度上略胜一筹,但两者在复杂现实任务中均需大量人工干预,暴露了当前AI在现实制造任务中的局限性。