Fable 5 基准测试(使用 remotion 视频)

Reddit r/singularity 新闻

摘要

Fable 5 在视频生成基准测试中相比 Opus 4.8 整体有所改进,但 Gemini 3.1 Pro 展现了更多艺术视野,尽管在工具调用和编写有 bug 的代码方面存在问题。

总的来说比 Opus 4.8 有所改进,但我仍然认为 Gemini 3.1 Pro 更具艺术视野,尽管它有时会无法正确进行工具调用并写出有 bug 的代码。我知道几乎每个人都只对 SWE 相关的东西感兴趣,但对我来说,这是一个很好的评估,让我思考模型有多大,它在生成新想法等方面有多“创造性”等等。来自 Fable 的更多结果,与 Gemini、Opus 以及一些开源模型进行了比较:[https://mesmer.tools/benchmarks/ai-video-generation](https://mesmer.tools/benchmarks/ai-video-generation)
查看原文

相似文章

Fable 5 在 Livebench 上甚至低于 Gemini 3.1

Reddit r/singularity

讨论 LiveBench 结果显示 Fable 5 表现低于 Gemini 3.1,质疑是该基准测试有缺陷,还是 Anthropic 在针对基准测试进行优化(benchmaxing)。