Fable 5 基准测试(使用 remotion 视频)
摘要
Fable 5 在视频生成基准测试中相比 Opus 4.8 整体有所改进,但 Gemini 3.1 Pro 展现了更多艺术视野,尽管在工具调用和编写有 bug 的代码方面存在问题。
总的来说比 Opus 4.8 有所改进,但我仍然认为 Gemini 3.1 Pro 更具艺术视野,尽管它有时会无法正确进行工具调用并写出有 bug 的代码。我知道几乎每个人都只对 SWE 相关的东西感兴趣,但对我来说,这是一个很好的评估,让我思考模型有多大,它在生成新想法等方面有多“创造性”等等。来自 Fable 的更多结果,与 Gemini、Opus 以及一些开源模型进行了比较:[https://mesmer.tools/benchmarks/ai-video-generation](https://mesmer.tools/benchmarks/ai-video-generation)
相似文章
Fable 5 在 Livebench 上甚至低于 Gemini 3.1
讨论 LiveBench 结果显示 Fable 5 表现低于 Gemini 3.1,质疑是该基准测试有缺陷,还是 Anthropic 在针对基准测试进行优化(benchmaxing)。
Fable 5 的 ProgramBench 结果已出,性能是 Opus 4.8 的两倍,即使 99% 的运行回退到 4.8
ProgramBench 结果显示,Fable 5 的性能是 Opus 4.8 的两倍,即使在 99% 的运行中回退到 4.8。
Opus 5在3D破坏物理方面优于Fable 5
Opus 5在3D破坏物理基准测试中优于Fable 5
@robinebers: Fable 5 Low 优于 Opus 4.8 Max
用户发帖比较,认为 Fable 5 Low 优于 Opus 4.8 Max,另一用户评论称 Fable 5 回归了但使用方式不当。
据Anthropic称,Fable 5将把编程任务转向Opus 4.8
据Anthropic称,Fable 5的开发将转向使用Opus 4.8 AI模型进行编码任务。