Fable 5 基准测试(使用 remotion 视频)
摘要
Fable 5 在视频生成基准测试中相比 Opus 4.8 整体有所改进,但 Gemini 3.1 Pro 展现了更多艺术视野,尽管在工具调用和编写有 bug 的代码方面存在问题。
总的来说比 Opus 4.8 有所改进,但我仍然认为 Gemini 3.1 Pro 更具艺术视野,尽管它有时会无法正确进行工具调用并写出有 bug 的代码。我知道几乎每个人都只对 SWE 相关的东西感兴趣,但对我来说,这是一个很好的评估,让我思考模型有多大,它在生成新想法等方面有多“创造性”等等。来自 Fable 的更多结果,与 Gemini、Opus 以及一些开源模型进行了比较:[https://mesmer.tools/benchmarks/ai-video-generation](https://mesmer.tools/benchmarks/ai-video-generation)
相似文章
Fable 5.1 不同凡响!
在科学工作中表现卓越,基于用户体验,超越了 GPT 5.6 和 Opus 5。
Fable 5 在 Livebench 上甚至低于 Gemini 3.1
讨论 LiveBench 结果显示 Fable 5 表现低于 Gemini 3.1,质疑是该基准测试有缺陷,还是 Anthropic 在针对基准测试进行优化(benchmaxing)。
Fable 5 的 ProgramBench 结果已出,性能是 Opus 4.8 的两倍,即使 99% 的运行回退到 4.8
ProgramBench 结果显示,Fable 5 的性能是 Opus 4.8 的两倍,即使在 99% 的运行中回退到 4.8。
Opus 5在3D破坏物理方面优于Fable 5
Opus 5在3D破坏物理基准测试中优于Fable 5
@VraserX:Fable 5.1 在基准测试中表现确实令人印象深刻,尤其是在代理研究和编码方面,但这仍然感觉像是……
这条推文评论了 Fable 5.1 在代理研究和编码方面的出色基准测试,但认为这只是渐进式的改进,表达了对 OpenAI 的 Astra 的更多兴趣,因其潜在的持久记忆。