Fable 5 的 ProgramBench 结果已出,性能是 Opus 4.8 的两倍,即使 99% 的运行回退到 4.8
摘要
ProgramBench 结果显示,Fable 5 的性能是 Opus 4.8 的两倍,即使在 99% 的运行中回退到 4.8。
https://x.com/ValsAI/status/2066760552156971291 相当有趣的结果。ProgramBench 的创建者似乎在暗示,Fable 5 快速回退到 4.8 与 4.8 本身之间是有区别的,即使在那些消耗最多 4.8 token 的任务上也是如此。为什么在 Fable 5 的快速交接中,4.8 使用的 token 数量是 4.8 的两倍?
相似文章
@robinebers: Fable 5 Low 优于 Opus 4.8 Max
用户发帖比较,认为 Fable 5 Low 优于 Opus 4.8 Max,另一用户评论称 Fable 5 回归了但使用方式不当。
@danshipper: 这不对,这是同一个模型。但它会稍微更多地回退到 Opud 4.8,所以基准测试测量的是...
Dan Shipper 认为 Fable 5 模型并没有被削弱,而是更频繁地回退到 Opus 4.8,导致基准测试结果混杂,这与声称严重退化的说法相反。
在SlopCodeBench上对Opus 5进行基准测试
在SlopCodeBench基准测试中对Opus 5模型的性能进行测试。
Fable 5 基准测试(使用 remotion 视频)
Fable 5 在视频生成基准测试中相比 Opus 4.8 整体有所改进,但 Gemini 3.1 Pro 展现了更多艺术视野,尽管在工具调用和编写有 bug 的代码方面存在问题。
Opus 5在3D破坏物理方面优于Fable 5
Opus 5在3D破坏物理基准测试中优于Fable 5