MineBench 上 Fable 5 与 Fable 5.1 的差异
摘要
在 MineBench 上的基准测试显示,由于推理时间更长,Fable 5.1 的成本和推理时间均高于 Fable 5,但它能实现更详细的 3D 构建,包括可识别的室内环境。
注:平均推理时间:40分12秒,Fable 5 平均为18分04秒
总成本(15次构建):$147.55,Fable 5 成本 $54.93
平均 JSON 大小:34.07 MiB(最大 88.76 MiB),大致与 Fable 5 的平均 30.65 MiB 相当
尽管 API 定价未变,Fable 5.1 在 MineBench 上的成本几乎是 Fable 5 的三倍。
推理时间大约是两倍,其中大部分差异似乎源于推理时间显著延长。
考虑到 Anthropic 宣传的 API 价格相同,价格增长相当显著,尽管它仍然比 GPT 5.6 Sol P(当前排行榜上的顶级模型)便宜得多。
我觉得这很有趣,因为在我的个人使用中,GPT 5.6 Sol 对于我的 20 倍订阅来说效率极高,不过 MineBench 测试的是 5.6 Sol P 而非标准 Sol 变体 ^^
有些构建/风格我个人更喜欢 Fable 5 的。对我来说,Fable 5.1 的一些构建,比如宇航员,更接近 Opus 5 的风格,这让我好奇用 Fable 5.1 编码是什么感觉;如果 Fable 5.1 采用了 Opus 5 那种胡言乱语的英语风格,我会非常失望😭
另外,看到 Fable 5.1 实际上是第一个创建出真正可识别室内环境的模型,真的很有趣!
这里有一个视频展示 Fable 5.1 的小屋构建的内部(你可以看到一张床、一张桌子、一个书架和一个壁炉)– 现在你可以通过点击 voxelBox 标题中的操纵杆图标在 MineBench 上探索任何构建 :)
完整的发布说明/想法请见 GitHub 发布
如果你喜欢这些帖子,请随意资助基准测试
所有资金目前直接用于基准测试新提示的 API 成本
分享基准测试和给 Git 仓库加星也有帮助 :)
或者,如果你有 API 积分,请随意在画廊中添加提示和生成,并在各处发布!这实际上比直接捐赠给我更可取,托管费用等我一直能够自费支付,只是 API 成本难以覆盖😓
基准测试:https://minebench.ai/
Git 仓库:https://github.com/Ammaar-Alam/minebench
之前的帖子:
地图提示的比较
Fable 5 与 Opus 5 的比较
GPT-5.5 Pro 与 GPT-5.6 Sol 的比较
Opus 4.8 与 Fable 5 的比较
Opus 4.7 与 Opus 4.8 的比较
GPT 5.4 与 GPT 5.5 的比较
Kimi K2.5 与 Kimi K2.6 的比较
Opus 4.6 与 Opus 4.7 的比较
GPT 5.4 与 GPT 5.4-Pro 的比较
GPT 5.2 与 GPT 5.4 的比较
GPT 5.2 与 GPT 5.3-Codex 的比较
Opus 4.5 与 4.6 的比较,还回答了一些关于基准测试的问题
Opus 4.6 与 GPT-5.2 Pro 的比较
Gemini 3.0 与 Gemini 3.1 的比较
额外信息(如果你感到困惑):
本质上,这是一个测试模型创建 3D Minecraft 式结构能力的基准测试。
因此,模型被给定一个方块调色板(可以将它们想象成乐高)和一个构建提示,比如你在帖子中看到的第一个提示是一架战斗机。然后模型必须通过返回一个 JSON 来构建战斗机,其中给出每个方块/乐高的坐标(x, y, z)。
有趣的是看看哪个模型能够创建出给定提示的更好 3D 表示。
更智能的模型往往设计出更详细和复杂的构建。
仓库的 README 可能有助于更好地理解。
(免责声明:这是我创建的公共基准测试,所以从技术上讲是自我推广 :)
相似文章
Claude Opus 4.8 与 Claude Fable 5 在 MineBench 上的差异
对 Claude Opus 4.8 和 Claude Fable 5 在 MineBench 基准上的详细比较,重点突出了推理时间、成本、构建质量和提示敏感性方面的权衡。
Fable 5 在 Livebench 上甚至低于 Gemini 3.1
讨论 LiveBench 结果显示 Fable 5 表现低于 Gemini 3.1,质疑是该基准测试有缺陷,还是 Anthropic 在针对基准测试进行优化(benchmaxing)。
Fable 5 基准测试(使用 remotion 视频)
Fable 5 在视频生成基准测试中相比 Opus 4.8 整体有所改进,但 Gemini 3.1 Pro 展现了更多艺术视野,尽管在工具调用和编写有 bug 的代码方面存在问题。
Opus 5在3D破坏物理方面优于Fable 5
Opus 5在3D破坏物理基准测试中优于Fable 5
Fable 5不再是第一了!?根据公司公告,Sakana的Fugu在某些情况下击败了它
根据Sakana AI的公司博客,其新模型Fugu在LiveCodeBench和Terminal Bench 2.1上以微小的优势超越了Fable 5,尽管结果尚未得到独立确认。