Claude Opus 4.8 与 Claude Fable 5 在 MineBench 上的差异
摘要
对 Claude Opus 4.8 和 Claude Fable 5 在 MineBench 基准上的详细比较,重点突出了推理时间、成本、构建质量和提示敏感性方面的权衡。
**一些说明:**
* *平均推理时间:18分04秒(1084.4秒)*
* 快于 Claude 4.8 Opus,后者平均为24分48秒/1487.9秒
* 令人惊讶的是,在 [Claude.ai](http://Claude.ai) 网页端,Fable 感觉思考时间更长,但通过 API 平均总时间却比 Opus 4.8 少
* *总成本(15次构建):54.93美元*
* 比 Opus 4.8 更贵,后者15次构建花费41.52美元
* 考虑到 Fable 的 API 定价是 Opus 4.8 的两倍,MineBench 成本仅高出约30%
* Fable 生成的总 token 似乎更少,这可能是成本较低的原因
此外,我认为模型构建的质量非常令人惊讶:它们相对于 GPT 5.5 Pro 的提升似乎并没有[官方基准分数所暗示的那么大](https://www.anthropic.com/_next/image?url=https%3A%2F%2Fwww-cdn.anthropic.com%2Fimages%2F4zrzovbb%2Fwebsite%2F1e65982497d7d4891219ed0e83141625a291b860-2600x2870.png&w=3840&q=75),但模型显然非常注重细节。例如,这是第一个在 Arcade Machine 构建中实际创建了正确详细屏幕(PacMan)的模型,包括完整布局、分数,甚至还有一个“1UP”标签。不过,模型对系统提示的解释似乎相当保守,并且(主观上)并非所有构建都明显优于 4.8。尽管如此,结果仍然相当令人惊讶,于是我联系了 [VoxelBench](https://voxelbench.ai/) 团队,他们也确认在他们的测试中,构建的规模通常要小得多。他们提到在模板中添加这两行会产生更好的构建:
细节级别:最大
边界框:无限制
虽然我不会为了迎合特定模型而更改 MineBench 系统提示,但我认为值得指出的是,通过改进提示或许可以获得更好的结果。同样有趣的是,该模型能够构建这些精细结构,同时保持整体 JSON 大小比 Opus 4.8 更小,并且思考时间更短。纯属猜测:我认为这可能表明为什么 Claude Fable 据称在编码相关任务上表现更好;它实际上以直观的方式完成任务,不会添加多余内容。
* 完整发布说明/想法请见 [GitHub release](https://github.com/Ammaar-Alam/minebench/releases/tag/3.7.0)
* **如果你喜欢这些帖子,请随时帮助** [**资助**](https://buymeacoffee.com/ammaaralam) **基准测试**
**基准测试:** [https://minebench.ai/](https://minebench.ai/)
**Git 仓库:** [https://github.com/Ammaar-Alam/minebench](https://github.com/Ammaar-Alam/minebench)
**以往文章:**
* [比较 Opus 4.7 和 Opus 4.8](https://www.reddit.com/r/ClaudeAI/comments/1tt3a8h/differences_between_opus_47_and_opus_48_on/)
* [比较 GPT 5.4 和 GPT 5.5](https://www.reddit.com/r/singularity/comments/1sxapqb/differences_between_gpt_54_and_gpt_55_on_minebench/)
* [比较 Kimi K2.5 和 Kimi K2.6](https://www.reddit.com/r/LocalLLaMA/comments/1srs4uj/differences_between_kimi_k25_and_kimi_k26_on/)
* [比较 Opus 4.6 和 Opus 4.7](https://www.reddit.com/r/ClaudeAI/comments/1sofgno/differences_between_opus_46_and_opus_47_on/)
* [比较 GPT 5.4 和 GPT 5.4-Pro](https://www.reddit.com/r/OpenAI/comments/1rr0vi4/differences_between_gpt_54_and_gpt_54pro_on/)
* [比较 GPT 5.2 和 GPT 5.4](https://www.reddit.com/r/singularity/comments/1rluvdz/difference_between_gpt_52_and_gpt_54_on_minebench/)
* [比较 GPT 5.2 和 GPT 5.3-Codex](https://www.reddit.com/r/OpenAI/comments/1rdwau3/gpt_52_versus_gpt_53codex_on_minebench/)
* [比较 Opus 4.5 和 4.6,并回答了一些关于基准测试的问题](https://www.reddit.com/r/ClaudeAI/comments/1qx3war/difference_between_opus_46_and_opus_45_on_my_3d/)
* [比较 Opus 4.6 和 GPT-5.2 Pro](https://www.reddit.com/r/OpenAI/comments/1r3v8sd/difference_between_opus_46_and_gpt52_pro_on_a/)
* [比较 Gemini 3.0 和 Gemini 3.1](https://www.reddit.com/r/singularity/comments/1ra6x6n/fixed_difference_between_gemini_30_pro_and_gemini/)
**额外信息(如果你感到困惑):** 本质上,这是一个测试模型创建类似 Minecraft 的 3D 结构能力的基准测试。模型会获得一组方块(可以想象成乐高积木)和一个构建提示,例如你在这篇文章中看到的第一个提示是一架战斗机。然后模型必须通过返回一个 JSON 来构建战斗机,JSON 中给出每个方块/乐高的坐标(x, y, z)。观察哪个模型能够更好地创建给定提示的 3D 表示是很有趣的。更智能的模型往往能设计出更详细和更复杂的构建。仓库的 README 可能有助于更好地理解。*(声明:这是我创建的一个公开基准测试,所以技术上算是自我推广 : )*
相似文章
Minebench中Train 5.2→5.5与Opus 4.6→Fable 5
在Minebench(Minecraft)基准测试中,对GPT和Claude Opus多种模型版本进行比较,并针对特定建筑对GPT-5.5和Fable 5进行了详细评判。
MineBench上Opus 4.7与Opus 4.8的区别
Opus 4.8在MineBench 3D方块结构基准测试中相比Opus 4.7展现出更高的构建质量和更低的成本,尽管存在一些不一致性。该模型展示了更精简的推理过程和更高的推理效率。
Opus 5 即将登陆 MineBench
Claude Opus 5 在 MineBench 基准测试上的预期结果即将公布。
Claude Opus 5 基准测试!
一篇介绍即将推出的 Claude Opus 5 AI 模型基准测试结果的文章。
Claude Fable 5 基准测试
Anthropic 发布了 Claude Fable 5(一款新的人工智能模型)的基准测试,显示出显著的性能提升。