Good example of the gap between Fable and Sol
摘要
文章对比了OpenAI GPT-5.6 Soul和Anthropic Claude Fable 5在物理3D打印零件复制和自主杂志制作中的表现,Soul在速度和设计精度上略胜一筹,但两者在复杂现实任务中均需大量人工干预,暴露了当前AI在现实制造任务中的局限性。
暂无内容
查看缓存全文
缓存时间: 2026/07/15 01:41
TL;DR: OpenAI的GPT-5.6 Soul和Anthropic的Claude Fable 5在一个涉及物理3D打印零件复制和完全自主AI杂志制作的对比测试中,Soul在速度、设计精度和实用性上明显领先,而两者在复杂现实任务中仍需人工干预。
## 引言:一场期待已久的正面交锋
这个视频从周五晚上开始拍摄,持续到周二凌晨,跨越了多个测试日。我准备了几个非常不同且困难的测试,比较OpenAI的GPT-5.6 Soul(简称Soul)和Anthropic的Claude Fable 5(简称Fable)的真实能力。测试包括物理设计(复制并打印缺失的零件)、混合现实游戏、复古PC移植,以及一个创意挑战——让它们完全自主地制作一本杂志。两个模型都运行在“次顶级”努力模式(比全力模式低一档),但依然足够强大。许多测试中,我给了它们API密钥,允许它们调用其他模型(如Grok、Deep Seek V4 Pro等)和文本转语音服务。
## 物理设计测试:复制Acer Predator G7700前面板
### 任务背景
我有一台2007/2008年的Acer Predator G7700电脑,缺少一块关键的前面板——那个覆盖额外硬盘位的黑色长条零件。我有参考照片、手绘草图、测量数据,以及一些覆盖区域零件的示意图。我要求每个模型:根据这些信息设计一个替换零件,必须分块(不超过300mm×300mm打印机体积),并设计互锁机制。零件需要实际打印并安装到电脑上。
### 过程与初步结果
Soul先完成(约36分钟),Fable用了约58分钟。Soul的初步设计让我眼前一亮:它设计了两个零件,用可更换的卡扣连接——考虑到卡扣易断,可单独更换这一细节很聪明。Fable的设计看起来差得多,几乎是一个平板,没有深度。我给了它们反馈和额外照片,希望重做。第二次结果:Soul加入了CD驱动器门,更接近原件;Fable依然很差,缺乏立体感。
### 打印与安装
两个结果都需要在CAD中手动修改才能打印。Soul的问题:设计了两层,需要大量支撑,而且顶部为LED灯条切成了三角形(实际需要矩形)。我手动修正了形状。打印后,长度和插槽尺寸合适,卡扣系统无法直接安装,需要额外处理。装上后外观可接受,至少比裸露好。
Fable的零件更厚,打印需要大量支撑,我修剪了底部。它的连接方式强度不够,松软,而且LED灯条开口太小,无法套入。底部没有为硬盘位开孔,无法安装。设计本身看起来不算差,但实用性远不如Soul。
### 总结
这个测试暴露了AI在根据照片和测量值复制3D零件时的严重局限性。两者都无法完美复现原始设计,卡扣基本无效,都需要人工大量编辑。Soul在速度、设计细节(可更换卡扣)和尺寸准确性上明显胜出,但最终仍需要CAD干预才能实际使用。这个测试触及了当前模型在真实世界制造任务中的能力上限。
## 创意杂志测试:AI完全自主制作一本杂志
### 任务设定
我告诉两个模型:你们是一家杂志的主编。拿到OpenRouter API密钥后,完全自主完成以下所有步骤:
- 为杂志命名,选择主题
- 写刊首语/编辑手记
- 规划约10页内容
- 为每篇文章指定不同的模型(从OpenRouter中选择),主动匹配模型与文章
- 通过API向每个模型发送写作简报,编辑返回的内容(删减、润色、重写或重新委派)
- 寻找/生成图像(封面和文章配图)
- 排版成PDF:封面、目录、文章(带标题和作者行)
整个过程无需请示我,自助完成。
### 结果对比
Fable 5先完成。它选用了以下模型阵容:
- 封面:Gemini 3.1 Flash图像
- 一篇文章:GPT-5.5
- 一篇:Kimmy K 2 Thinking
- 一篇:Deep Seek V4 Pro
- 一篇:Claude Sonnet 5
- 一首诗:Grok 4.5和Mistral Large合作
- 一篇:Gemini 2.5 Pro
- 读者来信:GLM 5
Fable在编辑过程中做了不少清理:将GPT-5.5的特写稿砍到约400字;重新委派了半途而废的Gemini评论;删除了散文中的虚构署名;在人物特写中增加了“综合角色”声明;修正了Deep Seek发明的名字和来源;修正了小说中一个同时有10年和40年历史的机器人电话造成的连续性错误。Fable至少展示了合理的编辑判断力。
Soul当时还在生成图像,我预计它在视觉方面会做得更好。视频结束时Soul尚未完成,但Fable提交的PDF已经是一个接近完成的产品。
### 意义
这个测试本质上是让AI当一个“杂志编辑套件”——从选题、写稿、选模型、编辑到排版完全自动化。虽然结果尚未完全展示,但初步表明AI已经可以串联多个模型完成端到端的内容生产,编辑过程中的错误修正也体现了元认知能力。
## 总结:Soul vs Fable 的差距
- **速度与效率**:Soul在所有测试中完成速度明显更快(36分钟 vs 58分钟)。
- **设计质量**:在物理任务中,Soul的设计更合理(可更换卡扣、准确尺寸),而Fable严重偏离参考结构。
- **实用性**:两者都需要人工干预才能实际使用,但Soul的零件更容易修改和安装。
- **创意任务**:Fable展示了更强的编辑自主性(重新委派、删改、修正错误),Soul的视觉可能更好但尚未完成。
- **关键发现**:AI在需要精确复制现实物体(尤其是基于照片和测量值)时表现不佳,但在开放式的文字创意任务中表现出了可观的自主性和判断力。
这个视频证明:目前的AI模型在模拟现实制造时仍有巨大短板,但在数字内容生产领域已具备自动化编辑的潜力。Soul在速度和结构设计上略胜一筹,但Fable在编辑过程中展现了更细致的质量意识。
Source: https://youtu.be/kRX6YEje9Bs?si=ZxFRfhSyh8JDnLoS
相似文章
@mylifcc: Jason 这个真实项目对比写得很好。 Fable 5 在复杂 coding 任务上的表现确实亮眼:几乎不犯低级错误、主动考虑 edge case、严格遵循 brand system,还能在 13 年老代码库里快速解决 GPT 多次失败的…
用户@mylifcc分享对Fable 5和GPT-5.6 Sol在复杂编码任务上表现的评价,认为Fable 5准确率高但成本高,提出混合工作流模式,引发对模型组合使用的讨论。
@petergostev: 我对Fable 5与GPT-5.6-Sol的看法。它们不是容易比较的模型,这些是我的主观感受——信不信由你。我…
Peter Gostev比较了Fable和GPT-5.6-Sol,认为Fable更聪明、更有口才但可靠性较差,而GPT-5.6-Sol则是一个勤奋的“工作马”,擅长执行任务和保持代码模式。他详细观察了UI、写作、稳健性及其他功能。
@FinanceYF5: 这个结论可能会让市场感到意外:实际上,OpenAI 的增长速度已经超过 Anthropic。 Ramp 数据显示,Q3 至今两者环比增长分别为【82% 和 76%】。 为什么? GPT-5.6 Sol 正在成为更多开发者的选择;Fable…
OpenAI 的增长速度超过 Anthropic,Q3 环比增长分别为 82% 和 76%,主要由于 GPT-5.6 Sol 更受开发者欢迎,而 Fable 5 因成本和数据问题采用不及预期。
@CMGS1988: https://x.com/CMGS1988/status/2074488576356876585
作者分享了对AI与基础设施之间关系的个人见解,认为AI在放大执行力的同时,无法替代人类在复杂trade-off和组织问题上的判断,并以自身使用Fable 5等模型开发cocoon/sandbox项目的经验为例进行说明。
@mattshumer_: 我提前体验了GPT-5.6 Sol。这是一个令人惊叹的模型,但在我测试的几乎所有任务中,Fable都要好得多…
Matt Shumer透露了提前体验GPT-5.6 Sol的情况,指出该模型令人印象深刻,但Fable在大多数任务上表现更优且更具自主性,并承诺在发布日提供完整评测。