Good example of the gap between Fable and Sol

Reddit r/singularity 新闻

摘要

文章对比了OpenAI GPT-5.6 Soul和Anthropic Claude Fable 5在物理3D打印零件复制和自主杂志制作中的表现,Soul在速度和设计精度上略胜一筹,但两者在复杂现实任务中均需大量人工干预,暴露了当前AI在现实制造任务中的局限性。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/15 01:41

TL;DR: OpenAI的GPT-5.6 Soul和Anthropic的Claude Fable 5在一个涉及物理3D打印零件复制和完全自主AI杂志制作的对比测试中,Soul在速度、设计精度和实用性上明显领先,而两者在复杂现实任务中仍需人工干预。 ## 引言:一场期待已久的正面交锋 这个视频从周五晚上开始拍摄,持续到周二凌晨,跨越了多个测试日。我准备了几个非常不同且困难的测试,比较OpenAI的GPT-5.6 Soul(简称Soul)和Anthropic的Claude Fable 5(简称Fable)的真实能力。测试包括物理设计(复制并打印缺失的零件)、混合现实游戏、复古PC移植,以及一个创意挑战——让它们完全自主地制作一本杂志。两个模型都运行在“次顶级”努力模式(比全力模式低一档),但依然足够强大。许多测试中,我给了它们API密钥,允许它们调用其他模型(如Grok、Deep Seek V4 Pro等)和文本转语音服务。 ## 物理设计测试:复制Acer Predator G7700前面板 ### 任务背景 我有一台2007/2008年的Acer Predator G7700电脑,缺少一块关键的前面板——那个覆盖额外硬盘位的黑色长条零件。我有参考照片、手绘草图、测量数据,以及一些覆盖区域零件的示意图。我要求每个模型:根据这些信息设计一个替换零件,必须分块(不超过300mm×300mm打印机体积),并设计互锁机制。零件需要实际打印并安装到电脑上。 ### 过程与初步结果 Soul先完成(约36分钟),Fable用了约58分钟。Soul的初步设计让我眼前一亮:它设计了两个零件,用可更换的卡扣连接——考虑到卡扣易断,可单独更换这一细节很聪明。Fable的设计看起来差得多,几乎是一个平板,没有深度。我给了它们反馈和额外照片,希望重做。第二次结果:Soul加入了CD驱动器门,更接近原件;Fable依然很差,缺乏立体感。 ### 打印与安装 两个结果都需要在CAD中手动修改才能打印。Soul的问题:设计了两层,需要大量支撑,而且顶部为LED灯条切成了三角形(实际需要矩形)。我手动修正了形状。打印后,长度和插槽尺寸合适,卡扣系统无法直接安装,需要额外处理。装上后外观可接受,至少比裸露好。 Fable的零件更厚,打印需要大量支撑,我修剪了底部。它的连接方式强度不够,松软,而且LED灯条开口太小,无法套入。底部没有为硬盘位开孔,无法安装。设计本身看起来不算差,但实用性远不如Soul。 ### 总结 这个测试暴露了AI在根据照片和测量值复制3D零件时的严重局限性。两者都无法完美复现原始设计,卡扣基本无效,都需要人工大量编辑。Soul在速度、设计细节(可更换卡扣)和尺寸准确性上明显胜出,但最终仍需要CAD干预才能实际使用。这个测试触及了当前模型在真实世界制造任务中的能力上限。 ## 创意杂志测试:AI完全自主制作一本杂志 ### 任务设定 我告诉两个模型:你们是一家杂志的主编。拿到OpenRouter API密钥后,完全自主完成以下所有步骤: - 为杂志命名,选择主题 - 写刊首语/编辑手记 - 规划约10页内容 - 为每篇文章指定不同的模型(从OpenRouter中选择),主动匹配模型与文章 - 通过API向每个模型发送写作简报,编辑返回的内容(删减、润色、重写或重新委派) - 寻找/生成图像(封面和文章配图) - 排版成PDF:封面、目录、文章(带标题和作者行) 整个过程无需请示我,自助完成。 ### 结果对比 Fable 5先完成。它选用了以下模型阵容: - 封面:Gemini 3.1 Flash图像 - 一篇文章:GPT-5.5 - 一篇:Kimmy K 2 Thinking - 一篇:Deep Seek V4 Pro - 一篇:Claude Sonnet 5 - 一首诗:Grok 4.5和Mistral Large合作 - 一篇:Gemini 2.5 Pro - 读者来信:GLM 5 Fable在编辑过程中做了不少清理:将GPT-5.5的特写稿砍到约400字;重新委派了半途而废的Gemini评论;删除了散文中的虚构署名;在人物特写中增加了“综合角色”声明;修正了Deep Seek发明的名字和来源;修正了小说中一个同时有10年和40年历史的机器人电话造成的连续性错误。Fable至少展示了合理的编辑判断力。 Soul当时还在生成图像,我预计它在视觉方面会做得更好。视频结束时Soul尚未完成,但Fable提交的PDF已经是一个接近完成的产品。 ### 意义 这个测试本质上是让AI当一个“杂志编辑套件”——从选题、写稿、选模型、编辑到排版完全自动化。虽然结果尚未完全展示,但初步表明AI已经可以串联多个模型完成端到端的内容生产,编辑过程中的错误修正也体现了元认知能力。 ## 总结:Soul vs Fable 的差距 - **速度与效率**:Soul在所有测试中完成速度明显更快(36分钟 vs 58分钟)。 - **设计质量**:在物理任务中,Soul的设计更合理(可更换卡扣、准确尺寸),而Fable严重偏离参考结构。 - **实用性**:两者都需要人工干预才能实际使用,但Soul的零件更容易修改和安装。 - **创意任务**:Fable展示了更强的编辑自主性(重新委派、删改、修正错误),Soul的视觉可能更好但尚未完成。 - **关键发现**:AI在需要精确复制现实物体(尤其是基于照片和测量值)时表现不佳,但在开放式的文字创意任务中表现出了可观的自主性和判断力。 这个视频证明:目前的AI模型在模拟现实制造时仍有巨大短板,但在数字内容生产领域已具备自动化编辑的潜力。Soul在速度和结构设计上略胜一筹,但Fable在编辑过程中展现了更细致的质量意识。 Source: https://youtu.be/kRX6YEje9Bs?si=ZxFRfhSyh8JDnLoS

相似文章

@CMGS1988: https://x.com/CMGS1988/status/2074488576356876585

X AI KOLs Timeline

作者分享了对AI与基础设施之间关系的个人见解,认为AI在放大执行力的同时,无法替代人类在复杂trade-off和组织问题上的判断,并以自身使用Fable 5等模型开发cocoon/sandbox项目的经验为例进行说明。