Ethan Mollick:与Mythos合作是什么感受
摘要
Ethan Mollick评测了Mythos级别的AI模型Claude 5 Fable的早期访问版,认为相比之前的模型,这是一个重大飞跃,能够通过单条提示生成复杂的游戏、学术论文和地图,暗示人机交互方式的转变。
暂无内容
查看缓存全文
缓存时间: 2026/06/10 00:23
# 与Mythos共事的感受
我获得了首个向公众发布的Mythos级AI模型——Claude 5 Fable的早期访问权限。关于Mythos的讨论大多集中在其对软件安全的影响上,但我对除安全之外的所有方面都进行了测试(Fable的防护措施基本上完全阻止了它用于网络安全)。我的结论是:它比我之前使用过的所有模型都迈出了实实在在的一大步,而且更重要的是,它表明我们与AI的关系正在发生剧变。
首先,Fable有多好?在我进行的一个又一个实验中,它的表现基本上远超我用过的所有其他公开模型。它能处理多种问题,并产生一些惊人的成果——它可以连续工作十几个小时来执行多页规格说明。我很快会带您看几个更复杂、更严肃的用例,但您可以看到它在所有任务上的全面进步。在文章中传达这一点的问题在于,许多最令人印象深刻的成果可能只对一小部分读者有吸引力。例如,它[仅凭一句提示和一次反馈](https://verdicts-not-evidence-paper.netlify.app/),就产出了我所见AI生成的最复杂的学术社会科学论文。它还创作了一首关于剪头发的[10页史诗级押韵诗](https://claude.ai/public/artifacts/32ebc671-f415-4072-b46d-5353d4ffaad4),其中每个单词都以字母s开头。
所以,作为一个更容易上手且有趣的例子,我还让它创建了一系列您可以尝试的游戏。所有这些游戏都是在Claude Code中通过一次初始提示完成的,Fable必须根据我模糊的提示生成可运行的东西,然后再加上一些包含轻微鼓励(“让它更好”)或反馈的额外提示。这些游戏特别令人印象深刻的是,Claude无法生成图像,所以每一件艺术品或3D对象完全是通过数学运算生成的,没有使用任何外部资源。您可以试试它们:一个关于[抛硬币的游戏](https://play-flipside.netlify.app/)(提示:“Balatro,但用于抛硬币游戏”)挺有趣的;一个[蛇类游戏](https://snake-stable-build.netlify.app/),蛇有自我意识,会发生疯狂的事情;或者一个关于[深入地下](https://strata-descent.netlify.app/)探索的游戏。
所以输出结果令人印象深刻。但是,尤其当我转向更严肃的项目时,我常常觉得使用这个工具的感觉介于愉悦和不安之间。愉悦是因为我只是提出要求,事情就发生了。不安也是因为我只是提出要求,事情就发生了。
要理解原因,了解Fable完成工作的方式会有所帮助。为此,我想用一个我之前在许多AI模型上测试过的例子:构建等时地图。这种地图显示在给定时间内可以到达的距离,第一张此类地图于1881年创建,显示了从伦敦出发的旅行时间。
[原版地图]
没有哪个之前的模型在尝试创建这样的地图时能做出哪怕一半有用的事情,因为这涉及到研究数千个可能的行程距离和大量微小的判断与决策。我决定用Fable在Claude Code中尝试,提示如下:
*我想让你构建一张经过充分研究且美观的等时地图,让我可以选择不同的城市,并看到基于真实数据的真实等时线。我要求设计独特。你应该考虑机场(以及往返机场的旅行时间)、火车、步行、驾车。数据不需要是实时的,但应基于你的研究和数据真实可靠。你可以从几个城市开始,但越普遍越好,这应该是一个全新的项目。*
然后它建议以原始地图的风格来做。我同意了,它就开始工作了。
值得再看一下AI独自经历的、长达数小时的构建过程的记录,因为您可以看到一些不寻常的事情。首先,AI启动了多个其他AI(我相信主要是更便宜的Claude Sonnet)来帮助它进行旅行时间研究,最终检索了超过2200个特定航班、从TGV到新干线的铁路时刻表,以及来自多篇学术论文的各国道路速度。在这些代理运行时,它开始编码。然后它启动了更多的代理和测试来验证其代码,同时记录其进展。
[图片]
结果是一个功能完备、非常精妙的地图,看起来很像1881年的原始版本,但这并不意味着它完美无缺。我注意到许多偏远地点(如格陵兰)只包含旅行时间的估算值,而不是精确数字,所以我告诉Fable修复它,指示包括:*实际上要获取到偏远机场和地点的旅行时间。*这次,AI启动了一个工作流,包括进行研究和相互测试结果的对抗性代理组。它弄清楚了船只多久航行到太平洋的皮特凯恩岛一次,以及如何从渥太华到达格赖斯峡湾。它在非常短的时间内使用了大量的令牌(稍后会详细说明)。
[图片]
结果令人印象深刻。我又朝着我感兴趣的方向推动了几次(包括要求其他可视化方法等)。我建议您花几分钟[点击查看结果](https://isochronic-passage-chart.netlify.app/#nyc),您可以在图表底部阅读其方法和来源。
[图片] AI生成的内容。点击地图可进入交互式版本
这对您来说可能不是一个有用的项目,除非您真的喜欢旅行和地图,但它表明了AI解决了一个涉及研究、数学、视觉开发、品味、判断、复杂编码等难题。而且,令人不安的部分是我做得如此之少。我给出了一个非常雄心勃勃的指令,AI就执行了。我给出了一些微小的反馈,AI就搞定了。我的角色极其有限。
重要的是,不仅是我与模型相比所做的工作量有限,而且我对模型如何做事、为什么选择特定方法,甚至其结果会有多深入的控制也有限。AI决策过程的细节没有向我展示,而且这个过程太长了,根本不值得跟踪。这张地图要求AI对数百个小选择做出判断,它就直接做出了,我没有理解这些选择,也没有机会参与。在许多方面,这堪称奇迹(我总能在最后要求修改),另一方面,这又使AI变成了一个终极黑箱。
我从Fable那里获得的最雄心勃勃的项目需要更多的解释。我做了很多研究,其中人类会产生混乱的答案,进行任何形式的分析都需要正确地对这些答案进行分类:这个想法有多创新?人们为什么喜欢这本书?为了解决这个问题,我们让人类研究人员对一条信息做出判断,并将他们的答案与其他人的进行统计比较,以确定我们是否能够信任这些数据。最近的许多研究表明,AI或许能够胜任这项重要工作,但校准AI和人类的判断一直很困难且昂贵。所以我让Fable来解决这个问题,首先生成了一份[复杂的19页设计文档](https://claude.ai/public/artifacts/35ab6e17-fbf4-4cf1-9362-2c55a9afa57c),然后执行它。
它工作了九个半小时。
[图片]
结果是AI创建了一个名为Concord的极其复杂的软件,它可以接收多个数据集,校准人类和AI的响应,然后对结果进行复杂的数据分析。同样,它并不完美。作为专家,我能够发现一些错误和遗漏(有些是我要求的设计导致的结果),并让AI修正。但该项目以及其他许多项目的交付范围超出了我以前见过的一切。在这种情况下,它是一个研究人员多年来一直需要但从未有利可图去创建的软件。您现在可以在此处使用或修改代码。我相信它并不完美(我只花了一个小时处理结果),但软件工程师会解决我无法快速找到的剩余潜在错误(这也是为什么我们未来可能需要更多,而不是更少的程序员,来帮助处理软件新用途的激增)。
这种能力与奇特性和局限性相伴。其中的局限性包括其令牌使用量。Fable的价格是Opus的两倍,并且它以惊人的速度消耗令牌,这表明其生产成本“很高”,尽管它巧妙地将任务委托给更便宜的模型可能会大大降低实际价格。Fable的防护措施在出现最轻微的安全问题时也会触发,回退到能力较弱的Claude 4.8 Opus,而且这种情况发生得太频繁了。锯齿状的前沿仍然存在。例如,AI仍然以同样奇怪的风格写作(事实上,Fable生成的软件带有Claudisms的痕迹;它的进度报告也是如此,都承载着重量,并赢得答案)。但更深层次的奇特之处在于我需要做的如此之少,以及在任务进行过程中我能看到的如此之少。
去年,我称之为与[巫师](https://www.oneusefulthing.org/p/on-working-with-wizards)共事:你念咒语,事情就发生了。有了Fable,咒语已经变得足够强大,以至于我不再确定我是那个巫师。我更接近于一个赞助人。我描述我想要什么,我为此付钱,然后我评判结果。这种召唤发生在某个我无法观察的地方,经历着数百个我永远无法投票的小选择。工作已从过程转向结果。我不再掌舵;我委托任务。
这种边缘化可能是暂时的,只是尚未跟上的界面的产物,我们将会更好地了解这些模型在做什么,并更好地在过程中引导它们。反之也可能是真的:模型的能力越强,人类有意义地去做的就越少,而黑箱就是这种能力的代价。我怀疑后者更可能是真正的方向。这都不是在明显意义上的失控。我仍然可以引导Fable,它非常出色地遵循指令:指令越雄心勃勃,结果就越好。但引导不再等同于执行。我向模型简要说明情况,它启动自己的代理进行研究、编写和相互检查工作,然后返回成品。一个赞助人委托一个单一的艺术家。Fable更接近于一个完整的工作室,而我是那个客户,在未曾踏足生产现场的情况下批准最终作品。
[分享](https://www.oneusefulthing.org/p/what-it-feels-like-to-work-with-mythos?utm_source=substack&utm_medium=email&utm_content=share&action=share)
相似文章
Anthropic 发布首个 Mythos 级模型 Claude Fable
Anthropic 宣布推出 Claude Fable 5,这是其迄今最强大的广泛可用 AI 模型,属于此前被认为过于危险而不得公开发布的 Mythos 系列。该模型引入了新的安全机制,在高风险领域会降级至 Opus 4.8。
@liu8in: 测试 Mythos 两小时 - 目前最好的代码到动作大模型,Claude Code + Fable 5 一次性生成了这个 @HyperFrames_ 启动模板
宣布推出 Mythos 级别的模型 Claude Fable 5,其能力超越此前所有通用模型,已在代码到动作任务中经过测试。
Anthropic 的 Claude Fable 5 是公众今天可以访问的 Mythos 版本
Anthropic 发布了 Claude Fable 5,这是其强大的 Mythos 模型的公开可访问版本,配备安全护栏,可阻止高风险领域的响应,并回退到较弱的模型。此次发布是在 Anthropic 警告 AI 变得过于危险并推动协调安全措施之后进行的。
@github: Claude Fable 5,@AnthropicAI 旗下 Mythos 模型类中的首个模型,现已全面上线并在 GitHub Co…
Claude Fable 5 是 Anthropic 旗下 Mythos 类模型中的首个模型,现已全面登陆 GitHub Copilot。它专为长周期、自主编程及知识工作任务而设计,相比之前的 Opus 层级模型效率更高。
测试 Mythos 和 Fable,超越 SWE-bench,Nvidia 的开放竞争者
Anthropic 发布带有严格防护措施的 Claude Fable 5,以及美国政府随后对该模型实施的出口管制,引发了人们对 AI 主权和专有 AI 平台稳定性的担忧。