@karpathy:我们正开始离开那种用例如“创建一只骑自行车的鹈鹕的SVG”来测试LLM的领域。作为一个…
摘要
安德烈·卡帕西分享了一个实验:Claude Opus 5 使用 100 万 token 的预算,在 three.js 中程序化地渲染《指环王》,引发了对 LLM 测试、自定义世界生成和多模态弱点的思考。
查看缓存全文
缓存时间: 2026/08/03 01:46
我们正开始走出一个阶段:测试LLM的方式是让它“创建一个骑自行车的鹈鹕的SVG”。作为推广这一思路的一个想法,我很好奇,如果给Opus 5《指环王》的第一段,100万token的预算(约10美元),并让它用Three.js渲染出来,它会怎么做。Opus 5花了大约2个小时,写了5500行代码,以(程序化地)渲染出这个故事。结果有点粗糙,但很有趣。但真正令人难以想象的是,LLM必须在(x,y,z)坐标中放置并编排各种多边形资源,编写代码让这一切动起来,而且它居然真的能做出来。
我也喜欢这类例子,因为头脑正常的人绝不会花时间写这么定制化的东西,但LLM有取之不尽的耐力和耐心。所以这是一个例子,让我们从“没人会这么做”变成“当然,为什么不呢,几乎免费”。可能还有很多这样的例子。但我感到兴奋的是,可以创建超定制的世界,让你想象把玩家投入其中,比如作为一个旁观者NPC,或作为其中一个角色,参与《指环王》的故事,等等。就像是按需生成的、短暂的“X版GTA”。
最后一点想法是,世界/游戏领域暴露了LLM的一个弱点:它们不易审查自己的工作,因为它们无法高效且原生地感知视频,或在其中玩游戏。在这里,Opus 5不得不非常缓慢而费力地在不同时间点截屏,而且它还搞砸了几次,产生了一大堆粗糙的结果。我认为,这正是仍然相当欠缺的原始能力(多模态、游戏玩法)的一个例子。
相似文章
Karpathy的鹈鹕
Andrej Karpathy使用Opus 5进行实验,给它《指环王》的第一段和100万token的预算,让其创建故事的3D JS渲染,突显了LLM在超定制世界方面的耐力,同时指出了在多模态审计和游戏玩法方面的弱点。
@karpathy: More on the pelican on the bicycle test from @simonw: https://simonwillison.net/2025/Jun/6/six-months-in-llms/… I uploa…
Simon Willison's keynote at AI Engineer World's Fair reviews the last six months in LLMs, highlighting over 30 significant model releases and his 'pelican on a bicycle' SVG benchmark as a practical evaluation tool.
@omarsar0:受 @karpathy 的 LLM 知识库想法启发的 LLM Artifacts,我一直在构建一种生成动态产物的有趣方式……
受 @karpathy 的 LLM 知识库想法启发,我一直在构建 LLM Artifacts:一种有趣的方式,可以从这些知识库中生成动态产物,旨在发现并揭示有意义且更深层的洞察。LLM 知识库对人类来说很难直接理解消化,正如我
@omarsar0: Fable 5 在 threejs 上绝对是猛兽。它是生成3D模拟/世界的最佳LLM。看看我如何将其与…
Fable 5 被强调为使用 threejs 生成3D模拟/世界的最佳LLM,并且它可以与 gpt-realtime-2 结合创建交互式教育3D世界。
@yoheinakajima:谁想帮Eyal在这个方法上挑毛病——在浏览器中运行LLM推理?
Eyal Toledano 使用纯 WebGPU/WGSL 构建了一个LLM推理引擎,可在浏览器和Node中无API密钥地本地运行,并正寻求同行评审。