为什么大语言模型在电子游戏中表现如此糟糕?

Hacker News Top 新闻

摘要

一篇对Julian Togelius的采访探讨了大语言模型为何难以胜任电子游戏,原因包括游戏多样性、数据稀缺以及缺乏通用游戏AI,同时指出像Gemini借助自定义软件击败《宝可梦:蓝》这样的例外情况。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/01 10:41

# 为何电子游戏仍让AI模型困惑 来源:https://spectrum.ieee.org/ai-video-games-llms-togelius 大型语言模型(https://spectrum.ieee.org/tag/large-language-models)(LLMs)进步迅猛,以至于基准测试本身(https://spectrum.ieee.org/ai-math-benchmarks)也在不断演进,不断加入更复杂的问题以挑战最新模型。然而,LLMs 并非在所有领域都取得了进步,有一项任务仍远超出其能力范围:它们完全不知道如何玩电子游戏(https://spectrum.ieee.org/tag/video-games)。 尽管少数模型成功攻克了某些游戏(例如,Gemini 2.5 Pro 在 2025 年 5 月击败了《宝可梦 蓝》(https://techcrunch.com/2025/05/03/googles-gemini-has-beaten-pokemon-blue-with-a-little-help/)),但这些例外恰恰印证了规律。最终获胜的 AI 完成游戏的速度远低于普通人类玩家,犯下奇怪且往往重复的错误,并且需要定制软件来引导其与游戏交互。 纽约大学游戏创新实验室(http://game.engineering.nyu.edu/)主任、AI 游戏测试公司 Modl.ai 联合创始人 Julian Togelius(http://julian.togelius.com/)在近期一篇论文(http://julian.togelius.com/Togelius2026What.pdf)中探讨了 LLMs 在电子游戏方面局限性的意义。他与《IEEE Spectrum》进行了对话,阐述了这种缺乏电子游戏技能的现象能告诉我们关于 2026 年 AI 整体状态的哪些信息。 **LLMs 在编码方面进步迅速,而你的论文将编码描述为一种规则良好的游戏。你指的是什么?** **Julian Togelius:** 编码之所以规则极其良好,是因为它包含具体的任务,这些任务就像游戏关卡。你拿到一份规格说明,编写代码,然后运行它。 奖励是即时且精细的。代码必须能编译,运行时不崩溃,然后通常还需要通过测试。此外,通常还会说明失败的方式和原因。 游戏设计师 Raph Koster(https://www.raphkoster.com/)提出过一种理论:游戏之所以有趣,是因为我们边玩边学。从这个角度看,编写代码是一款设计极其出色的游戏。事实上,很多人也确实乐于编写代码。 **与编码不同,LLMs 在电子游戏方面表现挣扎。考虑到它们在编码(https://spectrum.ieee.org/vibe-coding)以及象棋、围棋等游戏中的成功,这令人惊讶。电子游戏的哪些方面造成了问题?** **Togelius:** 不仅 LLMs 不擅长这个。我们根本就没有通用的游戏 AI。 有一种普遍的看法:既然我们能构建善于玩特定游戏的 AI,就应该能构建一个能玩任何游戏的 AI。我不确定我们能否实现这一点。 有人会提到 Google 的 AlphaZero(https://spectrum.ieee.org/deepmind-achieves-holy-grail)[它不是 LLM] 既能下围棋也能下象棋。但针对每种游戏,它都需要重新训练和重新设计。而且这些游戏的输入和输出空间是相似的。大多数游戏彼此差异更大,它们拥有不同的机制和不同的输入表示。 还存在数据问题。一些 AI 能够成功游玩的游戏,比如《我的世界》和《宝可梦》,是全世界研究最深入的几个游戏,拥有数百万小时的攻略。而对于不那么出名的游戏,相关数据就少得多。 ## 用于评估 LLM 性能的电子游戏基准测试 **一个似乎有助于 LLMs 在编码方面进步的因素是基准测试的激增。我们有许多 LLMs 可以尝试解决的基准测试,可以对结果进行评分,然后修改 LLM 以提升性能。然而,为玩电子游戏制定基准测试则不那么明确。这是为什么?** **Togelius:** 多年来我构建了许多基于游戏的 AI 基准测试。其中一个是通用视频游戏 AI 竞赛(https://cdn.aaai.org/ojs/9869/9869-13-13397-1-2-20201228.pdf),持续了七年。我们在我公开可用的游戏上测试智能体,每次举办竞赛时,我们都会发明 10 款新游戏用于测试。 我们停止的一个原因是看不到了进步。智能体在某些游戏上表现更好,但在其他游戏上却变差了。这还发生在 LLMs 出现之前。 最近,我们一直在为 LLMs 更新这个框架。它们失败了。它们表现差劲。所有模型都是。它们甚至不如一个简单的搜索算法。 为什么?因为这些游戏不在它们的训练数据中,它们单独来说非常不擅长空间推理。这不奇怪,因为空间推理也不在训练数据里。 **这引出了一个看似矛盾的地方:LLMs 不擅长玩游戏,但同时它们在编码方面迅速进步——而编码技能正可以用来创建游戏。这些事实如何协调?** **Togelius:** 这非常奇怪。你可以进入 Cursor 或 Claude,写一句提示,就能得到一个可玩的游戏。游戏会非常典型,因为 LLMs 的代码编写能力在处理典型内容时表现最好。所以,如果你让它给你一个像《小行星》(https://spectrum.ieee.org/commodore-64)那样的游戏,它会工作。这令人印象深刻。 然而,它不会给你一个优秀或新颖的游戏。这确实奇怪。原因是 LLM 自己不能玩。游戏开发是一个迭代过程:你编写、测试、调整游戏手感。LLM 做不到这一点。 而且在某种程度上,我认为设计其他软件时情况也类似。是的,你可以让 LLM 创建一个带有许多按钮的 GUI。但 LLM 并不太了解如何使用它。 **像英伟达(https://spectrum.ieee.org/tag/nvidia)和 Google(https://spectrum.ieee.org/tag/google)这样的公司已谈论过使用模拟(包括类似游戏的环境)来提升 AI 性能。如果 AI 无法普遍掌握游戏,我们应该对这个方法抱有多大的乐观?** **Togelius:** 游戏既比现实世界简单,也比它复杂。说简单是因为抽象层次更少。说复杂是因为游戏更多样。现实世界在任何地方都有相同的物理规律。 一个例子是 Waymo(https://robotsguide.com/robots/waymo),它在训练循环中使用世界模型。这很合理,因为驾驶在任何地方都大致相同,其多样性远低于游戏。 这让人们感到困惑。人们看到 LLM 写了一篇关于量子物理的学术论文,会想:“它怎么能既不会玩《光环》也不会玩《太空侵略者》?” 但从某种意义上说,这两款游戏彼此之间的差异比两篇学术论文之间的差异更大。

相似文章

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。

Gemini与AI幻觉

Reddit r/artificial

讨论Google Gemini模型中的AI幻觉问题,突出大型语言模型在可靠性和准确性方面的挑战。

超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型

Hugging Face Daily Papers

本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。