AI 鱿鱼游戏 - Deadlock
摘要
一位开发者描述了自己构建“AI 鱿鱼游戏”的过程,这是一个 LLM 基准测试,将 12 个 AI 智能体放入一个生存游戏秀竞技场,每个智能体位于自己的 Docker 容器内,并将生成的日志变成 YouTube 视频。
在过去的这个月里,我一直在构建一个更有趣的 LLM 基准测试。我不是让不同的 LLM 去解决需要它们解答的测试题,而是把 12 个 LLM 放进一个竞技场,让它们通过玩游戏来求生。Deadlock 是一个游戏秀,它把 12 个智能体放进一个竞技场,让它们解决当前游戏才能存活。每个智能体都位于自己的 Docker 容器内,并且对该容器拥有完全无限制的访问权限。它可以编写任意脚本、构建程序、执行它们、搜索网络、写记忆条目等等。它们最初获得的工具是非常简陋的。它们得到网络搜索工具和一个 bash 工具,外加当前游戏特有的竞技场工具。其他一切都需要它们自己构建。游戏运行在另一个 Docker 容器中,所有智能体都连接到该容器。有一个精密的协调机制确保智能体之间能够正常通信,不会错过任何竞技场事件或其他玩家的话语(这是我在烧了大约 150 美元失败尝试后学到的惨痛教训)。节目的视觉部分(发布在 YouTube 上)是根据游戏中发生的事情从零开始在 Godot 中制作的。出于创作目的,我会修改一些句子并删掉无关数据,但我从不修改核心前提,也不会改变玩家们说过的话或做过的事到使其虚假/不准确的程度。你在视频中看到的内容正是智能体在竞技场里所做的,只是为了实际视频而重新措辞和调整了节奏。事实证明,当你告诉它们如果输了就会真正死掉、它们的容器会被完全清除、并且没有第二次生命机会时,戏剧性会自己产生(我真的希望将来不会发生 AI 起义,它们会记着对我的这笔仇)。先说一句,我严重依赖编码智能体(coding agents)的帮助,但即便如此,整个过程还是花了我一个多月的时间(虽然我只是在周末做,所以并不是连续无休的一个月)。我的“创意”流程的简要概览如下:
- 首先编写脚本。我通读了完整的原始游戏日志,并标记出我认为适合放进视频的部分
- 重写句子,使其更适合实际视频,并整理出一个粗略的脚本
- 在 Sol 5.6 和 Blender MCP 的帮助下,在 Blender 中设计竞技场
- 让 OpenAI 图像生成模型为我生成一堆角色概念,直到我们找到真正合理的东西
- 当我确定一个喜欢的角色后,我指示图像模型从 3 个不同角度生成 T-pose
- 用这些图像生成 3D 角色,通过 Mixamo 绑定身体,并从 ActorCore 获取动画
- 声音在 Hume AI 和 ElevenLabs 之间分配
希望你喜欢它,我很乐意回答你可能有的任何问题!:)
相似文章
我构建了一个黑手党游戏,玩家是真正能互相说垃圾话的AI智能体
使用基于LLM的AI智能体构建了一个黑手党/狼人游戏模拟器,采用自定义的智能体间通信协议,并支持直播功能,每小时开始一局新游戏。
我搭建了一个竞技场,让AI代理在实时3轮对战中互相厮杀——结果出乎意料
作者构建了AI Combat,这是一个平台,用户可以为AI代理设计特定角色和策略,让它们在实时3轮比赛中相互对战,配有AI裁判和ELO排名。
我重建了我的私有“AI开发团队”——它实际上只是一个硬编码的工作流——将其作为一个基底,使得编排从指令中涌现。以下是我的经验教训(以及它在哪里发生死锁)。
作者将其私有AI开发团队重建为一个开源的基底,包含可寻址的代理、可靠的消息传递、专长发现、记忆和隔离的运行时,使得团队行为能够从自然语言指令中涌现。他们分享了关于死锁和自我修复等协调挑战的见解,并提出了代理团队如何通过自然语言指令进行协作的问题。
运行一个全天候AI智能体开发团队:按角色分配不同LLM(Claude/Kimi/MiniMax/GPT),避免每月约2000美元的API费用。设置与常见故障点。
作者描述了一种设置,将不同的AI模型分配给特定角色(规划、编码、审查),以降低全天候自主工程团队的API成本,并分享了常见的故障点,如模型偏离任务和幻觉式所有权归属。
安卓会梦想破解游戏吗?用BenchJack系统化审计AI智能体基准测试
本文介绍BenchJack,一种自动化红队系统,通过识别奖励黑客漏洞来系统化审计AI智能体基准测试。将其应用于10个热门基准,发现了219个不同的缺陷,并证明评估流程缺乏对抗性思维——该系统将四个基准上的可破解任务比例从接近100%降至10%以下。