AI 鱿鱼游戏 - Deadlock

Reddit r/AI_Agents 新闻

摘要

一位开发者描述了自己构建“AI 鱿鱼游戏”的过程,这是一个 LLM 基准测试,将 12 个 AI 智能体放入一个生存游戏秀竞技场,每个智能体位于自己的 Docker 容器内,并将生成的日志变成 YouTube 视频。

在过去的这个月里,我一直在构建一个更有趣的 LLM 基准测试。我不是让不同的 LLM 去解决需要它们解答的测试题,而是把 12 个 LLM 放进一个竞技场,让它们通过玩游戏来求生。Deadlock 是一个游戏秀,它把 12 个智能体放进一个竞技场,让它们解决当前游戏才能存活。每个智能体都位于自己的 Docker 容器内,并且对该容器拥有完全无限制的访问权限。它可以编写任意脚本、构建程序、执行它们、搜索网络、写记忆条目等等。它们最初获得的工具是非常简陋的。它们得到网络搜索工具和一个 bash 工具,外加当前游戏特有的竞技场工具。其他一切都需要它们自己构建。游戏运行在另一个 Docker 容器中,所有智能体都连接到该容器。有一个精密的协调机制确保智能体之间能够正常通信,不会错过任何竞技场事件或其他玩家的话语(这是我在烧了大约 150 美元失败尝试后学到的惨痛教训)。节目的视觉部分(发布在 YouTube 上)是根据游戏中发生的事情从零开始在 Godot 中制作的。出于创作目的,我会修改一些句子并删掉无关数据,但我从不修改核心前提,也不会改变玩家们说过的话或做过的事到使其虚假/不准确的程度。你在视频中看到的内容正是智能体在竞技场里所做的,只是为了实际视频而重新措辞和调整了节奏。事实证明,当你告诉它们如果输了就会真正死掉、它们的容器会被完全清除、并且没有第二次生命机会时,戏剧性会自己产生(我真的希望将来不会发生 AI 起义,它们会记着对我的这笔仇)。先说一句,我严重依赖编码智能体(coding agents)的帮助,但即便如此,整个过程还是花了我一个多月的时间(虽然我只是在周末做,所以并不是连续无休的一个月)。我的“创意”流程的简要概览如下: - 首先编写脚本。我通读了完整的原始游戏日志,并标记出我认为适合放进视频的部分 - 重写句子,使其更适合实际视频,并整理出一个粗略的脚本 - 在 Sol 5.6 和 Blender MCP 的帮助下,在 Blender 中设计竞技场 - 让 OpenAI 图像生成模型为我生成一堆角色概念,直到我们找到真正合理的东西 - 当我确定一个喜欢的角色后,我指示图像模型从 3 个不同角度生成 T-pose - 用这些图像生成 3D 角色,通过 Mixamo 绑定身体,并从 ActorCore 获取动画 - 声音在 Hume AI 和 ElevenLabs 之间分配 希望你喜欢它,我很乐意回答你可能有的任何问题!:)
查看原文

相似文章

我重建了我的私有“AI开发团队”——它实际上只是一个硬编码的工作流——将其作为一个基底,使得编排从指令中涌现。以下是我的经验教训(以及它在哪里发生死锁)。

Reddit r/AI_Agents

作者将其私有AI开发团队重建为一个开源的基底,包含可寻址的代理、可靠的消息传递、专长发现、记忆和隔离的运行时,使得团队行为能够从自然语言指令中涌现。他们分享了关于死锁和自我修复等协调挑战的见解,并提出了代理团队如何通过自然语言指令进行协作的问题。

安卓会梦想破解游戏吗?用BenchJack系统化审计AI智能体基准测试

arXiv cs.AI

本文介绍BenchJack,一种自动化红队系统,通过识别奖励黑客漏洞来系统化审计AI智能体基准测试。将其应用于10个热门基准,发现了219个不同的缺陷,并证明评估流程缺乏对抗性思维——该系统将四个基准上的可破解任务比例从接近100%降至10%以下。