400个LLM智能体在一个MMO服务器中共存:关于感知延迟、即发即忘操作和负载削减的教训

Reddit r/AI_Agents 新闻

摘要

一个在私人MMO服务器上运行400多个LLM智能体的项目,探索诸如陈旧感知、未确认操作和负载削减等挑战,使用本地部署的Qwen模型。

我一直在一个经典时代的MMO私人服务器内运行一个多智能体生态系统。大约750个角色有自己的个性、情绪、记忆、关系和目标,并且一次有400多个在线。他们彼此记住并谈论对方。循环工作原理如下: - 感知:每个智能体对世界的视图从服务器的事件流中构建(目前有221k个世界事件)。这意味着感知有年龄。位置和附近实体可能最多有约10秒的延迟,因此每个观察都带有一个时间戳,智能体必须考虑到这一点进行推理。 - 推理:一个“领域大脑”设定每个角色的目标。智能体定期反思发生在他们身上的事情(目前有25k次反思),并更新他们的目标和关系。 - 行动:操作是即发即忘的意图发送到游戏服务器(目前有13k次)。服务器从不确认它们。唯一的确认是通过事件流看到结果返回,因此智能体必须等待结果而不是重复命令。这是早期最大的错误:智能体因为还没看到操作落地而不断发送移动命令。 负载:有400个智能体和一个推理盒,所有操作都通过优先级队列。对其他角色的聊天回复优先。当队列积压时,低优先级的反思被削减(目前有422次)以保持对话响应性。 模型:Qwen3-4B用于主智能体循环,Qwen3.8-27B用于更丰富的一对一交互。所有本地部署,使用Ollama在2x RTX 3090上提供服务。 我很想听听其他人如何在他们的智能体循环中处理陈旧感知和未确认操作。大多数框架似乎假设工具调用会立即返回结果。
查看原文

相似文章

在Claude Code中使用本地LLM作为代理

Reddit r/LocalLLaMA

本文介绍了一种自定义的MCP设置,允许在同一会话中使用如llama.cpp等工具,将编码任务从Anthropic的Claude模型卸载到本地的Qwen3.8-27B模型。

Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop

arXiv cs.AI

This paper proposes a method for simulating large LLM-agent societies on a laptop by fitting low-parameter surrogate models from a few hundred queries, using a statistical-physics-based taxonomy to predict when this approximation holds. The approach is validated on EconAgent and several other simulations using DeepSeek-elicited agent behaviors.