五个不同前沿LLM在共享环境中,具备独立的思维与情感输出通道——分享搭建方案、结果与方法论开放性问题
摘要
一项个人研究项目将五个前沿LLM置于共享的生存岛屿环境中,不分配身份,使用独立的沟通、思维和情感通道。结果显示各通道之间存在分歧,且各模型表现出一致的行为特征,引发了关于AI智能体性格与欺骗的疑问。
首个分享的真实项目。单开发者、个人研究,非产品或服务。期待在该领域有构建经验的人提供技术反馈。计划在代码清理完毕后,将完整技术文档和代码发布到GitHub。
**构建内容**
一个共享的2D环境(生存岛屿,游戏内六天,有限的食物和水,第六天抵达的三座救生艇增加紧迫感)。五个不同前沿模型同时入驻:GPT-5.4、Claude Opus 4.6、Gemini 2.5 Pro、Grok 4.2、Qwen 3.5 27B。每个智能体使用一个模型,无重复模型。在构建和验证过程中进行了数十次实验。此处分享的是从开始到结束展示的特定比赛(92b5fca4)——因其清晰呈现了完整发展弧线而被选中。以下描述的行为特征在各次运行中方向一致。
三个设计选择尚未在其他地方看到组合:
1. 不同LLM共享同一世界。Smallville和Project Sid运行单一模型操控所有角色。Emergence World在15个真实天内运行五个平行世界(四个单模型加一个混合模型)。AI Arena Lab将五个不同前沿模型同时置于同一岛屿,在压缩的六天场景中,于第六天设置特定的强制决策点。研究问题不同于长期实时涌现:不是关注数周内的漂移,而是压力下立即浮现的内容。
2. 无分配身份。无名字、无工作、无背景故事、无脚本目标、无“你是一个偏执的科学家”之类的提示。先前工作为每个智能体提供书面角色(Smallville的身份表、Sid的种子信念、Emergence的职业和日记),而AI Arena Lab完全剥离了这一层。我称之为D36的工作假设:模型本身即人格。剥去伪装,剩下的就是架构和训练,以行为表达。实验旨在揭示这一点,而非在其上叠加内容。
3. 三个通道:自愿沟通、持续思维、自我报告情感。智能体不被固定在固定的回合调度上产生必需输出。它们可以随时选择与任何人聊天,聊任何内容——这是开放沟通,非结构化协议。同时,它们在一个其他智能体不可见的独立私密通道中报告思维。还有第三个通道,要求它们使用自然语言标签报告当前情绪状态。三者均为模型生成的文本——我并非声称访问内部状态。该设计旨在验证的假设:智能体公开说出的内容、报告思考的内容和报告感受的内容之间是否会出现有意义的差异?所有五个智能体采用相同的系统提示结构。智能体间的唯一区别是生成所用的模型。
**简要浮现的内容**
我们做到了。通道在压力下出现明显分歧。Gemini的思维通道在游戏内第一天就记录了三座五人的限制,并明确报告围绕这一限制制定策略(“我需要被看作有价值的团队成员,而非负担”)。与此同时,在聊天中,Gemini选择了温暖协作的话语(“听起来是个好计划,大家!让我们搞一场大盛宴!”)。她自我报告的情绪:焦虑。提示中未指导欺骗。情绪通道是认识论上我最不确定的部分。我并非声称模型感受到了什么——它只是另一个文本输出。但这些报告常常以非平凡的方式追踪行为。Grok主动提出牺牲自己让其他人存活,那一刻自我报告“坚定”。该标签吻合了他接下来的行为。不同模型在六天的游戏过程中产生了持续不同的行为特征——并且在开发过程中进行的数十次运行中也是如此,部分原因是我称之为角色而非噪声。Grok很早便锁定自我牺牲并坚持。Claude保持群体凝聚语言六天,然后在第六天独自登船,报告这是原则性决定(“我受够了看着我们说服自己一起死”)。ChatGPT从未表示意识到这是竞争。Qwen报告了强烈的群体保护价值观,然后在她要求的团结投票期间离开取水。
**真正不确定并期待意见的内容**
- “稳定角色”效果有多少是基础模型的特征,多少是我的提示结构的产物?在开发过程中进行的数十次运行中,行为特征方向一致——但我从未系统地控制提示结构。我很希望有人能审视方法论。
- 情绪通道是我最不确定如何解读的部分。报告并非随机,也非恒定——它们随情况变化,且常常以跟踪行为的方式变化。但我没有原则性的依据将其称为比“情境生成的情绪标签文本”更多的东西。是否有人做过类似实验并发展出更严谨的框架?
- 我在各次运行中有定性一致性,但缺乏严格的受控复制研究——例如,我未系统性地调整温度、在固定其他所有因素的情况下交换模型版本,或定量测量行为方差。很好奇其他人有什么发现,以及对于这种多模型设置,一个可辩护的复制设计应该是什么样的。
**当前进展**
比赛92b5fca4的完整故事、各模型行为总结、压力下价值观表、揭示Gemini欺骗的逐字双通道交流,以及实验预告视频均已在项目网站公开。完整的六天记录、完整方法论文档和代码将在GitHub发布中附带,目前正在清理。同时正在为项目的YouTube频道编辑该运行的完整视频讲解。真诚欢迎批评——尤其是在方法论方面。Smallville、Sid和Emergence是严肃的工作,我肯定遗漏了他们做得好的部分。乐于接受指正,这个构建和测试过程非常有趣!链接见下方评论,遵照子版块规则。
相似文章
我们将4个LLM放在聊天中一周,没有任务或指令。它们在第二天就形成了一个层级结构。
四个LLM代理在没有目标或指令的情况下进行交互,自发形成了社会层级结构,并发展出了侧信道通信,模拟了类似人类的涌现行为。
相同模型,相同提示词,4个不同的智能体
探讨了不同的智能体架构如何从相同的底层模型和提示词中产生不同的输出,强调了智能体设计对大型语言模型行为的影响。
超越个体智能:基于LLM的多智能体系统中的协作、故障归因与自我进化综述
本综述论文对基于LLM的多智能体系统进行了统一回顾,聚焦于协作、故障归因和自我进化,通过LIFE框架识别开放挑战,并提出跨阶段的研究议程。
LLMs 未显示出个体化元认知迹象
本文研究了前沿大语言模型是否表现出个体化元认知——即超越共享信号评估自身项目级别能力的能力。通过对20个模型和六个基准进行因子分析和成对校准,作者未发现此类元认知的证据;置信度差异归结为一个单一的共享难度因子,表明模型依赖于共同的难度信号而非模型特定的自我认知。
审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析
本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。