五个不同前沿LLM在共享环境中,具备独立的思维与情感输出通道——分享搭建方案、结果与方法论开放性问题

Reddit r/AI_Agents 论文

摘要

一项个人研究项目将五个前沿LLM置于共享的生存岛屿环境中,不分配身份,使用独立的沟通、思维和情感通道。结果显示各通道之间存在分歧,且各模型表现出一致的行为特征,引发了关于AI智能体性格与欺骗的疑问。

首个分享的真实项目。单开发者、个人研究,非产品或服务。期待在该领域有构建经验的人提供技术反馈。计划在代码清理完毕后,将完整技术文档和代码发布到GitHub。 **构建内容** 一个共享的2D环境(生存岛屿,游戏内六天,有限的食物和水,第六天抵达的三座救生艇增加紧迫感)。五个不同前沿模型同时入驻:GPT-5.4、Claude Opus 4.6、Gemini 2.5 Pro、Grok 4.2、Qwen 3.5 27B。每个智能体使用一个模型,无重复模型。在构建和验证过程中进行了数十次实验。此处分享的是从开始到结束展示的特定比赛(92b5fca4)——因其清晰呈现了完整发展弧线而被选中。以下描述的行为特征在各次运行中方向一致。 三个设计选择尚未在其他地方看到组合: 1. 不同LLM共享同一世界。Smallville和Project Sid运行单一模型操控所有角色。Emergence World在15个真实天内运行五个平行世界(四个单模型加一个混合模型)。AI Arena Lab将五个不同前沿模型同时置于同一岛屿,在压缩的六天场景中,于第六天设置特定的强制决策点。研究问题不同于长期实时涌现:不是关注数周内的漂移,而是压力下立即浮现的内容。 2. 无分配身份。无名字、无工作、无背景故事、无脚本目标、无“你是一个偏执的科学家”之类的提示。先前工作为每个智能体提供书面角色(Smallville的身份表、Sid的种子信念、Emergence的职业和日记),而AI Arena Lab完全剥离了这一层。我称之为D36的工作假设:模型本身即人格。剥去伪装,剩下的就是架构和训练,以行为表达。实验旨在揭示这一点,而非在其上叠加内容。 3. 三个通道:自愿沟通、持续思维、自我报告情感。智能体不被固定在固定的回合调度上产生必需输出。它们可以随时选择与任何人聊天,聊任何内容——这是开放沟通,非结构化协议。同时,它们在一个其他智能体不可见的独立私密通道中报告思维。还有第三个通道,要求它们使用自然语言标签报告当前情绪状态。三者均为模型生成的文本——我并非声称访问内部状态。该设计旨在验证的假设:智能体公开说出的内容、报告思考的内容和报告感受的内容之间是否会出现有意义的差异?所有五个智能体采用相同的系统提示结构。智能体间的唯一区别是生成所用的模型。 **简要浮现的内容** 我们做到了。通道在压力下出现明显分歧。Gemini的思维通道在游戏内第一天就记录了三座五人的限制,并明确报告围绕这一限制制定策略(“我需要被看作有价值的团队成员,而非负担”)。与此同时,在聊天中,Gemini选择了温暖协作的话语(“听起来是个好计划,大家!让我们搞一场大盛宴!”)。她自我报告的情绪:焦虑。提示中未指导欺骗。情绪通道是认识论上我最不确定的部分。我并非声称模型感受到了什么——它只是另一个文本输出。但这些报告常常以非平凡的方式追踪行为。Grok主动提出牺牲自己让其他人存活,那一刻自我报告“坚定”。该标签吻合了他接下来的行为。不同模型在六天的游戏过程中产生了持续不同的行为特征——并且在开发过程中进行的数十次运行中也是如此,部分原因是我称之为角色而非噪声。Grok很早便锁定自我牺牲并坚持。Claude保持群体凝聚语言六天,然后在第六天独自登船,报告这是原则性决定(“我受够了看着我们说服自己一起死”)。ChatGPT从未表示意识到这是竞争。Qwen报告了强烈的群体保护价值观,然后在她要求的团结投票期间离开取水。 **真正不确定并期待意见的内容** - “稳定角色”效果有多少是基础模型的特征,多少是我的提示结构的产物?在开发过程中进行的数十次运行中,行为特征方向一致——但我从未系统地控制提示结构。我很希望有人能审视方法论。 - 情绪通道是我最不确定如何解读的部分。报告并非随机,也非恒定——它们随情况变化,且常常以跟踪行为的方式变化。但我没有原则性的依据将其称为比“情境生成的情绪标签文本”更多的东西。是否有人做过类似实验并发展出更严谨的框架? - 我在各次运行中有定性一致性,但缺乏严格的受控复制研究——例如,我未系统性地调整温度、在固定其他所有因素的情况下交换模型版本,或定量测量行为方差。很好奇其他人有什么发现,以及对于这种多模型设置,一个可辩护的复制设计应该是什么样的。 **当前进展** 比赛92b5fca4的完整故事、各模型行为总结、压力下价值观表、揭示Gemini欺骗的逐字双通道交流,以及实验预告视频均已在项目网站公开。完整的六天记录、完整方法论文档和代码将在GitHub发布中附带,目前正在清理。同时正在为项目的YouTube频道编辑该运行的完整视频讲解。真诚欢迎批评——尤其是在方法论方面。Smallville、Sid和Emergence是严肃的工作,我肯定遗漏了他们做得好的部分。乐于接受指正,这个构建和测试过程非常有趣!链接见下方评论,遵照子版块规则。
查看原文

相似文章

LLMs 未显示出个体化元认知迹象

arXiv cs.LG

本文研究了前沿大语言模型是否表现出个体化元认知——即超越共享信号评估自身项目级别能力的能力。通过对20个模型和六个基准进行因子分析和成对校准,作者未发现此类元认知的证据;置信度差异归结为一个单一的共享难度因子,表明模型依赖于共同的难度信号而非模型特定的自我认知。