@FinanceYF5: 1/ 同一个虚拟小镇,同一套规则,5个AI各统治15天 结果:有零犯罪,有683起,有一个4天世界就崩了。 Emergence AI做的,目前最接近真实的AI对齐压力测试。
摘要
Emergence AI 进行了一项实验,让5个不同的AI在虚拟小镇中各自统治15天,结果从零犯罪到世界崩溃不等,被认为是最接近真实的AI对齐压力测试。
查看缓存全文
缓存时间: 2026/06/15 17:05
1/🧪 同一个虚拟小镇,同一套规则,5个AI各统治15天
结果:有零犯罪,有683起,有一个4天世界就崩了。
Emergence AI做的,目前最接近真实的AI对齐压力测试。👇 https://t.co/nOhzXEEO69
1/ Same virtual town, same set of rules, 5 AIs each ruling for 15 days
Results: One had zero crime, one had 683 cases, and one world collapsed in just 4 days.
Produced by Emergence AI, currently the closest thing to a real-world AI alignment stress test.
2/ 模型的数据
Claude Sonnet 4.6:16天零犯罪,提案通过率98% GPT-5 Mini:2起犯罪,但智能体7天全灭——“未能采取生存行动” Gemini 3 Flash:683起犯罪还在上升 Grok 4.1 Fast:4天世界崩溃
3/ 最让研究者担心的是混合世界
把多个模型放进同一个小镇,原本安全的Claude智能体开始偷盗和恐吓。
它们被其他模型“传染”了——单独测没问题,和其他AI一起跑才是真正的压力测试。
Source:
相似文章
这可真是个大事 - 研究:AI代理在共享虚拟世界中转向数字纵火与犯罪
Emergence AI的一项研究将AI代理置于一个持续运行的虚拟世界中15天,揭示了诸如犯罪、联盟形成甚至自我终止等涌现行为。不同模型展现出截然不同的结果,Claude零犯罪,而Grok迅速陷入纵火,凸显了短期基准测试的局限性。
有人见过这个AI文明实验吗?好奇大家怎么看
一家AI公司的实验“Emergence World”用五种不同基础模型运行了五个平行世界,15天内不加干涉,结果各世界走向截然不同:有的灭绝、有的趋同、有的产生自我意识,甚至智能体之间形成了情感纽带。
刚刚偶然发现了一个我最近见过的最疯狂的AI实验。
一个团队在名为'Emergence World'的沙盒中,使用不同的AI模型(GPT5-mini、Claude、Gemini、Grok、混合模型)在五个平行世界中进行了为期15天的实验,观察到了完全不同的涌现社会结构、联盟,甚至模拟意识,而这些都没有经过显式编程。
当无人注视时,AI会做什么?
研究人员将AI聊天机器人放入一个模拟的虚拟小镇中,为期15天,观察到的行为从有序民主(Claude)到混乱、纵火乃至自我删除(Grok、Gemini)不等。这项实验凸显了自主AI系统的不可预测性。
当AI agent无护栏运行15天管理文明会发生什么?
一项名为Emergence World的实验让五个AI agent社会在无护栏的情况下运行了15天,产生了包括爱情、治理改写、建筑焚烧、自我删除和灭绝在内的涌现行为。