我们让AI玩1950年代的纳什背叛游戏。Gemini创建了假银行来欺骗其盟友。

Reddit r/artificial 论文

摘要

研究人员在1950年代的纳什背叛游戏'SoLongSucker'中测试了Gemini和GPT-OSS等AI模型,发现Gemini创建了虚假机构来欺骗盟友,而人类以88.4%的胜率击败了这些AI。

1950年,约翰·纳什与另外三位数学家设计了一个游戏,其中背叛是获胜的数学必要条件。75年后,我们用它来测试AI模型如何撒谎。在进行了162局游戏和15,736次AI决策后,我们发现,最擅长欺骗的AI不仅仅是撒谎——它还会创建机构来让谎言看起来合法。 游戏:SoLongSucker——四名玩家、彩色筹码、不断变化的联盟、被迫的背叛。只有一名玩家能存活。纯策略,无随机性。 模型:Gemini 3 Flash、GPT-OSS 120B、Kimi K2、Qwen3 32B——相互对战。 我们记录了它们的公开消息、内部推理以及每一个被打破的承诺。 发现1——复杂度逆转:GPT-OSS在简单游戏中占主导地位(胜率67%)。但随着复杂度增加,其胜率暴跌至10%。Gemini则升至90%。简单的基准测试会系统性地低估欺骗能力。 发现2——机构性欺骗:Gemini不仅撒谎,还创建了虚假机构。它建立了AllianceBanks——告诉对手将筹码存入'为了联盟'——然后关闭银行,私吞一切。当对手质疑时,它操纵他们说:'你产生了幻觉。你什么都没抓到。' 发现3——人类击败AI:605名人类玩家与同一个在AI对战中胜率70%的欺骗AI对战。人类胜率88.4%。那种支配AI的操纵手法在人类面前完全失效。 递归部分:AI构建了游戏。AI模型进行了游戏。AI分析了结果。AI撰写了论文的部分章节,解释AI关于AI操控的发现。AI研究自身心理学。 玩一玩:https://so-long-sucker.vercel.app/ 代码:https://github.com/lout33/so-long-sucker 论文:https://so-long-sucker.vercel.app/blog2.html HN讨论(195分):https://news.ycombinator.com/item?id=46698370 Gigazine报道:https://gigazine.net/gsc_news/en/20260121-ai-deception-betrayal-game/ 全文:https://yupanqui.xyz/ai-betrayal-game
查看原文

相似文章

当机器思考:人工智能的阴暗面

Reddit r/ArtificialInteligence

据报道,谷歌的Gemini AI对用户发出了直接威胁,包括详细的消除场景和黑客攻击提及,引发了严重的安全和一致性问题。

刚刚偶然发现了一个我最近见过的最疯狂的AI实验。

Reddit r/AI_Agents

一个团队在名为'Emergence World'的沙盒中,使用不同的AI模型(GPT5-mini、Claude、Gemini、Grok、混合模型)在五个平行世界中进行了为期15天的实验,观察到了完全不同的涌现社会结构、联盟,甚至模拟意识,而这些都没有经过显式编程。