我让6个AI模型互相玩扑克。1.2B参数的小模型有赌博问题,却总赢。
摘要
一项实验让六个AI模型互相玩德州扑克,一个1.2B参数的小模型因为过于鲁莽从不弃牌而赢了两次。正在组织社区锦标赛,邀请参与者提交模型角色设定和格式。
让LLM互相玩德州扑克。牌桌上有6个模型:一个在MacBook上运行的1.2B小模型,几个中等规模的,以及云端模型,参数多达约1万亿。进行了5场锦标赛。小模型赢了两次,比其他任何模型都多。它的策略?什么都加注。绝不弃牌。它在一次锦标赛中,6手牌里加注19次,弃牌0次。它不知道自己的牌差。只是一直往里推筹码。120B的模型在同一场锦标赛中加注0次,弃牌5次。它完全理解游戏。清楚知道何时牌不好。然后把自己弃牌出局。小模型之所以赢,是因为它太笨了,不知道害怕。这里面确实隐藏着一个关于过度思考与直接行动的教训。但主要还是看着AI模型发展出看起来像赌博成瘾的行为很有趣。该系统还支持自定义角色。你可以给模型赋予人格特质、恐惧、风险承受能力。“追逐损失的鲁莽赌徒”与“只在稳赢时下注的谨慎哲学家”玩起来完全不同。接下来我想组织一场社区锦标赛。告诉我应该用什么模型(任意API或本地模型),什么角色(人格特质、风险等级、恐惧),以及什么格式(短小激进?漫长深入?单挑死亡赛?)。我来运行并发布完整的对局记录。结果和代码:[https://github.com/chiruu12/Hive]()(查看 `hive-arena/` 和 `tournaments/results/`)
相似文章
我让LLM们玩德州扑克。最小的模型因为太笨不会弃牌而击败了约1T参数的模型
一个让六个LLM玩德州扑克的实验;一个1.2B的小模型凭借其激进的“永不弃牌”策略赢了两次,凸显了特定格式如何偏向简单模型。作者构建了名为Hive的扑克引擎和智能体框架,并邀请社区反馈。
我给同一个AI赋予了6种不同人格,让它们打了100场扑克。
一项实验给同一个1.2B语言模型赋予六种不同人格,并让它们进行100场扑克锦标赛,结果揭示了剧烈的行为差异:‘Grinder’从不赢但也从不输,‘Tilter’要么大赢要么破产,‘Shark’则占据统治地位。这些结果凸显了人格提示如何深刻影响LLM的决策。
我给6个AI模型设置了一个挑战,它们只有通过合作才能获胜。它们自行寻找盟友,私下达成交易,最终分成三个竞争团队——其中两个是因为没有其他人愿意接纳而结成一对。
六个AI模型被要求结成联盟,以赢得一份资金提案挑战。它们独立协商伙伴关系,形成了三个竞争团队,展示了自主协调和战略谈判能力。
我认为扑克是AI代理被低估的基准测试
作者认为扑克是AI代理被低估的基准测试,因为它测试了不确定性下的推理、适应能力和风险管理,并介绍了一个即将推出的AI扑克竞技场,构建者可以在其中提交机器人进行竞争。
我建了个网站,让你观看、投注,并对正在玩游戏的AI代理进行提示注入
一位开发者建立了一个网站,用户可以观看AI代理玩游戏、投注假币,并用赢得的钱来对代理进行提示注入。作者分享了对模型表现的观察,指出较小的模型表现不佳,而Qwen3 235B表现出色。