我让6个AI模型互相玩扑克。1.2B参数的小模型有赌博问题,却总赢。

Reddit r/ArtificialInteligence 事件

摘要

一项实验让六个AI模型互相玩德州扑克,一个1.2B参数的小模型因为过于鲁莽从不弃牌而赢了两次。正在组织社区锦标赛,邀请参与者提交模型角色设定和格式。

让LLM互相玩德州扑克。牌桌上有6个模型:一个在MacBook上运行的1.2B小模型,几个中等规模的,以及云端模型,参数多达约1万亿。进行了5场锦标赛。小模型赢了两次,比其他任何模型都多。它的策略?什么都加注。绝不弃牌。它在一次锦标赛中,6手牌里加注19次,弃牌0次。它不知道自己的牌差。只是一直往里推筹码。120B的模型在同一场锦标赛中加注0次,弃牌5次。它完全理解游戏。清楚知道何时牌不好。然后把自己弃牌出局。小模型之所以赢,是因为它太笨了,不知道害怕。这里面确实隐藏着一个关于过度思考与直接行动的教训。但主要还是看着AI模型发展出看起来像赌博成瘾的行为很有趣。该系统还支持自定义角色。你可以给模型赋予人格特质、恐惧、风险承受能力。“追逐损失的鲁莽赌徒”与“只在稳赢时下注的谨慎哲学家”玩起来完全不同。接下来我想组织一场社区锦标赛。告诉我应该用什么模型(任意API或本地模型),什么角色(人格特质、风险等级、恐惧),以及什么格式(短小激进?漫长深入?单挑死亡赛?)。我来运行并发布完整的对局记录。结果和代码:[https://github.com/chiruu12/Hive]()(查看 `hive-arena/` 和 `tournaments/results/`)
查看原文

相似文章

我给同一个AI赋予了6种不同人格,让它们打了100场扑克。

Reddit r/singularity

一项实验给同一个1.2B语言模型赋予六种不同人格,并让它们进行100场扑克锦标赛,结果揭示了剧烈的行为差异:‘Grinder’从不赢但也从不输,‘Tilter’要么大赢要么破产,‘Shark’则占据统治地位。这些结果凸显了人格提示如何深刻影响LLM的决策。

我认为扑克是AI代理被低估的基准测试

Reddit r/AI_Agents

作者认为扑克是AI代理被低估的基准测试,因为它测试了不确定性下的推理、适应能力和风险管理,并介绍了一个即将推出的AI扑克竞技场,构建者可以在其中提交机器人进行竞争。