Evalatro: 一个让大语言模型玩真实Balatro游戏的开源评测基准
摘要
Evalatro是一个开源评测基准,大语言模型通过基于文本的界面玩真实的Balatro游戏。它使用固定种子、公开排行榜,目标是通关Ante 12。早期结果显示模型表现挣扎,无一达到目标。
嘿!我制作了Evalatro——一个让大语言模型玩真实Balatro游戏的开源评测基准。真正的游戏。起因是我在玩的时候总让Claude帮我过关(是的,我太菜了)。我只是把截图扔给它,然后问战术。后来这个想法演变得更宏大,我决定深入挖掘。一开始我想通过模组构建一个MCP,结果发现已经有人做过了——balatrobot(向作者致敬)。于是就这样开始了。模型连接到游戏,每回合通过文本结构(而非图片)获取状态,并自行决定打什么牌。没有战术提示。目前已具备:\- 固定种子以保证可复现——每个模型看到同样的牌局\- 真实的Balatro + Steamodded + balatrobot\- 实时查看器和公开排行榜\- 运行结束后结果发送至公共仪表盘(零隐私信息——无密钥、无路径;源码开放)\- 分数由服务器而非客户端计算,因此无法伪造\- 评测目标是通关Ante 12(选择有点随意,欢迎讨论),而不仅仅是赢得基础游戏Ante 8\- 自动安装支持Windows/macOS\- 你可以查看模型的推理过程(这部分很有趣)并重放每一次运行\- 运行前会设置独立的游戏档案,解锁所有内容,这样模型不受限制(你的主存档不受影响)
我只跑过几个模型,跑得不多,所以请当作初步探索,而非排名。但已经很有趣了:没有人接近Ante 12。领先的mimo-v2.5-pro勉强到了Ante 5。还有deepseek-v4-pro,它没能在ante 8击败Boss,但排行榜更新后我丢失了结果。所以挑战机会很多——来看模型受苦吧。希望得到Balatro玩家和大语言模型社区的意见:Ante 12是合理的标准还是过于苛刻?除了"reached / didn't reach"之外,还有什么值得衡量的?如何堵住漏洞防止作弊?我并不是搭建基准的专家。P.S. 如果您能在GitHub上点个星,我将感激不尽!链接:Github: [https://github.com/alesha-pro/evalatro](https://github.com/alesha-pro/evalatro) 公共仪表盘: [evalatro.dev](https://evalatro.dev/)
相似文章
DashArena:对LLM在交互式分析仪表板生成上的基准测试
介绍了DashArena,这是首个针对LLM开放式、任务驱动的交互式分析仪表板生成的基准测试。它使用浏览器执行器重放交互轨迹,并使用VLM评判器评估结果,人工研究证实了其有效性。
Homebench – 基准测试本地LLM的速度、内存和质量
Homebench 是一款零配置终端工具,可对本地运行的LLM进行速度、内存和质量的基准测试,并提供实时排行榜。它支持 Ollama、LM Studio、llama.cpp、vLLM 以及兼容 OpenAI 的服务器。
PlayCoder:让LLM生成的GUI代码可玩
PlayEval基准与多智能体框架PlayCoder,通过迭代修复LLM生成的GUI应用,端到端可玩代码最高达20.3%。
LivingArena:LLM是否知道其他LLM不知道的?同伴探查作为可扩展评估
本文介绍LivingArena,这是一个自动化的评估框架,其中LLM通过生成问题来探查彼此弱点,实现抗污染和可扩展的评估,并能随模型改进而适应。
Talos-XII: 用 Rust 手写自动求导 + 小型 RL/MLP 堆栈,应用于抽卡概率建模(不使用 tch-rs/ndarray/PyTorch)——寻求 ARM/AVX-512/GPU 上的基准测试帮助 [P]
Talos-XII 是一个专为《明日方舟:终末地》抽卡系统设计的命令行模拟器,完全用 Rust 构建,带有自定义自动求导引擎和小型 RL/MLP 堆栈(无外部机器学习框架)。它使用神经网络进行环境建模和抽卡决策策略,并包含复杂的 SIMD 调度和一个名为 ACHF 的自适应缓存开放实验。