Kev 4B 在我运行的所有俄罗斯方块游戏中都堆顶了。Mica v0.1 4B 清除了约4倍多的方块行,并在其中两局游戏中坚持到了最后
摘要
Mica v0.1 4B 在俄罗斯方块游戏中表现优于 Kev 4B,清除约4倍多的方块行,并在某些情况下坚持到了最后,仅使用棋盘描述,无需搜索或前瞻。
我让 Mica(我的4B决策模型)和 Kev 4B 玩相同的俄罗斯方块游戏,相同的种子和相同的方块顺序,使用一块 RTX 3090。背景是,这是一个副项目。训练和所有实验都是在租用的 3090 上运行的,总共约30美元。每回合,两者都得到棋盘和4种可能的放置位置,每种都有一个简短描述(清除的行数、空洞、高度),然后选择一个。其他帮助都没有,没有搜索或前瞻。三个种子的结果(清除的行数)如下:- 种子7:Mica 33,Kev 27 - 种子11:Mica 97,Kev 17 - 种子23:Mica 93,Kev 11。Kev 在所有三局中都堆顶了。Mica 在种子11和23中完成了所有250个方块而没有死亡。它也大约75%的时间选择了最佳可用放置位置,而 Kev 大约50%。视频是种子11,在100个方块时剪辑。Kev 在第86个方块时堆顶,而 Mica 此时在37行并仍在继续。Mica 不生成文本。它读取输入一次并从 logits 中取答案,所以视频中的条形图是它对每个放置位置的实际概率。权重:https://huggingface.co/sky7350/Mica-v0.1-4B 代码:https://github.com/akivet/Mica-v0.1-4B
相似文章
Mica v0.1 4B:开源 Jev 风格决策模型(是/否、选择、评分),支持 8 GB GPU 运行——训练 GPU 时间成本不足 30 美元
Mica v0.1 4B 是一款开源决策模型,专为 AI 代理循环设计,训练 GPU 时间成本低于 30 美元,旨在本地 8GB GPU 上运行,具有良好的校准性能,在提示注入抵抗等特定任务中表现优异。
我探索所有Tetris的旅程
来自Antithesis的一篇详细博客文章,描述了他们的软件测试工具如何用于探索并实现Tetris中的‘重生’(达到255级),在此过程中克服挑战并发现故障。
个人评测后续:Gemma4 26B MoE(Q8)vs Qwen3.5 27B Dense vs Gemma4 31B Dense 对比
个人基准测试显示,Qwen3.5-27B Dense 与 Gemma4-31B Dense 在 37 个失败用例中修复率 100%,即使 8-bit 量化的 Gemma4-26B MoE 也望尘莫及,同时消耗更少 token 与更短挂钟时间。
DeepSeek v4 Flash 0731 在 Windows XP 下一次性生成俄罗斯方块(NyoCoder 1.5.5 发布)
作者分享了一段 NyoCoder 1.5.5(AI 代码助手)在 Windows XP/VS2010 下使用 DeepSeek v4 Flash 0731 生成俄罗斯方块游戏的视频,并提供了 GitHub 链接。
gemma-4-12b-it vs Qwen3.5-9B 在共同基准测试中的对比:Qwen 在 5/8 项基准测试中击败 gemma,虽体积更小但总体胜出
Qwen3.5-9B 在 8 项基准测试中的 5 项中优于 gemma-4-12b-it,尽管模型体积更小。gemma 仅在编程能力上略胜一筹。