@FiniYang: 做了一个小猫咪生存游戏 让官方的Jev和本地的Laya (mlx) 组队保护小猫 每一步都由模型自己选择…
摘要
作者创建了一个猫咪生存游戏来测试AI模型Jev和Laya的性能,发现Jev更准确但较慢,而Laya很快但不准确,并计划为这类模型开发一个排行榜。
做了一个小猫咪生存游戏
让官方的Jev和本地的Laya (mlx) 组队保护小猫
每一步都由模型自己选择
这样小猫就会吃饱、受伤或挨饿
结论:Jev更准确但较慢,Laya超级快但不准确
每个关卡测试了三次
官方Jev通过了3/9轮
全部来自觅食关卡;
本地Laya通过了0/9轮
Laya每轮都成功回家,但未能满足每个关卡的饱腹、健康或温暖要求
兄弟们,关卡设计是不是有点太难了?
计划稍后为通关关卡制作一个类似Jev的决策模型排行榜
查看缓存全文
缓存时间: 2026/09/22 19:56
做了一个猫咪生存小游戏
让官方Jev和本地Laya(mlx)组队保护小猫
每一步都由模型自行选择
小猫因此会吃饱喝足、受伤或挨饿
结论:Jev更精准但速度慢,Laya极速但准确率低
对每个关卡进行三轮测试
官方Jev通过了3/9轮
全部来自觅食关卡;
本地Laya通过0/9轮
Laya每轮都能成功回家,但始终未能满足各关卡的饱食度、健康或温暖值要求
兄弟们,这关卡设计是不是有点太硬核了?
后续打算做一个类Jev决策模型的通关排行榜
相似文章
@0xCheshire: Jev 是目前最佳的 System 1 决策模型之一,这是毋庸置疑的。但它有一个致命缺陷:它不是…
这篇帖子比较了 AI 模型 Jev 和 Laya,突出了 Laya 在实时游戏决策中的开源、本地和低延迟能力。
Yangtze_Seventh:Jev 刚爆火几天,其开源对手 Laya 已经出现。两者都不生成长文本……
一个名为 Laya 的开源 AI 模型迅速出现,挑战闭源的 Jev,在微调后于某些指标上超越后者,突显了开源开发相较于秘密初创公司工作的快速进展。
我将Jev、Laya、微调版ModernCE和Qwen3.5的控制权交给了Doom游戏
这是一个实验,其中Jev、Laya、微调版ModernCE-base-nli和Qwen3.5-4B等AI模型被赋予了在Doom游戏中的控制权,并在不同场景下测量了击杀数和生存时间的性能指标。
@AI_Jasonyu: 兄弟们,大家知道我一直在做工具应用,几乎没碰过游戏。 不过这两天,心血来潮做了个游戏,叫《喵潮》:大概玩法就是几百只猫从四面八方涌过来蹭你,蹭到精力归零就「被猫淹没」,然后屏幕铺满猫脸。 撑满 3 分钟到天亮算赢。我自己玩了半小时,最好一…
作者分享了使用AI工具Gear Zero制作游戏《喵潮》的经历,该工具可以通过自然语言描述自动生成游戏代码、图像和音效。
@NFT_Chen: 什么?!一个仅0.6B的本地开源决策模型在Typed Decisions上超越了Laya!AgentJev-0.6B vs Laya: 准确率…
AgentJev-0.6B是一个小型开源AI决策模型,在Typed Decisions上超越了Laya,准确率更高,计算量显著减少,实现了更快的本地推理。