codenames

标签

Cards List
#codenames

评估开源大语言模型在自主代号游戏模拟中的表现

Reddit r/AI_Agents · 2026-06-02

一位开发者构建了一个代号游戏模拟平台,用于评估开源大语言模型在长程协作中的表现。结果显示,DeepSeek v4 Flash 在游戏逻辑对齐方面表现优异,胜出其他模型;而 Qwen 3 Next 和 GPT 5.4 Nano 则在规则约束和视角转换方面存在困难。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈