游戏竞技场:竞争环境中的战略LLM评估
摘要
游戏竞技场是一个开放平台,通过Chess、Poker和Werewolf等竞争游戏来评估LLM,实现对战略规划和鲁棒性的动态评估。
查看缓存全文
缓存时间: 2026/09/28 04:02
论文页面 - 游戏竞技场:竞争环境下的战略型大语言模型评估
来源:https://huggingface.co/papers/2609.31473 发布于9月25日
#3 当日热门论文 (https://huggingface.co/papers/date/2026-09-28) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们推出Kaggle Game Arena——一个开放且持续扩展的平台,旨在通过竞技游戏评估大型语言模型。与静态基准测试不同,Game Arena让模型能在结构化环境中进行一对一的对战,游戏难度随模型的进化自然提升,从而防止性能饱和。本技术报告详细阐述了Game Arena背后的基础设施,并介绍了三个试点游戏环境:国际象棋、扑克和狼人杀。这些环境覆盖了完美信息、不完美信息以及多人游戏设置,使得系统性地研究模型在不确定性下的战略规划、适应能力与鲁棒性成为可能。针对每个游戏,我们都提供了环境详述、评估指标以及跨模型完整竞赛的结果。通过强大的基础设施和基于大规模真实标签的评估,Game Arena确保了研究的可复现性、透明性,并可扩展至未来的新游戏及变体。
查看 arXiv 页面 (https://arxiv.org/abs/2609.31473)查看 PDF (https://arxiv.org/pdf/2609.31473)项目页面 (https://www.kaggle.com/game-arena)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.31473)
在你的代理中获取此论文:
hf papers read 2609\.31473
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接到本文
在模型的 README.md 中引用 arxiv.org/abs/2609.31473 以从此页面链接到该模型。
引用本文的数据集 0
没有数据集链接到本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.31473 以从此页面链接到该数据集。
引用本文的空间 0
没有空间链接到本文
在空间的 README.md 中引用 arxiv.org/abs/2609.31473 以从此页面链接到该空间。
包含本文的收藏夹 0
没有收藏夹包含本文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
LivingArena:LLM是否知道其他LLM不知道的?同伴探查作为可扩展评估
本文介绍LivingArena,这是一个自动化的评估框架,其中LLM通过生成问题来探查彼此弱点,实现抗污染和可扩展的评估,并能随模型改进而适应。
Poker Arena: 对LLMs中策略推理与记忆的多轴剖析
Poker Arena 是一个新基准,使用无限制德州扑克评估LLMs在多个认知轴上的策略推理与记忆能力。该平台揭示,多轴评估能够暴露标量排行榜误排的能力结构。
重新思考我们如何衡量AI智能
Google DeepMind和Kaggle推出了Kaggle Game Arena,一个开源的AI基准测试平台,让大型语言模型在策略游戏中进行对抗,从而提供动态的、可验证的能力评估。该平台通过提供明确的胜负条件和清晰的性能信号,克服了传统基准测试的局限性。
GENSTRAT:迈向大型语言模型战略推理科学
本文介绍了GENSTRAT,一个利用程序生成的战略环境来评估LLMs在多维度上的战略推理能力的基准,解决了固定游戏套件的局限性。
LLM时代:迷雾战争下大语言模型推理、外交与可靠性的战略1v1基准测试
介绍Age of LLM,一个回合制1v1基准测试,LLM在带有战争迷雾和外交机制的网格上对战,评估推理、可靠性和战略规划能力。结果显示核速攻战术占主导,且可靠性与获胜之间存在弱关联。