游戏竞技场:竞争环境中的战略LLM评估

Hugging Face Daily Papers 论文

摘要

游戏竞技场是一个开放平台,通过Chess、Poker和Werewolf等竞争游戏来评估LLM,实现对战略规划和鲁棒性的动态评估。

我们介绍Kaggle Game Arena,一个开放且不断扩展的平台,用于通过竞争游戏评估大型语言模型(LLMs)。与静态基准测试不同,游戏竞技场允许模型在结构化环境中进行一对一的对决,随着模型的演进,游戏能力自然增强,防止性能饱和。本技术报告详细介绍了Game Arena背后的基础设施,并描述了三个试点游戏环境:Chess、Poker和Werewolf。这些环境涵盖了完全信息、不完全信息和多人游戏设置,使得能够系统地研究模型的战略规划、适应性和在不确定性下的鲁棒性。对于每个游戏,我们提供了环境的详细描述、评估指标以及跨模型进行完整竞赛的结果。通过健壮的基础设施和基于大规模真实数据的评估,Game Arena确保了可重复性、透明性,并能随时间推广到新游戏和变体。
查看原文
查看缓存全文

缓存时间: 2026/09/28 04:02

论文页面 - 游戏竞技场:竞争环境下的战略型大语言模型评估

来源:https://huggingface.co/papers/2609.31473 发布于9月25日

#3 当日热门论文 (https://huggingface.co/papers/date/2026-09-28) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们推出Kaggle Game Arena——一个开放且持续扩展的平台,旨在通过竞技游戏评估大型语言模型。与静态基准测试不同,Game Arena让模型能在结构化环境中进行一对一的对战,游戏难度随模型的进化自然提升,从而防止性能饱和。本技术报告详细阐述了Game Arena背后的基础设施,并介绍了三个试点游戏环境:国际象棋、扑克和狼人杀。这些环境覆盖了完美信息、不完美信息以及多人游戏设置,使得系统性地研究模型在不确定性下的战略规划、适应能力与鲁棒性成为可能。针对每个游戏,我们都提供了环境详述、评估指标以及跨模型完整竞赛的结果。通过强大的基础设施和基于大规模真实标签的评估,Game Arena确保了研究的可复现性、透明性,并可扩展至未来的新游戏及变体。

查看 arXiv 页面 (https://arxiv.org/abs/2609.31473)查看 PDF (https://arxiv.org/pdf/2609.31473)项目页面 (https://www.kaggle.com/game-arena)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.31473)

在你的代理中获取此论文:

hf papers read 2609\.31473

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接到本文

在模型的 README.md 中引用 arxiv.org/abs/2609.31473 以从此页面链接到该模型。

引用本文的数据集 0

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.31473 以从此页面链接到该数据集。

引用本文的空间 0

没有空间链接到本文

在空间的 README.md 中引用 arxiv.org/abs/2609.31473 以从此页面链接到该空间。

包含本文的收藏夹 0

没有收藏夹包含本文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

重新思考我们如何衡量AI智能

Google DeepMind Blog

Google DeepMind和Kaggle推出了Kaggle Game Arena,一个开源的AI基准测试平台,让大型语言模型在策略游戏中进行对抗,从而提供动态的、可验证的能力评估。该平台通过提供明确的胜负条件和清晰的性能信号,克服了传统基准测试的局限性。