GameHorizon Suite: 多时间跨度数据和游戏玩法评估

Hugging Face Daily Papers 论文

摘要

本文介绍了GameHorizon Suite,一个统一的数据和评估框架,用于评估AI模型在多个时间跨度上的游戏玩法能力,包含标注流水线、大规模数据集和可复现的基准。

现代视频游戏为AI模型提供了一个可衡量的测试平台,结合了视觉理解、指令分解、目标规划和多个时间跨度上的精确动作控制能力。然而,现有的数据集和基准测试要么游戏覆盖范围狭窄,要么缺乏语言指令,要么依赖于高方差的在线模拟。为了应对这些挑战,我们引入了GameHorizon,一个统一的数据和评估套件,用于衡量不同模型家族在不同时间跨度上的游戏玩法能力。GameHorizon Suite由三个组件构成。首先,GameHorizon-Annotator是一个可扩展的自动化多时间跨度指令标注流水线。其次,利用该流水线,我们构建了GameHorizon-Data,这是首个包含时间对齐视频、玩家动作和多时间跨度指令的大规模AAA游戏数据集。它包括来自21款游戏的5000小时录制内容,由100名人类专家玩家收集。第三,我们建立了GameHorizon-Bench,具有可复现的离线和逐步在线测试。离线轨道使用数千个标准化问题,组织成三个主要任务和一系列诊断变体,实现可复现的评估,而在线轨道测试离线分数是否反映实际游戏玩法能力,并将故障定位到长时游戏玩法中的特定步骤。基于我们的GameHorizon Suite,我们通过超过一百万次模型调用评估了47个模型,揭示了任务难度的有意义层次和模型能力的显著差异。我们的工作可以为评估跨时间跨度和模型家族的游戏玩法能力提供一个标准化的衡量标准。我们将发布数据集、标注器和基准测试,以促进未来研究。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:27

论文页面 - GameHorizon Suite:游戏玩法中的多跨度数据与评估

来源:https://huggingface.co/papers/2609.25001
发布于 9 月 21 日

#3 每日论文 (https://huggingface.co/papers/date/2026-09-22)
作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

现代电子游戏为 AI 模型提供了一个可量化的测试平台,结合了视觉理解、指令分解、目标规划以及在多个时间跨度上进行精确动作控制的能力。然而,现有的数据集和基准要么覆盖的游戏范围狭窄,要么缺乏语言指令,要么依赖于高方差的在线模拟运行。为了应对这些挑战,我们推出了 GameHorizon,一个统一的数据和评估套件,用于衡量不同模型家族在不同跨度上的游戏能力。GameHorizon Suite 由三个组成部分构成。首先,GameHorizon-Annotator 是一个可扩展且自动化的多跨度指令标注流水线。其次,利用该流水线,我们构建了 GameHorizon-Data,这是首个大规模的 AAA 游戏玩法数据集,包含时间对齐的视频、玩家操作和多跨度指令。它包含来自 21 款游戏的 5,000 小时录制内容,由 100 名人类专家玩家收集。第三,我们建立了 GameHorizon-Bench,提供可复现的离线测试和逐步在线测试。离线赛道通过数千个标准化问题进行可复现的评估,这些问题分为三个主要任务和一系列诊断变体;而在线赛道则测试离线分数是否反映了实际的游戏玩法能力,并将长跨度游戏玩法中的故障定位到特定步骤。基于我们的 GameHorizon Suite,我们评估了 47 个模型,进行了超过一百万次模型调用,揭示了任务难度的有意义层次和模型能力的显著差异。我们的工作可以为跨跨度和模型家族的游戏玩法能力评估提供一个标准化的衡量标准。我们将发布我们的数据集、标注器和基准,以促进未来的研究。

查看 arXiv 页面 (https://arxiv.org/abs/2609.25001)查看 PDF (https://arxiv.org/pdf/2609.25001)项目页面 (https://gamehorizon-suite.github.io/)GitHub12 (https://github.com/TencentARC/GameHorizon)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.25001)

通过您的代理获取此论文:

hf papers read 2609\.25001

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.25001 以从本页面链接它。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.25001 以从本页面链接它。

引用此论文的 Space 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.25001 以从本页面链接它。

包含此论文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

用于衡量前沿AI能力的开放世界评估

arXiv cs.AI

本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。