GameHorizon Suite: 多时间跨度数据和游戏玩法评估
摘要
本文介绍了GameHorizon Suite,一个统一的数据和评估框架,用于评估AI模型在多个时间跨度上的游戏玩法能力,包含标注流水线、大规模数据集和可复现的基准。
查看缓存全文
缓存时间: 2026/09/22 07:27
论文页面 - GameHorizon Suite:游戏玩法中的多跨度数据与评估
来源:https://huggingface.co/papers/2609.25001
发布于 9 月 21 日
#3 每日论文 (https://huggingface.co/papers/date/2026-09-22)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
现代电子游戏为 AI 模型提供了一个可量化的测试平台,结合了视觉理解、指令分解、目标规划以及在多个时间跨度上进行精确动作控制的能力。然而,现有的数据集和基准要么覆盖的游戏范围狭窄,要么缺乏语言指令,要么依赖于高方差的在线模拟运行。为了应对这些挑战,我们推出了 GameHorizon,一个统一的数据和评估套件,用于衡量不同模型家族在不同跨度上的游戏能力。GameHorizon Suite 由三个组成部分构成。首先,GameHorizon-Annotator 是一个可扩展且自动化的多跨度指令标注流水线。其次,利用该流水线,我们构建了 GameHorizon-Data,这是首个大规模的 AAA 游戏玩法数据集,包含时间对齐的视频、玩家操作和多跨度指令。它包含来自 21 款游戏的 5,000 小时录制内容,由 100 名人类专家玩家收集。第三,我们建立了 GameHorizon-Bench,提供可复现的离线测试和逐步在线测试。离线赛道通过数千个标准化问题进行可复现的评估,这些问题分为三个主要任务和一系列诊断变体;而在线赛道则测试离线分数是否反映了实际的游戏玩法能力,并将长跨度游戏玩法中的故障定位到特定步骤。基于我们的 GameHorizon Suite,我们评估了 47 个模型,进行了超过一百万次模型调用,揭示了任务难度的有意义层次和模型能力的显著差异。我们的工作可以为跨跨度和模型家族的游戏玩法能力评估提供一个标准化的衡量标准。我们将发布我们的数据集、标注器和基准,以促进未来的研究。
查看 arXiv 页面 (https://arxiv.org/abs/2609.25001)查看 PDF (https://arxiv.org/pdf/2609.25001)项目页面 (https://gamehorizon-suite.github.io/)GitHub12 (https://github.com/TencentARC/GameHorizon)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.25001)
通过您的代理获取此论文:
hf papers read 2609\.25001
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.25001 以从本页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.25001 以从本页面链接它。
引用此论文的 Space 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.25001 以从本页面链接它。
包含此论文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
PlayWorld:基于智能体玩家与长时程目标的世界模型基准测试
PlayWorld是一个用于评估交互式视频世界模型的基准测试,使用多模态智能体玩家来追求长时程目标。它评估几何一致性、交互保真度和状态演化,揭示了当前模型在空间一致性和持续状态演化方面存在困难。
超越最终分数:长期AI研发智能体的系统性评估
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
用于衡量前沿AI能力的开放世界评估
本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。
Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance
This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.