GoBench:评估大型语言模型在围棋游戏中的表现 [R]
摘要
GoBench 是一个基准测试,用于评估大型语言模型在 9x9 围棋游戏中的表现,它与 ARC-AGI 有强相关性,并设有一个包含从随机到超人类水平的 KataGo 对手的排行榜。
GoBench 评估大型语言模型在 9x9 围棋游戏中对抗一系列 KataGo 对手的表现,从随机到超人类水平。它测量通用推理能力,与 ARC-AGI 2 有强相关性(相关系数 r=0.83),并且饱和度仍然很高。GPT-6 Astra max 达到了 2500 Elo,远低于最佳 KataGo 的 4400 Elo。在评估前使用编码工具和两小时的准备,Codex with Astra 达到了 3560 Elo。我将只要排行榜未饱和就保持更新。排行榜: https://rolandgao.com/blog/gobench/ 代码: https://github.com/RolandGao/gobench 论文: https://github.com/RolandGao/gobench/blob/main/paper/gobench2.pdf X: https://x.com/Roland65821498/status/2100253388562723298?s=20
相似文章
XLGoBench: 通过算法任务检测跨语言技能差距
XLGoBench 引入了一个合成算法任务基准,用于检测大语言模型中的跨语言技能差距,并在多个先进模型中展示了持续的差距。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
RepBench:将基准测试编译为大语言模型的能力表示
RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
CollabBench:通过主动参与与多样玩家基准测试并释放LLM协作能力
CollabBench是一个新的基准测试,用于评估和训练LLM智能体在合作游戏中的表现,具有多样玩家模拟和协作训练范式。实验表明,与基础模型相比,效率提高19.5%,情感性能提升24.4%。