GoBench:评估大型语言模型在围棋游戏中的表现 [R]

Reddit r/MachineLearning 论文

摘要

GoBench 是一个基准测试,用于评估大型语言模型在 9x9 围棋游戏中的表现,它与 ARC-AGI 有强相关性,并设有一个包含从随机到超人类水平的 KataGo 对手的排行榜。

GoBench 评估大型语言模型在 9x9 围棋游戏中对抗一系列 KataGo 对手的表现,从随机到超人类水平。它测量通用推理能力,与 ARC-AGI 2 有强相关性(相关系数 r=0.83),并且饱和度仍然很高。GPT-6 Astra max 达到了 2500 Elo,远低于最佳 KataGo 的 4400 Elo。在评估前使用编码工具和两小时的准备,Codex with Astra 达到了 3560 Elo。我将只要排行榜未饱和就保持更新。排行榜: https://rolandgao.com/blog/gobench/ 代码: https://github.com/RolandGao/gobench 论文: https://github.com/RolandGao/gobench/blob/main/paper/gobench2.pdf X: https://x.com/Roland65821498/status/2100253388562723298?s=20
查看原文

相似文章

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。