标签
RefereeBench 引入了首个大规模基准测试,包含 925 个精心策划的体育视频和 6,475 个问答对,用于评估视频多模态大模型是否能可靠地充当多项运动的裁判。对最先进模型的评估表明,现有多模态大模型表现不佳(准确率≤60%),尽管它们具有通用视频理解能力,但在规则应用和时间定位方面存在困难。