RefereeBench:视频多模态大模型是否已准备好担任多项运动的裁判
摘要
RefereeBench 引入了首个大规模基准测试,包含 925 个精心策划的体育视频和 6,475 个问答对,用于评估视频多模态大模型是否能可靠地充当多项运动的裁判。对最先进模型的评估表明,现有多模态大模型表现不佳(准确率≤60%),尽管它们具有通用视频理解能力,但在规则应用和时间定位方面存在困难。
arXiv:2604.15736v1 公告类型:跨领域
摘要:虽然多模态大模型(MLLMs)在通用视频理解方面表现出色,但它们支持专业化、规则驱动决策制定的能力仍未得到充分探索。在本文中,我们介绍 RefereeBench,这是首个用于评估多模态大模型作为自动体育裁判的大规模基准测试。RefereeBench 跨越 11 项运动,包含 925 个精心策划的视频和 6,475 个问答对,评估五项核心裁判能力:犯规存在识别、犯规和罚球分类、犯规和罚球推理、实体感知和时间定位。该基准由人工全面标注,确保高质量的标注基于真实的裁判逻辑和多模态证据。对最先进多模态大模型的广泛评估表明,即使是最强的模型(如 Doubao-Seed-1.8 和 Gemini-3-Pro),也仅达到约 60% 的准确率,而最强的开源模型 Qwen3-VL 仅达到 47%。这些结果表明当前模型远未达到可靠体育裁判的水平。进一步分析显示,虽然模型通常能识别事件和相关实体,但在规则应用和时间定位方面存在困难,且经常对正常比赛片段进行过度判罚。我们的基准测试强调了未来多模态大模型需要更好地整合领域知识和多模态理解的必要性,推进值得信赖的人工智能辅助裁判和更广泛的多模态决策制定。
查看缓存全文
缓存时间: 2026/04/20 08:30
# RefereeBench:视频多模态大模型是否已准备好成为多项目裁判? 来源:https://arxiv.org/html/2604.15736 \(2018\) ###### 摘要\. 虽然多模态大型语言模型(MLLMs)在通用视频理解方面表现出色,但其在支持专业化、基于规则决策制定方面的能力探索仍显不足\. 本文介绍RefereeBench,首个用于评估MLLMs作为自动体育裁判的大规模基准\. 涵盖11项运动,包含925个精选视频和6,475个QA对,RefereeBench评估五项核心裁判能力:犯规存在识别、犯规和罚则分类、犯规和罚则推理、实体感知和时间定位\. 该基准完全由人工标注,确保高质量的标注基于真实的裁判逻辑和多模态证据\. 对最先进MLLMs的广泛评估显示,即使是Doubao\-Seed\-1\.8和Gemini\-3\-Pro等最强模型也仅达到约60%的准确率,而最强的开源模型Qwen3\-VL仅达到47%\. 这些结果表明当前模型离可靠的体育裁判仍相距甚远\. 进一步分析显示,虽然模型能够识别事件和涉及的实体,但在规则应用和时间定位方面存在困难,并且经常在正常片段上过度判罚\. 我们的基准强调了未来MLLMs需要更好地整合领域知识和多模态理解,推进可信的人工智能辅助裁判和更广泛的多模态决策制定\. 自动体育裁判、多模态大型语言模型、体育理解 ††copyright:acmlicensed††journalyear:2018††doi:XXXXXXX\.XXXXXXX††conference:确保从您的权限确认电子邮件中输入正确的会议标题;XX XX–XX,XX;XX,XX††isbn:978\-1\-4503\-XXXX\-X/2018/06††submissionid:4282††ccs:计算方法 自然语言处理††ccs:计算方法 计算机视觉## 1\.引言 参考图1我们引入RefereeBench来提供MLLMs在自动体育裁判中的高质量评估,所有视频和标注均由认证裁判手工整理\. RefereeBench的这两个突出示例(黄色显示的真实答案)需要模型执行细粒度感知、时间定位、规则知识应用和决策制定\. RefereeBench旨在提出重大挑战,有效地评估MLLMs的多项目裁判和推理能力\. 体育已成为多模态人工智能的重要前沿阵地,视觉理解、时间推理和决策支持越来越多地满足现实需求\(Xu等人,(https://arxiv.org/html/2604.15736#bib.bib16); Xia等人,2024b (https://arxiv.org/html/2604.15736#bib.bib17); Zhao等人,2025 (https://arxiv.org/html/2604.15736#bib.bib18); Giancola等人,2018 (https://arxiv.org/html/2604.15736#bib.bib1); Deliege等人,2021 (https://arxiv.org/html/2604.15736#bib.bib2); Cui等人,2023 (https://arxiv.org/html/2604.15736#bib.bib32); Sun等人,2020 (https://arxiv.org/html/2604.15736#bib.bib34); Ingwersen等人,2023 (https://arxiv.org/html/2604.15736#bib.bib36); Falaleev和Chen,2024 (https://arxiv.org/html/2604.15736#bib.bib37); Wang等人,2024 (https://arxiv.org/html/2604.15736#bib.bib14); Mkhallati等人,2023 (https://arxiv.org/html/2604.15736#bib.bib3); Qi等人,2023 (https://arxiv.org/html/2604.15736#bib.bib5); You等人,2025 (https://arxiv.org/html/2604.15736#bib.bib10); Gao等人,2025 (https://arxiv.org/html/2604.15736#bib.bib6); Xu等人,2022 (https://arxiv.org/html/2604.15736#bib.bib8); Tian等人,2025 (https://arxiv.org/html/2604.15736#bib.bib11); Rao等人,2025 (https://arxiv.org/html/2604.15736#bib.bib12)\)\. 在体育应用中,裁判尤为关键,因为裁判决定直接影响比赛公平性、运动员安全和公众信任\(Xu等人,(https://arxiv.org/html/2604.15736#bib.bib16)\)\. 更重要的是,智能裁判辅助不仅在专业赛事中有价值,在业余和社区比赛中也同样重要,因为在这些地方经验丰富的裁判和回放设施往往有限\(Xu等人,(https://arxiv.org/html/2604.15736#bib.bib16); Xia等人,2024b (https://arxiv.org/html/2604.15736#bib.bib17)\)\. 这使得自动体育裁判既具有科学挑战性,也具有实际意义\. 然而,自动体育裁判比通用视频理解要复杂得多\. 一个称职的系统必须做的不仅仅是识别可见的动作:它必须确定是否发生了违规,识别涉及的实体,定位关键时刻,区分视觉上相似但法律上不同的事件,并将观察到的证据与体育特定的规则和罚则标准关联起来\(Xu等人,(https://arxiv.org/html/2604.15736#bib.bib16)\)\. 简言之,任务不仅需要感知,还需要时间定位和基于规则的推理\. 多模态大型语言模型(MLLMs)的快速进展使自动体育裁判成为重要的测试平台\. 虽然最近的模型在多模态推理、长视频理解和细粒度事件识别方面表现强劲\(Li等人,2024b (https://arxiv.org/html/2604.15736#bib.bib20); Fu等人,2025 (https://arxiv.org/html/2604.15736#bib.bib21); Liu等人,2025a (https://arxiv.org/html/2604.15736#bib.bib22); Wu等人,2024 (https://arxiv.org/html/2604.15736#bib.bib23); Xun等人,2025 (https://arxiv.org/html/2604.15736#bib.bib24); Feng等人,2025 (https://arxiv.org/html/2604.15736#bib.bib25)\),但这些能力不一定能转化为可靠的基于规则的决策制定\. 先前的基准显示当前模型在复杂视频场景中仍然难以做出一致的决策,尤其是当判断需要结构化推理和特定领域知识时\(Li等人,2024b (https://arxiv.org/html/2604.15736#bib.bib20); Fu等人,2025 (https://arxiv.org/html/2604.15736#bib.bib21); Song等人,2025 (https://arxiv.org/html/2604.15736#bib.bib19); Xia等人,2024c (https://arxiv.org/html/2604.15736#bib.bib31)\)\. 因此,体育裁判为评估通用多模态能力与现实世界决策制定之间的差距提供了一个自然的设置\. 尽管前景看好,现有的数据集和基准仍未能充分评估自动体育裁判作为一般问题\. 先前的体育基准主要关注动作和事件检测\(Giancola等人,2018 (https://arxiv.org/html/2604.15736#bib.bib1); Deliege等人,2021 (https://arxiv.org/html/2604.15736#bib.bib2); Shao等人,2020 (https://arxiv.org/html/2604.15736#bib.bib7)\)、评论\(Mkhallati等人,2023 (https://arxiv.org/html/2604.15736#bib.bib3); Ge等人,2024 (https://arxiv.org/html/2604.15736#bib.bib9)\)、动作质量评估\(Xu等人,2022 (https://arxiv.org/html/2604.15736#bib.bib8); Gao等人,2025 (https://arxiv.org/html/2604.15736#bib.bib6)\)或通用体育推理\(Xia等人,2024c (https://arxiv.org/html/2604.15736#bib.bib31),a (https://arxiv.org/html/2604.15736#bib.bib30)\),而裁判导向的资源通常仅限于单一运动(尤其是足球),或不涵盖完整的裁判范围\(Giancola等人,2018 (https://arxiv.org/html/2604.15736#bib.bib1); Held等人,2023 (https://arxiv.org/html/2604.15736#bib.bib26),2024 (https://arxiv.org/html/2604.15736#bib.bib27)\)\. 因此,目前尚不清楚当前的MLLMs是否能够作为跨多项运动的可靠裁判助手,这些运动有不同的规则体系、事件结构和罚则逻辑\. 为了弥补这一空白,我们推出RefereeBench,第一个致力于跨多项运动的自动体育裁判的大规模基准\. RefereeBench包含925个精选真实比赛视频和6,475个专家编写的多选QA对,涵盖11项运动\. 它评估七种以裁判为导向的问题类型,涵盖犯规存在、犯规类型识别、犯规推理、罚则类型识别、罚则推理、实体感知和事件时间定位\. 此外,该基准保留了现实的多模态信号,包括音频和重放视图,以更好地反映现实世界的裁判场景\. 基于RefereeBench,我们对一系列多样化的专有和开源MLLMs进行了全面评估\. 我们的研究涵盖了封闭源系统,包括GPT\(OpenAI,2025 (https://arxiv.org/html/2604.15736#bib.bib44),2024 (https://arxiv.org/html/2604.15736#bib.bib45)\)、Gemini\(Google,2025 (https://arxiv.org/html/2604.15736#bib.bib42)\)、Claude\(Anthropic,2025 (https://arxiv.org/html/2604.15736#bib.bib43)\)和Doubao\-Seed\(ByteDance Seed,2025 (https://arxiv.org/html/2604.15736#bib.bib46)\),以及开源视频模型,如Qwen3\-VL\(Xu等人,2025 (https://arxiv.org/html/2604.15736#bib.bib51)\)和VideoLLaMA3\(Zhang等人,2025 (https://arxiv.org/html/2604.15736#bib.bib49)\)\. 这项评估旨在解决一个核心问题:当前的MLLMs在多大程度上能够进行可靠的多项目裁判?结果显示,即使是最强的模型也仍远未达到可靠裁判的水平,只有Doubao\-Seed\-1\.8和Gemini\-3达到约60%的性能\. 开源模型落后,Qwen3\-VL仅达到47%\. 虽然他们在犯规存在和实体感知方面取得相对更强的性能,但他们在推理和时间定位方面仍存在重大困难,表明识别事件远比应用正确的运动规则和及时识别决定性证据容易得多\. 我们进一步分析了为什么当前模型表现出这样的性能模式,并探查了什么最能促进其自动裁判能力\. 我们发现多模态证据,尤其是音频,在提高性能方面起着关键作用,而模型仅拥有部分裁判知识,并且对误导性或暗示性输入仍然敏感\. 此外,他们显示出明显的过度判罚倾向,突出了稳健和无偏决策的局限性\. 总而言之,本文做出三项主要贡献: - •我们推出RefereeBench,第一个致力于跨多项运动的自动体育裁判的大规模基准,实现了超越单项运动设置的系统评估\. - •我们构建了一个高质量的、专家标注的多模态数据集,跨越11项运动和七种以裁判为导向的问题类型,捕捉现实的裁判证据,如音频、重放视图和时间定位\. - •我们对现代MLLMs在基于规则的体育决策制定方面进行了全面评估和分析,揭示了推理、定位和鲁棒性方面的关键局限,突出了感知与可靠裁判之间的差距\. ## 2\.相关工作 ### 2\.1\.体育理解数据集 早期的体育视频分析主要针对基础感知\. 初始基准聚焦于动作检测和细粒度识别\(Giancola等人,2018 (https://arxiv.org/html/2604.15736#bib.bib1); Deliege等人,2021 (https://arxiv.org/html/2604.15736#bib.bib2); Shao等人,2020 (https://arxiv.org/html/2604.15736#bib.bib7); Liu等人,2025b (https://arxiv.org/html/2604.15736#bib.bib39); He等人,2025 (https://arxiv.org/html/2604.15736#bib.bib38)\)以定位和分类运动员或球的动作\. 后续研究通过多对象跟踪\(Cui等人,2023 (https://arxiv.org/html/2604.15736#bib.bib32); Huang等人,2019 (https://arxiv.org/html/2604.15736#bib.bib33); Sun等人,2020 (https://arxiv.org/html/2604.15736#bib.bib34)\)和三维姿态估计\(Ingwersen等人,2023 (https://arxiv.org/html/2604.15736#bib.bib36)\)扩展了对运动细节的捕捉\. 基于这些感知基础,动作质量评估数据集\(Xu等人,2022 (https://arxiv.org/html/2604.15736#bib.bib8); Gao等人,2025 (https://arxiv.org/html/2604.15736#bib.bib6)\)应运而生,以评估细粒度动作的执行,充当了向客观性能评估过渡的早期桥梁\. 随着多模态架构的演进,范式转向了综合语义理解\. 一条重要的研究线聚焦于生成丰富的叙述,包括自动评论\(Mkhallati等人,2023 (https://arxiv.org/html/2604.15736#bib.bib3); Ge等人,2024 (https://arxiv.org/html/2604.15736#bib.bib9)\)、体育新闻\(Wang等人,2021 (https://arxiv.org/html/2604.15736#bib.bib35)\)和精彩集锦提取\(Díaz\-Juan等人,2025 (https://arxiv.org/html/2604.15736#bib.bib13)\)\. 同时,复杂领域问答基准,如Sports\-QA\(Li等人,2024a (https://arxiv.org/html/2604.15736#bib.bib28)\)、SportQA\(Xia等人,2024a (https://arxiv.org/html/2604.15736#bib.bib30)\)和SportU\(Xia等人,2024c (https://arxiv.org/html/2604.15736#bib.bib31)\)被引入以系统测试模型对基本规则、游戏场景和战术意图的整体理解\. 最近,研究人员开始探索需要更高阶认知推理的决策级分析\(Zhao等人,2025 (https://arxiv.org/html/2604.15736#bib.bib18)\),如战术分析\(Wang等人,2024 (https://arxiv.org/html/2604.15736#bib.bib14)\)、比赛预测\(Honda等人,2022 (https://arxiv.org/html/2604.15736#bib.bib15)\)和早期犯规检测\(Deliege等人,2021 (https://arxiv.org/html/2604.15736#bib.bib2); Held等人,2023 (https://arxiv.org/html/2604.15736#bib.bib26)\)\. 虽然现代MLLMs拥有实际决策为中心的应用所需的高级推理,但当前文献缺乏评估严格的跨项目裁判的基准——这正是我们工作明确解决的关键空白\. 表1\.RefereeBench与代表性体育数据集的比较\. RefereeBench是第一个致力于跨10+项运动类型的体育裁判的基准\. A\.S\. R\.G\. C\.S\.S数据集任务\# 运动\# 视频\# QAsSoccerNet\(Giancola等人,2018 (https://arxiv.org/html/2604.15736#bib.bib1)\)动作检测15006,637SoccerNet\-v2\(Deliege等人,2021 (https://arxiv.org/html/2604.15736#bib.bib2)\)动作检测等\.1500300K体育QA\(Xia等人,2024a (https://arxiv.org/html/2604.15736#bib.bib30)\)体育问答35\-70KSports\-QA\(Li等人,2024a (https://arxiv.org/html/2604.15736#bib.bib28)\)体育问答86K94KLiveSports\-3K\-QA\(Chen等人,2025 (https://arxiv.org/html/2604.15736#bib.bib29)\)体育问答494141,236SPORTU\-Video\(Xia等人,2024c (https://arxiv.org/html/2604.15736#bib.bib31)\)体育问答71,70112,048SPORTU\-Text\(Xia等人,2024c (https://arxiv.org/html/2604.15736#bib.bib31)\)体育问答7\-900SoccerNet\-MVFoul\(Held等人,2023 (https://arxiv.org/html/2604.15736#bib.bib26)\)裁判18,293\-SoccerNet\-XFoul\(Held等人,2024 (https://arxiv.org/html/2604.15736#bib.bib27)\)裁判110K22KRefereeBench裁判119256,475 ### 2\.2\.自动体育裁判 虽然基础数据集聚焦于通用体育理解,但实际体育裁判需要高度专业化、高风险的决策制定\(Xu等人,(https://arxiv.org/html/2604.15736#bib.bib16)\)\. 在现实世界中,技术辅助裁判已是实际现实\. 系统如视频助理裁判(VAR)\(国际足球协会委员会(IFAB),2024 (https://arxiv.org/html/2604.15736#bib.bib40)\)和半自动越位技术(SAOT)\(FIFA,2022 (https://arxiv.org/html/2604.15736#bib.bib41)\)在足球中形式化了多视图视觉证据和空间跟踪如何支持人类官员\. 受这些现实世界系统的启发,多媒体和计算机视觉社区开始将裁判形式化为学术任务\. 初期的工作形成了
相似文章
多视频摘要中多模态大语言模型位置偏差的系统性评估
吉林大学研究人员对多模态大语言模型(MLLMs)在多视频摘要任务中的位置偏差进行了系统性评估,基于 ActivityNet 和新闻视频构建了评测基准,并采用覆盖率、方向性位置偏差(DPB)和中间-边缘差距(MEG)等指标对九个模型进行了全面评估。结果表明,位置效应因领域和模型而异,且增加视觉输入或生成预算并不能统一消除这种不平衡现象。
Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动态基准测试
BilliardPhys-Bench 是一个新的基准测试,通过合成台球场景来评估多模态大语言模型的物理推理能力,要求预测碰撞和最终球的位置。论文发现,当前模型在较长的模拟中表现不佳,并表现出一种“静态偏差”——在不确定时预测无交互。
MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。