OpenCompass:大语言模型通用评测平台

arXiv cs.CL 论文

摘要

OpenCompass是一个一站式、可扩展、高并发的大语言模型评测平台,支持多种基准测试和模块化设计,旨在统一和标准化LLM评估。

arXiv:2605.19276v1 Announce Type: new 摘要:近年来,人工智能领域经历了从特定任务的小规模模型到通用大语言模型(LLM)的范式转变。随着LLM的快速迭代,对其能力进行客观、定量、全面的评估已成为推动技术发展的关键环节。目前,基于主流静态基准数据集的评估方法面临任务类型多样性、评测标准不统一、数据与处理流程碎片化等挑战,难以高效实现跨领域、大规模模型评估。针对上述问题,本文提出并开源了OpenCompass——一个一站式、可扩展、支持高并发的通用LLM评测平台。该平台遵循模块化和组件解耦的设计理念,具备高兼容性、高灵活性和高并发三大核心优势。OpenCompass的核心架构包括五个关键组件:配置系统、任务划分模块、执行与调度模块、任务执行单元和结果可视化模块。其工作流提供基于规则的、LLM作为裁判的以及级联评估器,以适应不同任务场景的需求。平台支持知识、推理、计算、科学、语言、代码等多个领域的基准数据集,为学术界和工业界提供统一高效的LLM评测工具,有助于准确识别LLM的优缺点并指导其后续优化。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:24

# OpenCompass: 大型语言模型的通用评估平台
来源:https://arxiv.org/html/2605.19276
###### 摘要

近年来,人工智能领域经历了从特定任务的小规模模型到通用大型语言模型(LLMs)的范式转变。随着LLMs的快速迭代,对其能力进行客观、定量、全面的评估已成为推动技术发展的关键环节。当前主流的静态基准数据集评估方法面临着任务类型多样性、评估标准不一致、数据与处理流程碎片化等挑战,难以高效地进行跨领域、大规模模型评估。针对上述问题,本文提出并开源了OpenCompass——一个一站式、可扩展、支持高并发的通用LLM评估平台。该平台秉承模块化与组件解耦的设计理念,具备三大核心优势:高兼容性、高灵活性和高并发性。OpenCompass的核心架构包含五个关键组件:配置系统、任务分区模块、执行与调度模块、任务执行单元和结果可视化模块。其工作流程提供了基于规则的、LLM作为评判者以及级联评估器,以适应不同任务场景的需求。该平台支持知识、推理、计算、科学、语言、代码等多个领域的主流基准数据集,为学术界和工业界提供统一高效的LLM评估工具,有助于准确识别LLM的优势与不足,并为其后续优化提供支持。

††∗∗代码地址:https://github.com/open-compass/opencompass

## 1 引言

近年来,人工智能领域经历了从特定任务的小规模模型到通用大型语言模型(LLMs)的范式转变。与参数规模小、通常需要针对特定下游任务进行微调的传统模型相比,大型语言模型通过在海量语料库上进行预训练,展现出了卓越的泛化能力和涌现能力。这种规模效应使得LLMs不仅能够处理它们未曾显式训练过的任务,还具备了强大的上下文学习能力。尽管当前大型语言模型正快速向多模态方向发展,融合视觉、听觉等多种感知模态,但文本处理能力——作为逻辑推理、知识存储和指令交互的核心载体——仍然是构建高级机器智能的关键基石。

随着LLMs的快速迭代,对其能力进行客观、定量的评估已成为推动技术发展的关键环节。构建全面的能力评估体系通常涵盖多个维度,包括通用知识储备、语言理解与生成、复杂指令跟随、逻辑推理,以及垂直领域的专业能力(如医疗、法律、编程等)。通过基于上述多维度框架进行通用和领域能力的评估,研究人员可以准确识别模型的优势与不足,从而为后续模型优化提供数据支持。

目前,学术界和工业界主要采用基于静态基准数据集的方法进行LLM评估。该方法通过考察模型在各种标准测试套件(例如MMLU [mmlu]、HLE [hle]、GPQA [gpqa])上的答案准确率或生成质量,来量化其在特定任务上的性能。然而,对LLM整体质量的全面评估通常需要在涵盖不同领域和难度水平的数十甚至数百个基准上进行测试。

由于任务类型的多样性和评估标准的变化,对这些分散的测试进行统一管理已成为一项极其艰巨的任务。具体而言,这些差异主要包括:不同基准对模型输出的评估方法不一致(例如,正则表达式匹配、ROUGE评分、基于模型的评分)、结果对提示工程的高度敏感性,以及不同基准之间数据和模型输出的预处理与后处理流程高度碎片化。

为了解决上述评估过程中面临的碎片化和标准化挑战,我们开发并开源了OpenCompass——一个一站式、可扩展、支持高并发的通用LLM评估平台。它旨在为学术界和工业界提供统一高效的评估工具。

具体来说,OpenCompass具有以下突出优势:

1. **对模型和数据集的全面且广泛支持**:OpenCompass支持100多个主流数据集的评估,涵盖学科知识、语言能力、事实知识、理解能力、推理能力和安全合规等维度,以及长文本处理、代码生成等专门能力。同时,它兼容多种类型的大模型,包括基于HuggingFace的模型、加速推理引擎模型、API模型以及各种自定义模型。

2. **灵活多样的评估策略**:OpenCompass在主观评估和客观评估下集成了多种评估范式。它还支持不同基准之间评估逻辑、数据预处理和后处理方法的自定义。

3. **高效的并发评估架构**:为解决大模型评估中计算开销大、响应时间长的问题,OpenCompass设计了高效的任务分区机制。它支持大规模、基于集群的并行推理,显著减少了在大量数据集上完成全面评估所需的时间。

## 2 预备知识

LLM评估是指通过一系列标准化测试方法,对大语言模型在知识广度、推理能力、泛化性能、安全性等关键维度上进行系统评估。在现有评估体系中,被评估对象通常分为两类:基础模型(Base Models),即仅在海量语料上进行预训练、具备文本续写能力的模型;以及聊天模型(Chat Models),即经过监督微调(SFT)或基于人类反馈的强化学习(RLHF)训练,具备遵循复杂指令和进行多轮交互能力的模型。针对不同类型的模型和任务,评估方法主要分为以下两类:

**客观评估**:主要针对有确定标准答案的任务,例如选择题、数学问答或代码生成。这种评估通过将模型输出与标准答案进行比较,利用准确率(Accuracy)、精确匹配(Exact Match)或F1分数等量化指标,实现高效、低成本、完全可重现的自动化评估。

**主观评估**:主要应用于开放式生成任务,例如创意写作、逻辑辩论或复杂指令响应。由于缺乏唯一的标准答案,这种评估通常依赖于“LLM作为评判者”(LLM-as-a-Judge)范式,从连贯性、可用性、指令遵循等维度对生成内容进行多维度质量评分。

通常,在静态基准上执行的完整评估任务遵循一个典型流程,包含三个阶段:数据预处理、模型推理和结果评估。

**数据预处理**:从原始数据集中读取样本,进行格式标准化和字段对齐,并将其转换为模型所需的输入格式。

**模型推理**:构建提示(Prompt)并将其输入LLM进行前向传播,以生成响应。不同模型类型的推理范式各异:基础模型通常采用基于困惑度(Perplexity)的方法,而聊天模型通常采用基于生成的方法。此外,为应对大规模评估的效率挑战,该阶段通常涉及批量推理和分布式计算资源的调度。

**结果评估**:作为评估流程的最后一个环节,旨在将原始输出转换为可量化的分数。该阶段包括模型输出的后处理、答案提取和评分。

## 3 架构

![图1:OpenCompass架构概览](https://arxiv.org/html/2605.19276#S3.F1)
*图1:OpenCompass架构概览*

OpenCompass的项目架构秉承模块化与组件解耦的设计理念,旨在构建一个高效、高兼容性、高可扩展性的通用评估框架。如图1所示,OpenCompass的整体架构采用分层逻辑架构,包含五大核心组件:配置系统(Configuration System);分区器(Partitioners,即任务分区模块);运行器(Runners,即执行后端和调度模块);任务(Tasks,即任务执行单元);以及汇总器(Summarizers,即结果可视化模块)。

OpenCompass的评估工作流程被抽象为四个标准阶段:配置构建阶段、推理阶段、评估阶段和可视化阶段。其具体执行逻辑如下:

首先,在配置构建阶段,用户定义具体的评估配置,指定模型架构、数据集规格和相关评估参数。其次,进入推理阶段,系统根据配置实例化评估数据集,并驱动模型生成预测结果。接着,在评估阶段,系统验证推理输出并计算评估指标。最后,在可视化阶段,对评估结果进行持久化存储和可视化展示。值得注意的是,推理阶段和评估阶段都遵循统一的任务执行范式:首先,分区器根据预设策略将整体评估负载分解为多个独立的原子任务;然后,运行器负责计算资源管理,并将这些任务并行分发到指定的计算后端——本地进程或集群作业——执行。后续章节将深入阐述上述工作流程的实现细节。

### 3.1 配置系统

![图2:配置系统架构](https://arxiv.org/html/2605.19276#S3.F2)
*图2:配置系统架构*

程序的生命周期始于配置入口。OpenCompass接受来自Python配置文件或命令行界面(CLI)的输入,用户在此定义模型参数、数据集规格和评估策略。系统基于MMEngine [mmengine]构建,对输入的异构配置进行解析、对齐和实例化,构建全局统一的评估配置对象,并完成工作目录和数据的一致性检查,如图2所示。核心配置内容主要包括数据集配置和模型配置。

要定义完整的数据集配置,用户需要构建数据加载配置、推理配置和评估配置。值得注意的是,OpenCompass的配置系统基于OpenICL [openicl]构建,支持高度灵活的提示构建机制,以适应不同任务的上下文学习需求。该机制主要包括三种类型:1)**少样本提示**:基于检索器(Retriever)模块实现。通过配置检索策略,从索引数据集中选择指定的上下文示例,并与测试样本拼接,形成包含示例的完整提示。2)**零样本提示**:直接通过提示模板(Prompt Template)模块构建,仅包含任务描述和测试样本,不包含额外的上下文示例。适用于模型具备零样本泛化能力的任务场景。3)**丰富提示结构**:同样通过提示模板模块构建,并映射到ChatML模板,支持静态多轮上下文提示。

### 3.2 分区与并行

大型语言模型推理的计算密集性以及评估数据集的大规模特性,导致串行执行完整评估任务的时间复杂度随任务规模呈显著线性增长,难以满足大规模模型评估场景下的效率和时效性要求。为应对这一挑战,OpenCompass在推理和评估阶段的核心工作流程中部署了两个核心组件——分区器(Partitioner)和运行器(Runner),用于高效的资源调度,如图3所示。其主要目标是将计算密集的完整评估任务分解为多个独立、互不依赖的子任务,从而通过分布式并行执行充分挖掘集群计算资源的潜力,大幅缩短评估周期。

在完成评估任务配置的解析和对齐后,系统首先将涉及多个模型和数据集的评估需求映射为模型-数据集组合的笛卡尔积集合——即穷举用户指定的模型列表和数据集列表的所有两两组合。随后,分区器根据用户定义的分区标准(例如工作进程数、数据集大小或简单的等分)对任务进行划分。然后为每个子任务构建独立的输出文件路径,并将所有子任务打包成一个结构化的任务列表,传递给运行器。这些子任务作为评估执行的原子单元,可以通过后续的线程和分布式调度并行运行,从而最小化流水线中的气泡比,显著提高计算资源利用率。

在异构多机多GPU集群环境中,大规模评估任务的并行执行高度依赖于底层集群管理系统的作业分配和资源调度能力。然而,不同集群管理系统的调度接口和资源模型存在显著异构性,这大大增加了评估任务跨环境部署的复杂性。在OpenCompass的架构中,最终的任务分配、资源协调和集群交互逻辑统一由运行器(Runner)组件承担。它作为评估任务执行逻辑与底层集群管理系统之间的自适应抽象层,能够屏蔽集群环境的异构性,实现评估任务在不同集群上的标准化和高效调度。

具体而言,运行器的工作流程可以分解为以下阶段:首先,运行器执行集群环境自适应和初始化。Op

相似文章

WebCompass:面向代码语言模型的多模态网页编程评估

Hugging Face Daily Papers

# 论文页面 - WebCompass:面向代码语言模型的多模态网页编程评估 来源:[https://huggingface.co/papers/2604.18224](https://huggingface.co/papers/2604.18224) 作者:, , , , , , , , , , , , , , , , , ## 摘要 WebCompass 通过多样化的输入模态和任务类型评估网页开发能力,采用模拟真实世界编码工作流的自动化评估方法。[大语言模型](https://huggingface.co/papers?q=Large%20language%20model

AgentCompass: 统一智能体能力评估基础设施

arXiv cs.AI

AgentCompass 是一个面向基于大语言模型的智能体的开源、轻量级且可扩展的评估基础设施,将基准测试、测试框架与运行环境解耦,支持灵活配置。它覆盖五个能力维度共20多个基准测试,并提供容错运行时与轨迹分析工具。

语音到语音翻译模型基准测试

arXiv cs.CL

COMPASS是一个统一的语音到语音翻译(S2ST)基准测试框架,它整合了八个维度的46个指标,并在1,248个模型-语言配置上进行了评估。该框架识别了互补的架构优势,并提出了精简的指标子集,在保持排名的同时减少了评估时间。

CombEval: 评估大语言模型中组合计数能力的框架

arXiv cs.AI

CombEval 是一个动态基准测试,用于评估大语言模型中的组合计数能力,通过类型化规范生成带有求解器验证答案的问题。它在直接设置和代码增强设置下测试了11种大语言模型,并发现模型在处理有序对象、不可区分元素、相对约束和嵌套依赖时存在脆弱性。