OmniPhys:一个统一的多模态物理理解与生成基准测试,源自中国教育语料库

arXiv cs.CL 论文

摘要

OmniPhys 是一个大规模的多模态基准测试,专注于物理理解与生成,涵盖了从中学到大学级别的问题,源自中国教育语料库。其目标是评估并推动多模态大型语言模型在科学领域的发展。

arXiv:2608.25398v1 公告类型:新 摘要:多模态大型语言模型(MLLMs)在解决多样化的视觉和文本推理任务方面表现出强大的能力。然而,它们在物理领域的发展由于缺乏一个全面的基准测试而受到显著阻碍。为了填补这一空白,我们推出了 OmniPhys,一个用于多模态物理理解和推理的大规模基准测试,涵盖了从中学到大学级别的问题,源自中国教育语料库。OmniPhys 包含 15,246 个问题和 19,850 张图像,附有详细的标注,支持对推理过程和知识使用的细粒度分析。除了传统的评估,OmniPhys 还是一个系统评估物理领域多模态输出的基准测试,包括模型生成结构化物理图表的能力,这是真实物理问题解决的基本组成部分。广泛的评估揭示了当前 MLLMs 在能力上的关键差距,特别是在复杂推理和视觉生成方面。为了解决这个问题,我们发布了 OmniPhys,以作为推进物理和科学领域多模态智能的基础资源。代码和数据可在 https://github.com/ECNU-RAIL/OmniPhys-EMNLP2026 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:19

# OmniPhys:基于中国教育语料库的物理理解与生成统一多模态基准测试
来源:https://arxiv.org/html/2608.25398
###### 摘要

多模态大语言模型(MLLMs)在解决多样化的视觉与文本推理任务中展现出强大能力。然而,其在物理领域的发展因缺乏全面的基准测试而受到严重阻碍。为填补这一空白,我们推出了OmniPhys——一个大规模的多模态物理理解与推理基准,涵盖从中学到大学水平的题目,均源自中国教育语料库。OmniPhys包含15,246个问题和19,850张图像,并附有详细标注,支持对推理过程和知识运用进行细粒度分析。除了传统评估,OmniPhys还是一个系统评估物理领域多模态输出的基准,包括模型生成结构化物理图表的能力——这是真实物理问题求解的基本组成部分。大量评估揭示了当前MLLMs在能力上的关键差距,尤其是在复杂推理和视觉生成方面。为此,我们开源发布OmniPhys,旨在作为推动物理及科学领域多模态智能发展的基础资源。代码和数据可在以下地址获取:https://github.com/ECNU-RAIL/OmniPhys-EMNLP2026。

## 1 引言

大语言模型(LLMs)[Jaech et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib1);OpenAI (2023) (https://arxiv.org/html/2608.25398#bib.bib2);Gheorghe Comanici 等人 (2025) (https://arxiv.org/html/2608.25398#bib.bib3);Grattafiori et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib4);Liu et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib5)] 与多模态大语言模型(MLLMs)[Radford et al. (2021) (https://arxiv.org/html/2608.25398#bib.bib6);Alayrac et al. (2022) (https://arxiv.org/html/2608.25398#bib.bib35);Li et al. (2023a) (https://arxiv.org/html/2608.25398#bib.bib7)] 的飞速发展,已彻底改变了通用任务中的语言理解与视觉推理能力。然而,将这些模型应用于专业科学领域,如数学问题求解 [Lu et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib51);Yang et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib52)]、物理问题求解 [Ding et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib12);Jaiswal et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib19)] 和图表解读 [Masry et al. (2022) (https://arxiv.org/html/2608.25398#bib.bib9);Methani et al. (2020) (https://arxiv.org/html/2608.25398#bib.bib8)],仍然面临巨大挑战。物理,尤其是作为典型的多模态领域,要求严格整合文本描述、视觉图表和符号逻辑以实现精确推理。

物理是所有自然科学分支的基础 [Feynman (1967) (https://arxiv.org/html/2608.25398#bib.bib11);Smith (2007) (https://arxiv.org/html/2608.25398#bib.bib10)]。尽管已有一些特定数据集用于评估物理推理能力 [Ding et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib12);Anand et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib26);Xu et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib13);Luo et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib27)],但现有工作很少能同时满足三个关键标准:(1) 跨阶段知识融合,覆盖从中学到大学的完整知识谱系;(2) 多模态输入理解,需要解读复杂的文本和视觉线索;(3) 多模态输出生成,评估模型主动综合图表而非仅仅选择选项的能力。缺乏这样一个统一的基准测试,阻碍了对当前模型能力的系统评估。

参见标题图 1:OmniPhys 数据集概览。该基准测试涵盖物理学的五大主要学科,并附有代表性样本示例:力学、电磁学、光学、热力学和声学。
为应对这些挑战,我们推出了 OmniPhys,一个统一的中文基准测试,旨在评估从中等教育到大学阶段的物理掌握水平。如图 1 (https://arxiv.org/html/2608.25398#S1.F1) 所示,该数据集具有严谨的文本、视觉和符号输入组合,涵盖了包括力学、电磁学和光学在内的五大物理学科。为确保难度和教学有效性,所有题目均经过精心策划,源自当代考试卷和权威教材,并经过严格的多阶段筛选流程。特别值得一提的是,OmniPhys 引入了一个开创性的多模态输出任务子集,专门用于评估 MLLMs 在物理图表理解和编辑方面的能力。为建立基准基线,我们对 OmniPhys 进行了全面评估。我们的实证结果表明,尽管近期有所进展,专有和开源的 MLLMs 仍然面临重大挑战。两类模型在处理跨教育阶段的多模态物理推理方面,都展现出巨大的改进空间。我们的主要贡献总结如下:

全面基准测试。我们推出了 OmniPhys,一个涵盖中学到大学物理的真实数据集,用于评估跨阶段推理迁移能力。

生成式子集。我们为多模态输出任务设计了一个新颖的子集,评估模型综合和编辑物理图表的能力。

全面评估。针对最先进 MLLMs 的广泛实验揭示了在概念掌握方面的持续挑战,使 OmniPhys 成为未来研究的严格基准。

## 2 相关工作

表 1:与现有物理数据集的比较。OmniPhys 通过支持多模态输出并涵盖全部教育阶段而独具特色。(语言,PS:小学,MS:中学,HS:高中,Uni:大学)重叠度(最右列)表示 OmniPhys 中与现有基准测试重叠的样本比例,通过字符串相似性和感知哈希计算得出。我们的数据集保持近乎零重叠,同时独特地支持所有阶段的多模态输出。
### 2.1 多模态大语言模型

近期的 MLLMs,如 LLaVA [Liu et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib36)] 和 BLIP-2 [Li et al. (2023b) (https://arxiv.org/html/2608.25398#bib.bib34)],利用指令微调将 LLM 推理适应多模态语境。虽然像 GPT-4V [Wu et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib37)] 和 Gemini [Gheorghe Comanici 等人 (2025) (https://arxiv.org/html/2608.25398#bib.bib3)] 这样的前沿模型现在支持复杂的交错输入和输出,但它们仍然容易产生幻觉 [Bai et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib38)],并且常常在严格的逻辑演绎或数值计算中表现不佳 [Yan et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib39);Jia et al. (2026) (https://arxiv.org/html/2608.25398#bib.bib65)]。这些持续存在的漏洞凸显了开发具有挑战性的基准测试以探索深度多模态推理上限的迫切需求。

### 2.2 物理推理基准测试

表 1 (https://arxiv.org/html/2608.25398#S2.T1) 总结了代表性的物理推理数据集。早期研究主要关注纯文本模态 [Ding et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib12);Jaiswal et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib19);Xu et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib13);Zheng et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib25);Qu et al. (2026) (https://arxiv.org/html/2608.25398#bib.bib64)] 或物理子集有限的通用 K-12 基准测试 [Hendrycks et al. (2020) (https://arxiv.org/html/2608.25398#bib.bib42);Li et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib17);Zhong et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib16);Huang et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib14);Zhang et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib15)]。虽然近期工作引入了图像输入 [He et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib20);Huang et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib22);Li et al. (2025a) (https://arxiv.org/html/2608.25398#bib.bib24);Zhou et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib41);Zhang et al. (2025a) (https://arxiv.org/html/2608.25398#bib.bib66)],但它们仍然存在教育覆盖不完整以及缺乏多模态输出的问题 [Guo et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib40)]。为弥合这些差距,我们推出了 OmniPhys,一个从权威中国教育语料库精心策划的统一基准测试。与经常在网络爬取内容上重叠的现有资源不同,OmniPhys 与当前基准测试保持近乎零重叠(<0.05%),确保了评估的非污染性和独立性。通过涵盖从 K-12 到大学阶段的完整范围,并独特地支持多模态输出,OmniPhys 为物理理解和图表生成提供了一个严格的测试平台。

## 3 OmniPhys 基准测试

我们推出 OmniPhys,一个涵盖从初中到大学课程的综合性多模态物理基准测试。它要求 MLLMs 协同整合图表、公式和文本,进行严谨的、基于视觉的推理。

表 2:OmniPhys 统计数据。该基准测试在三个教育阶段保持高质量分布。为应对生成式人工智能日益增长的需求,我们专门策划了一个多模态生成子集,配有专家标注的图表。
### 3.1 数据来源与分布

OmniPhys 策划自权威的中国教学资源和真实考试卷,涵盖中学到大学课程。原始材料收集自公开的教育平台(如,Zxxk.com)和开放的考试档案库,并依据合理使用原则用于非商业学术研究。为尊重知识产权,发布的基准测试仅包含结构化标注(文本、推理链和重新渲染的图表),而非原始 PDF 的逐字副本。我们利用一个多阶段处理流程,整合了 MinerU [Niu et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib28)] 和 DeepSeek-OCR [Wei et al. (2025) (https://arxiv.org/html/2608.25398#bib.bib29)],将原始 PDF 转换为结构化的 JSONL 格式。每个条目包含全面的标注,包括问题文本、关联图表和逐步推理链。原始材料的代表性样本见附录 D (https://arxiv.org/html/2608.25398#A4)。

表 2 (https://arxiv.org/html/2608.25398#S3.T2) 总结了 OmniPhys 的构成,其架构策略旨在镜像现实世界的物理课程。围绕“难度金字塔”构建,该基准测试从基础的 K-12 概念逐步扩展到高级的大学水平挑战。这种分层结构旨在压力测试模型在专家级场景中的推理上限,超越广泛但浅薄的评估。

### 3.2 数据预处理与质量过滤

为确保 OmniPhys 的正确性、清晰度和可靠性,我们实施了多阶段的数据预处理和过滤流程。

完整性筛选。每个样本都必须严格遵守有效的 JSON 模式,并包含所有必填字段,包括问题陈述、参考答案和详细解答。此外,我们剔除了文本长度不足的样本,有效过滤掉不完整或低质量的内容。

语义去重。我们采用基于嵌入的去重策略,使用 bge-small-zh-v1.5 编码器 [Xiao et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib30)]。我们为所有问题文本计算密集向量表示,并根据 0.95 的余弦相似度阈值识别重复项。这一严格过程消除了 12.1% 的冗余实例,从而得到最终的有效数据集。

视觉依赖性过滤。为确保 OmniPhys 针对真正的多模态推理,我们将实例分为三个级别。级别 1(文本可解)问题仅包含装饰性图像,所有必要信息均在文本中完整说明。级别 2(文本描述性)问题包含传达信息的图像,但文本描述完全复制了视觉内容。级别 3(图像必要)问题需要直接解读图像,因为关键数量或关系仅在图表中提供。为确保分类的稳健性,我们采用了一个多样化的评判小组,包括 DeepSeek-V3 [Liu et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib5)]、Qwen2.5 [Team (2025c) (https://arxiv.org/html/2608.25398#bib.bib32)] 和 GPT-3.5 [Ye et al. (2023) (https://arxiv.org/html/2608.25398#bib.bib33)]。只有被所有三个评判者分类为级别 3 的样本才会被纳入最终数据集。详细的提示策略见附录 A.1 (https://arxiv.org/html/2608.25398#A1.SS1)。为验证此基于文本的推理策略,我们在附录 D (https://arxiv.org/html/2608.25398#A4) 中对随机抽取的 300 个实例进行了人机对齐,达到了 89.3% 的一致率,且 Cohen’s κ = 0.82,与专家判断一致。这证实了仅凭文本线索即可可靠推断视觉依赖性。

难度筛选。我们实施了基于模型的难度筛选。我们使用两个代表性的轻量级 MLLMs:Qwen2.5-VL-3B [Team (2025b) (https://arxiv.org/html/2608.25398#bib.bib55)] 和 MiniCPM-V-2.6 [Yao et al. (2024) (https://arxiv.org/html/2608.25398#bib.bib31)]。我们采用对抗性过滤标准:任何被两个模型都正确解答的问题都被认为挑战性不足,随后被丢弃。该过程使用 vLLM 框架在 2 个 NVIDIA RTX 4090 GPU 上并行化执行。这一步骤优化了数据集分布,移除了容易的问题,以更好地反映有意义的跨阶段物理掌握度。

数据泄露预防。我们特别选用来自一线教育工作者和物理数字化考试的材料,这些材料实际上未被公开索引收录。为实证验证这种隔离性,我们采用基于搜索的过滤协议。我们剔除那些 GPT-4 [OpenAI (2023) (https://arxiv.org/html/2608.25398#bib.bib2)] 通过网络浏览检索到确切答案,或在切换搜索功能时表现出不一致响应的样本。最后,对剩余子集进行人工验证,以确保有效的零样本评估。

人工验证。对随机子集(附录 E (https://arxiv.org/html/2608.25398#A5))的专家交叉验证证实了我们的自动化流程与人类判断之间具有高度一致性。同时,所有收集的材料均经过人工筛查,以排除个人身份信息和敏感内容。

表 3:OmniPhys 主要结果。指标:S1(答案准确率)、S2/S3(客观/开放性任务的过程质量),以及 P_obj,P_open(严格掌握率)。格式:在每个部分(闭源 MLLMs/开源 MLLMs)中,最佳分数加粗,次佳分数下划线。所有模型中的全局最佳以蓝色突出显示。

## 4 实验

### 4.1 实验设置

我们评估了一个多样化

相似文章

Physics-R1: 经过审计的奥赛语料库与视觉物理推理配方

arXiv cs.CL

本文对多模态物理评估流程进行了审计,揭示了诸如训练-评估污染、翻译漂移和多项选择题(MCQ)饱和等问题。它发布了新数据集(PhysCorp-A、PhysR1Corp、PhysOlym-A)和一个训练配方(Physics-R1),显著提高了在保留的奥赛问题上的性能。