JOR-Bench:面向大型语言模型的日语运筹学基准测试
摘要
JOR-Bench 是一个包含五个日语基准测试的集合,用于评估大型语言模型在运筹学问题建模方面的能力,这些基准测试从现有的英语基准翻译而来。评估结果显示整体性能与语言无关,仅有轻微的跨语言差异。
arXiv:2607.16777v1 公告类型:新
摘要:我们提出 JOR-Bench,这是一个包含五个日语基准测试的集合,用于评估大型语言模型(LLM)在运筹学(OR)问题建模与求解方面的能力。每个基准测试均从现有英语基准翻译而来:IndustryOR、MAMO Complex LP、NL4OPT、OptiBench 和 OptMATH,涵盖 1,319 个问题,涉及线性规划、混合整数规划、非线性规划和组合优化。JOR-Bench 是一个不依赖求解器的基准测试,可与任何求解器或编程语言配合使用,由日语问题陈述和期望的数值答案对组成。我们评估了七个 LLM,包括多语言通用模型和日语专用模型,在原始英语版本和新日语版本上进行测试,并跨语言比较性能。对于主要评估,我们使用 OR-Tools 的 Python 接口标准化执行流程,使模型输出可比较且可通过开源软件复现。我们的结果表明,对于强大的多语言模型,OR 建模能力基本与语言无关;英语和日语之间的总体平均准确率差异仅为 -0.3 个百分点。然而,错误分析揭示了细微的跨语言差异,包括某些领域中的语用歧义消解失败,导致模型在提示为日语时输出决策变量值而非目标值。
查看缓存全文
缓存时间: 2026/07/21 06:43
# 大型语言模型的日语运筹学基准测试 来源:https://arxiv.org/html/2607.16777 ###### 摘要 我们提出了 JOR-Bench,这是一个包含五个日语基准测试的数据集,用于评估大型语言模型(LLM)在制定和解决运筹学(OR)问题方面的能力。每个基准测试都是现有英语基准测试的日语翻译版本:IndustryOR、MAMO Complex LP、NL4OPT、OptiBench 和 OptMATH,涵盖 1,319 个问题,涉及线性规划、混合整数规划、非线性规划和组合优化。JOR-Bench 是一个与求解器无关的基准测试,可与任何求解器或编程语言一起使用,由日语问题陈述和预期数值答案配对组成。我们评估了七个 LLM,包括多语言通用模型和日语专门化模型,分别在原始英语版本和新的日语版本上进行测试,并比较了跨语言的性能。对于主要评估,我们使用 OR-Tools 的 Python 接口标准化执行流程,以使模型输出具有可比性,并可通过开源软件重现。我们的结果表明,对于强大的多语言模型,OR 制定能力在很大程度上是与语言无关的;英语和日语之间的总体平均准确率差异仅为 -0.3 个百分点。然而,错误分析揭示了微妙的跨语言差异,包括在某些领域中存在一种实用性的歧义消除失败,这导致模型在提示为日语时输出决策变量值而不是目标值。 JOR-Bench:大型语言模型的日语运筹学基准测试 Yuu Jinnai CyberAgent 日本东京 [email protected] ## 1 引言 运筹学(OR)关注于复杂系统中的数学优化决策 [Hillier and Lieberman, 2005 (https://arxiv.org/html/2607.16777#bib.bib3)]。将现实世界问题表述为数学规划是一项认知要求很高的任务,传统上需要专业知识。随着大型语言模型(LLM)在数学和代码生成任务上的快速进步,人们越来越关注 LLM 能否自动化 OR 问题的制定过程 [Ramamonjison et al., 2023 (https://arxiv.org/html/2607.16777#bib.bib10)]。 用于评估基于 LLM 的 OR 制定的现有基准测试主要是英语资源 [Yang et al., 2025 (https://arxiv.org/html/2607.16777#bib.bib11); Lu et al., 2025 (https://arxiv.org/html/2607.16777#bib.bib7); Huang et al., 2025a (https://arxiv.org/html/2607.16777#bib.bib4)]。这为非英语语言留下了空白:在非英语环境中工作的从业者无法可靠地知道 LLM 处理其母语表述问题的能力是否与处理英语表述问题的能力相当。对于研究界来说,了解 LLM 的数学制定能力是与语言无关还是存在系统性跨语言差异也很有意义。 在本文中,我们介绍了 JOR-Bench,这是一个包含五个日语基准测试的数据集,用于评估 LLM 的 OR 制定能力,这些基准测试源自对现有英语基准测试的翻译。我们对七个 LLM 进行了跨语言评估,包括多语言通用模型和日语专门化模型,分别在基准测试的原始英语版本和新的日语版本上进行。我们发现,对于强大的多语言模型,总体 OR 制定能力在很大程度上是与语言无关的,英语和日语之间的平均准确率差异仅为 -0.3 个百分点。 ## 2 JOR-Bench:日语 OR 基准测试 ### 2.1 源基准测试 JOR-Bench 翻译了五个现有的英语 OR 基准测试。 **IndustryOR** [Huang et al., 2025a (https://arxiv.org/html/2607.16777#bib.bib4)] 包含 100 个来自制造业、物流和供应链管理的真实工业优化问题。问题通常涉及多周期规划,带有多个决策变量和现实约束。 **MAMO Complex LP** [Huang et al., 2025b (https://arxiv.org/html/2607.16777#bib.bib5)] 包含 203 个线性规划问题,通过人工标注和 LLM 辅助质量检查相结合的方式进行收集和审查。所有问题都可以使用标准的 LP 求解器解决。 **NL4OPT** [Ramamonjison et al., 2023 (https://arxiv.org/html/2607.16777#bib.bib10)] 源自 2022 年举办的 NL4OPT 竞赛。该数据集包含 245 个用英语表达的小型 LP 问题。问题通常涉及两到三个决策变量和少量线性约束。 **OptiBench** [Yang et al., 2025 (https://arxiv.org/html/2607.16777#bib.bib11)] 涵盖了各种各样的 OR 问题,包括由工作人员从教科书中收集的非线性规划问题。 **OptMATH** [Lu et al., 2025 (https://arxiv.org/html/2607.16777#bib.bib7)] 是一个专注于困难组合优化和 MIP 问题的合成数据集,包括作业车间调度、设施分散和飞机着陆调度。 ### 2.2 翻译方法 我们使用基于 LLM 的翻译,然后进行人工后期编辑,将所有五个英语数据集翻译成日语。由于许多源问题包含 Markdown 表格、结构化数据和数学符号,因此保留输入格式与翻译自然语言文本同样重要。我们使用 gpt-oss-120b 进行翻译,因为在初步检查中,它比我们测试的标准机器翻译模型更可靠地保留了表格和混合格式的问题陈述。然后,第一作者对翻译进行后期编辑,以检查术语、数值一致性和对原始英语问题陈述的忠实度。 | 日语 | 英语 | 答案 | | :--- | :--- | :--- | | ある会計事務所は、パートタイム従業員とフルタイム従業員を雇用しています。フルタイム従業員は1シフトにつき8時間働き、パートタイム従業員は1シフトにつき4時間働きます。さらに、フルタイム従業員はシフトごとに300ドル、パートタイム従業員はシフトごとに100ドルを支払われます。現在、会計事務所には500時間の労働時間を必要とするプロジェクトがあります。予算が15,000ドルの場合、合計労働者数を最小にするために、各タイプの労働者を何人ずつスケジュールすべきでしょうか。 | An accounting firm employs part time workers and full time workers. Full time workers work 8 hours per shift while part time workers work 4 hours per shift. In addition, full time workers are paid $300 per shift while part time workers are paid $100 per shift. Currently, the accounting firm has a project requiring 500 hours of labor. If the firm has a budget of $15000, how many of each type of worker should be scheduled to minimize the total number of workers. | 100 | 表 1:JOR-Bench 的示例条目。 ### 2.3 评估协议 表 1 (https://arxiv.org/html/2607.16777#S2.T1) 展示了 JOR-Bench 的一个示例条目。每个条目将日语问题描述与预期数值答案配对。因此,该基准测试与求解器无关:只要最终答案可以数值比较,它就可以评估任何由 LLM 生成的解决方案。 对于本文中的实验,我们使用以下基于执行的协议。我们提示每个模型生成一个独立的 Python 脚本,用于制定和解决给定的优化问题(参见附录 B (https://arxiv.org/html/2607.16777#A2))。模型需要将 Python 代码用围栏代码块(三重反引号)括起来,这是标准 Markdown 功能。如果未找到此类代码块,我们将该问题标记为“无代码”失败。如果找到代码块,我们提取代码并尝试在安装了 OR-Tools 的沙盒 Python 环境中执行。沙盒对每个问题强制执行最长 300 秒的执行时间和 32GB 内存限制。如果执行超出任一限制,我们将该问题标记为“超时”或“超出内存限制”失败。如果运行输出在 `10^{-6}` 容差范围内匹配预期答案,则将该问题标记为正确;否则,标记为不正确。模型偶尔会生成仅使用 Python 标准库而不导入 OR-Tools 的代码。只要输出正确,我们允许这种行为,因为基准测试旨在衡量问题解决准确性,而不是对特定求解器 API 的严格遵从。 ## 3 实验 主要实验使用 OR-Tools 作为执行后端。为了评估后端敏感性,我们还在附录 A (https://arxiv.org/html/2607.16777#A1) 中报告了在 PuLP 和 Pyomo 上的 MAMO 结果。 ### 3.1 模型 我们评估了七个 LLM,涵盖不同的规模、训练目标和语言专业化领域。所有模型都是推理模型。表 2 (https://arxiv.org/html/2607.16777#S3.T2) 提供了摘要。Swallow 是一个日语专门化模型家族,从 Qwen-3 系列权重开始进行持续预训练 [Fujii et al., 2024 (https://arxiv.org/html/2607.16777#bib.bib2); Ma et al., 2025 (https://arxiv.org/html/2607.16777#bib.bib8)],以提高日语能力。我们使用 Swallow 的微调版本,因为它们在数学和编码任务上表现与 Qwen-3 系列模型大致相当。虽然 Swallow 是日语专门化的,但它被训练成用英语推理。CAT-Thinking [Jinnai, 2026 (https://arxiv.org/html/2607.16777#bib.bib6)] 是一个日语专门化模型,在 Swallow-8B 基础上进一步微调。CAT-Thinking 在广泛的推理任务上进行训练,包括数学制定和代码生成,并被强制用日语生成推理痕迹。因此,至少在表面上,当用日语提示 CAT-Thinking 时,英语不会干扰输出的生成。CAT-Thinking 在标准数学和编码基准测试中的性能略低于 Swallow-8B。使用这些模型使我们能够评估日语专门化对两种语言的 OR 制定能力的影响。我们还评估了 Nemotron,一个在日语和英语混合数据上训练的日语专门化模型 [NVIDIA, 2025 (https://arxiv.org/html/2607.16777#bib.bib9)],以及 GPT-OSS,一个具有高能力的多语言通用模型 [openai2024gptoss]。 | 模型 | 全名 | 参数 | | :--- | :--- | :--- | | Qwen3-8B | Qwen/Qwen3-8B | 8B | | Qwen3-32B | Qwen/Qwen3-32B | 32B | | Swallow-8B | tokyotech-llm/Qwen3-Swallow-8B-RL-v0.2 [Ma et al., 2025 (https://arxiv.org/html/2607.16777#bib.bib8)] | 8B | | Swallow-32B | tokyotech-llm/Qwen3-Swallow-32B-RL-v0.2 [Ma et al., 2025 (https://arxiv.org/html/2607.16777#bib.bib8)] | 32B | | CAT-Thinking | cyberagent/CAT-Thinking-8B [Jinnai, 2026 (https://arxiv.org/html/2607.16777#bib.bib6)] | 8B | | Nemotron | nvidia/NVIDIA-Nemotron-Nano-9B-v2-JP [NVIDIA, 2025 (https://arxiv.org/html/2607.16777#bib.bib9)] | 9B | | GPT-OSS | openai/gpt-oss-120b | 120B | 表 2:评估的模型。所有七个模型都在全部五个基准测试的英语和日语版本上运行。 ### 3.2 结果 表 3 (https://arxiv.org/html/2607.16777#S3.T3) 和表 4 (https://arxiv.org/html/2607.16777#S3.T4) 分别显示了英语和日语基准测试上的准确率(%)。 | 模型 | Indus | MAMO | NL4OPT | OptiB | OptM | | :--- | :--- | :--- | :--- | :--- | :--- | | CAT-Thinking | 77.0 | 85.2 | 81.6 | 77.9 | 64.0 | | GPT-OSS | 81.0 | 74.9 | 17.6 | 42.0 | 73.2 | | Qwen3-8B | 35.0 | 38.9 | 76.7 | 57.9 | 10.4 | | Qwen3-32B | 53.0 | 50.2 | 80.0 | 61.8 | 25.9 | | Swallow-8B | 27.0 | 12.3 | 45.7 | 33.1 | 7.3 | | Swallow-32B | 48.0 | 28.6 | 43.3 | 40.7 | 42.0 | | Nemotron | 9.0 | 4.9 | 4.1 | 3.0 | 7.0 | 表 3:**英语**基准测试上的准确率(%)。粗体 = 最佳;下划线 = 每列第二好。 | 模型 | Indus | MAMO | NL4OPT | OptiB | OptM | | :--- | :--- | :--- | :--- | :--- | :--- | | CAT-Thinking | 81.8 | 85.0 | 71.0 | 70.7 | 66.3 | | GPT-OSS | 81.8 | 73.5 | 21.2 | 46.4 | 71.7 | | Qwen3-8B | 48.5 | 34.5 | 78.4 | 62.0 | 13.3 | | Qwen3-32B | 55.6 | 50.0 | 70.6 | 58.8 | 19.5 | | Swallow-8B | 23.2 | 10.5 | 46.5 | 31.7 | 7.2 | | Swallow-32B | 50.5 | 37.5 | 42.9 | 41.7 | 45.1 | | Nemotron | 3.0 | 1.0 | 4.5 | 4.1 | 1.2 | 表 4:**日语**基准测试上的准确率(%)。粗体 = 最佳;下划线 = 每列第二好。 ## 4 定量和定性分析 表 5 (https://arxiv.org/html/2607.16777#S4.T5) 显示了所有七个模型在五个基准测试上的 `Δ_JA = acc_JA - acc_EN`。 | 模型 | Indus | MAMO | NL4OPT | OptiB | OptM | Avg | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | CAT-Thinking | +4.8 | +4.8 | -0.2 | -10.6*** | -7.1** | +2.2 | -2.2 | | GPT-OSS | +0.8 | -1.4 | +3.7 | +4.5** | -1.5 | +1.2 | | Qwen3-8B | +13.5* | -4.4 | +1.6 | +4.1 | +2.9 | +3.5 | | Qwen3-32B | +2.6 | -0.2 | -9.4** | -3.0 | -6.4 | -3.3 | | Swallow-8B | -3.8 | -1.8 | +0.8 | -1.3 | -0.1 | -1.2 | | Swallow-32B | +2.5 | +8.9* | -0.4 | +1.0 | +3.2 | +3.0 | | Nemotron | -6.0 | -3.9 | +0.4 | +1.2 | -5.8* | -2.8 | | Avg | +2.1 | -0.4 | -2.0 | -0.1 | -0.8 | -0.2 | 表 5:`Δ_JA`(百分点)= 日语准确率减去英语准确率。根据 McNemar 检验(连续性校正)的显著性:`*p < 0.05`,`**p < 0.01`,`***p < 0.001`。正值表示日语更好;负值表示英语更好。 #### 总体语言中立性。 总平均 `Δ_JA` 为 -0.3 个百分点——在统计上与零无显著差异。大多数单个单元格位于 `±5` 个百分点范围内。这表明,对于具有足够多语言训练的模型,以代码生成准确性衡量的 OR 制定能力在很大程度上是与语言无关的。 #### 统计显著性。 我们对每个模型-数据集对的逐问题二元结果应用了 McNemar 检验(连续性校正)。在 35 个配对中,只有 7 个达到 `p < 0.05`(在表 5 (https://arxiv.org/html/2607.16777#S4.T5) 中标记)。四个显著下降集中在 NL4OPT 和 OptiBench 上;三个显著提升分布在 IndustryOR(Qwen3-8B,`p=0.026`)、MAMO(Swallow-32B,`p=0.030`)和 OptiBench(GPT-OSS,`p=0.008`)上。其余 28 个单元格在统计上与零无显著差异。 #### 模型规模与语言的交互作用。 无论在哪种语言中,规模都有助于提高性能,尤其是在困难问题上。在同一模型家族内增加模型规模一致地提高了准确率,并且在最困难的基准测试上提升最大。在 OptMATH(EN)上,Qwen3-32B 的准确率是 Qwen3-8B 的两倍多(25.9% 对比 10.4%),Swallow-32B 相比 Swallow-8B 提高了近六倍(42.0% 对比 7.3%)。这种复杂度的组合优化似乎无论语言专门化如何,都需要相当大的模型容量。 尽管如此,我们评估了两种规模的模型家族*表现出*关于语言的*相反*扩展行为。对于 Qwen3,较小的 8B 模型在日语上有所提升(平均 +3.5 个百分点,是所有模型中最好的),而较大的 32B 模型则下降(-3.3 个百分点),在 NL4OPT 上下降了 -9.4 个百分点,在 OptMATH 上下降了 -6.4 个百分点。对于 Swallow,模式则相反:8B 模型在日语上下降(-1.2 个百分点),而 32B 模型则提升(+3.2 个百分点),包括在 MAMO 上 +8.9 个百分点的提升。这些交叉现象表明,跨语言迁移不是模型家族的固定属性,而是取决于规模与语言专门化之间的交互作用。 #### 大多数模型在 MAMO 上下降。 MAMO 表现出最一致的负迁移方向:七个模型中有六个在日语上下降,尽管平均下降幅度很小(-0.4 个百分点),因为 Swallow-32B 提升了 +8.9 个百分点。我们在第 4.1 节 (https://arxiv.org/html/2607.16777#S4.SS1) 中研究了这种模式。 ### 4.1 MAMO:大多数模型在日语上的下降 我们分析了 MAMO 上的错误类型,以理解为什么大多数模型在日语上表现稍差。表 6 (https://arxiv.org/html/2607.16777#S4.T6) 将失败分解为我们的错误分类。使用 PuLP 和 Pyomo 的后端敏感性结果在附录 A (https://arxiv.org/html/2607.16777#A1) 中单独报告;本小节重点讨论 OR-Tools 特定的错误行为。 | 模型 | 语言 | 正确 | 无代码 | 导入错误 | | :--- | :--- | :--- | :--- | :--- | | GPT-OSS | EN | 74.9% | 1. | |
相似文章
YOMI-Bench:评估日语中汉字读音和语音理解的LLM基准测试
YOMI-Bench 是一个旨在评估大语言模型在日语汉字读音和语音理解方面的基准测试。它包含四项任务,并揭示即使是专门针对日语的模型在需要汉字读音知识的生成任务上也表现不佳。
KyrgyzLLM-Bench: 吉尔吉斯语言理解基准测试
本文介绍了KyrgyzLLM-Bench,这是一个用于评估吉尔吉斯语大语言模型的基准测试套件,包含原生创作和翻译数据集,并对26个模型进行了系统评估。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
LegalBench-BR:评估大语言模型在巴西法律判决分类上的基准
研究者发布首个公开基准 LegalBench-BR,用于评估大模型在巴西法律文本分类任务上的表现。实验表明,LoRA 微调的 BERTimbau 大幅超越 GPT-4o mini 与 Claude 3.5 Haiku。
RedBench:大型语言模型综合红队测试通用数据集
RedBench 引入了一个通用数据集,聚合了 37 个基准数据集,包含 29,362 个样本,涵盖 22 个风险类别和 19 个领域,用于实现大型语言模型的标准化和综合红队测试评估。该工作解决了现有红队测试数据集中的不一致问题,并提供了基准、评估代码和开源资源,用于评估 LLM 对对抗提示的鲁棒性。