MetroLLM-Bench:评估语言模型作为公交亭运行时

Hugging Face Daily Papers 论文

摘要

MetroLLM-Bench是一个包含955个案例的基准测试,用于评估语言模型作为公交亭策略层的性能,结果显示,经过微调的小型模型可以在结构化工具使用和票价报价任务上与大型模型相媲美。

我们介绍MetroLLM-Bench,这是一个包含955个案例的基准测试,用于测试语言模型作为公交亭的策略层。它覆盖了六个真实的地铁系统,站点数量从37到414不等,以及十一个类别,包括路径规划、票价计算、中断服务、无障碍设施和对抗性输入。在每个案例中,模型必须调用结构化工具并提交一个机器可渲染的终态,包含结果、适用时的单张票价报价和亭子操作。十四个确定性评分组件构成第一层;八个语义质量组件构成第二层,其中六个使用语言模型评判器。我们报告第一层分数和两层的组合分数。一个分层75/25的分割保留了717个案例用于训练数据生成,238个用于保留评估。 我们评估了来自六家供应商的二十六个模型,其中二十三个被排名。在保留分区上,一个通过参数高效微调(PEFT)训练的4B Qwen 3.5学生模型在第一层上超过了GPT-5.6的两个层级(91.3对比90.6和90.0),并在最大推理努力下匹配了GPT-5.4完整版(91.4),足迹为2.6 GB Q4_K_M。更大的9B和27B学生模型在这个训练规模上没有比4B学生模型在第一层上提供进一步的改进。在四个Qwen尺寸中,PEFT相对于相应基础模型的增益从2B时的+7.03分(三个训练种子)下降到27B时的-0.91;每个种子在每个尺寸上都显示相同的方向。一个确定性基于规则的基线在第一层达到84.6,剩余的语言模型优势集中在策略适应、复合场景、无障碍设施和时间推理上。Muse Glimmer 30B在复合排名中领先,仅服务配置就使Qwen 3.5到3.8的比较移动了2.7个第一层点。基准测试、工具、复现指南和微调学生模型已发布在 https://github.com/continker/metrollm-bench。
查看原文
查看缓存全文

缓存时间: 2026/09/11 10:17

论文页面 - MetroLLM-Bench:评估语言模型作为地铁票务终端运行时的表现

来源:https://huggingface.co/papers/2609.10016

摘要

针对地铁票务终端策略推理的基准测试表明,经过参数高效微调的小型语言模型在结构化工具调用和票价计算任务上可以匹配更大规模模型的表现。

我们推出 MetroLLM-Bench,这是一个包含 955 个案例的基准测试,用于评估语言模型作为地铁票务终端策略层的能力。它覆盖了六个真实地铁系统(站点数量从 37 个到 414 个不等),包含十一个类别,涉及路径规划、票价计算、运营中断、无障碍服务及对抗性输入等场景。在每个案例中,模型必须调用结构化工具,并提交一个包含结果、单张票价信息(如适用)和终端操作指令的机器可读终端状态。

十四项确定性评分组件构成第一层级;八项语义质量组件构成第二层级,其中六项使用语言模型评判器。我们报告第一层级得分及两个层级的综合得分。通过分层 75/25 划分,保留 717 个案例用于生成训练数据,238 个案例用于独立评估。我们评估了来自六家供应商的二十六款模型,其中二十三款获得了排名。

在独立划分数据上,经过参数高效微调训练的 40 亿参数 Qwen 3.5 学生模型,在第一层级上超越了 GPT-5.6 的两个层级(91.3 对比 90.6 和 90.0),并在最大推理努力下匹配了 GPT-5.4 完整版(91.4),其模型体积仅为 2.6 GB(Q4_K_M 量化)。在此训练规模下,更大规模的 90 亿和 270 亿参数学生模型相比 40 亿参数学生模型并未在第一层级带来进一步提升。

在四个 Qwen 模型尺寸的对比中,参数高效微调相比基础模型的增益从 20 亿参数时的 +7.03 分(使用三个训练随机种子)递减至 270 亿参数时的 -0.91 分;每个随机种子在每个尺寸上都显示出相同的变化趋势。一个确定性的基于规则的基线在第一层级达到 84.6 分,语言模型剩余的优势主要集中在策略适应、复合场景、无障碍服务和时序推理方面。

Muse Glimmer 30B 在综合排名中领先,而仅调整服务配置就能使 Qwen 3.5 到 3.8 的比较产生第一层级 2.7 分的差异。

基准测试工具集、复现指南及微调学生模型现已在 https://github.com/continker/metrollm-bench 发布。

查看 arXiv 页面 查看 PDF 项目页面 GitHub 添加到收藏

通过您的代理获取此论文:

hf papers read 2609.10016

尚未安装最新版 CLI?运行:curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 5 个

continker/metrollm-bench-mac 更新于约 22 小时前 (https://huggingface.co/continker/metrollm-bench-mac)

continker/Qwen3.5-9B-metro-v24 文本生成• 9B• 更新于约 22 小时前 • 11 (https://huggingface.co/continker/Qwen3.5-9B-metro-v24)

continker/Qwen3.5-2B-metro-v24 文本生成• 2B• 更新于约 22 小时前 • 20 (https://huggingface.co/continker/Qwen3.5-2B-metro-v24)

continker/Qwen3.5-4B-metro-v24 文本生成• 4B• 更新于约 22 小时前 • 12 (https://huggingface.co/continker/Qwen3.5-4B-metro-v24)

浏览 5 个引用此论文的模型

引用此论文的数据集 0 个

暂无数据集关联此论文。

在数据集的 README.md 中引用 arxiv.org/abs/2609.10016 即可将本页面与其关联。

引用此论文的空间 1 个

包含此论文的收藏集 1 个

相似文章

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。