MetroLLM-Bench:评估语言模型作为公交亭运行时
摘要
MetroLLM-Bench是一个包含955个案例的基准测试,用于评估语言模型作为公交亭策略层的性能,结果显示,经过微调的小型模型可以在结构化工具使用和票价报价任务上与大型模型相媲美。
查看缓存全文
缓存时间: 2026/09/11 10:17
论文页面 - MetroLLM-Bench:评估语言模型作为地铁票务终端运行时的表现
来源:https://huggingface.co/papers/2609.10016
摘要
针对地铁票务终端策略推理的基准测试表明,经过参数高效微调的小型语言模型在结构化工具调用和票价计算任务上可以匹配更大规模模型的表现。
我们推出 MetroLLM-Bench,这是一个包含 955 个案例的基准测试,用于评估语言模型作为地铁票务终端策略层的能力。它覆盖了六个真实地铁系统(站点数量从 37 个到 414 个不等),包含十一个类别,涉及路径规划、票价计算、运营中断、无障碍服务及对抗性输入等场景。在每个案例中,模型必须调用结构化工具,并提交一个包含结果、单张票价信息(如适用)和终端操作指令的机器可读终端状态。
十四项确定性评分组件构成第一层级;八项语义质量组件构成第二层级,其中六项使用语言模型评判器。我们报告第一层级得分及两个层级的综合得分。通过分层 75/25 划分,保留 717 个案例用于生成训练数据,238 个案例用于独立评估。我们评估了来自六家供应商的二十六款模型,其中二十三款获得了排名。
在独立划分数据上,经过参数高效微调训练的 40 亿参数 Qwen 3.5 学生模型,在第一层级上超越了 GPT-5.6 的两个层级(91.3 对比 90.6 和 90.0),并在最大推理努力下匹配了 GPT-5.4 完整版(91.4),其模型体积仅为 2.6 GB(Q4_K_M 量化)。在此训练规模下,更大规模的 90 亿和 270 亿参数学生模型相比 40 亿参数学生模型并未在第一层级带来进一步提升。
在四个 Qwen 模型尺寸的对比中,参数高效微调相比基础模型的增益从 20 亿参数时的 +7.03 分(使用三个训练随机种子)递减至 270 亿参数时的 -0.91 分;每个随机种子在每个尺寸上都显示出相同的变化趋势。一个确定性的基于规则的基线在第一层级达到 84.6 分,语言模型剩余的优势主要集中在策略适应、复合场景、无障碍服务和时序推理方面。
Muse Glimmer 30B 在综合排名中领先,而仅调整服务配置就能使 Qwen 3.5 到 3.8 的比较产生第一层级 2.7 分的差异。
基准测试工具集、复现指南及微调学生模型现已在 https://github.com/continker/metrollm-bench 发布。
查看 arXiv 页面 查看 PDF 项目页面 GitHub 添加到收藏
通过您的代理获取此论文:
hf papers read 2609.10016
尚未安装最新版 CLI?运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 5 个
continker/metrollm-bench-mac 更新于约 22 小时前 (https://huggingface.co/continker/metrollm-bench-mac)
continker/Qwen3.5-9B-metro-v24 文本生成• 9B• 更新于约 22 小时前 • 11 (https://huggingface.co/continker/Qwen3.5-9B-metro-v24)
continker/Qwen3.5-2B-metro-v24 文本生成• 2B• 更新于约 22 小时前 • 20 (https://huggingface.co/continker/Qwen3.5-2B-metro-v24)
continker/Qwen3.5-4B-metro-v24 文本生成• 4B• 更新于约 22 小时前 • 12 (https://huggingface.co/continker/Qwen3.5-4B-metro-v24)
引用此论文的数据集 0 个
暂无数据集关联此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.10016 即可将本页面与其关联。
引用此论文的空间 1 个
包含此论文的收藏集 1 个
相似文章
Conv-to-Bench: 通过用户-助手对话评估语言模型在代码任务中的表现
Conv-to-Bench 是一个多阶段框架,能够自动将多轮用户-助手对话转化为结构化的、可验证的需求清单,用于评估大型语言模型在代码任务上的表现,以较低的计算成本实现了与人工编写的基准近乎完美的对齐。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
合规、能力与冲突:系统消息下多模态LLM的基准测试
文章介绍了VSysBench,一个评估多模态大语言模型在系统消息下约束合规性与答案正确性的基准。研究发现系统消息降低了任务准确率,且开源权重模型与专有模型的合规表现存在差异。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。