使用警方事故叙述对前沿大语言模型进行基准测试:对照官方事故数据库编码
摘要
本文对六种前沿大语言模型(LLM)进行基准测试,评估其根据警方事故叙述为事故属性编码的效果,并与官方致命事故数据库进行对照。研究发现,虽然 GPT-5.5 High 在 LLM 中表现领先,但简单基线方法的性能可与 LLM 媲美甚至更优,且属性间的差异大于模型间的差异。
arXiv:2607.29064v1 公告类型:新
摘要:警方事故叙述包含可能补充结构化事故数据库的信息,但人工审查劳动强度大,且目前尚不清楚大语言模型(LLM)在多大程度上能重现官方事故编码。本研究通过将叙述推导出的事故属性编码与阿肯色州致命事故数据库中的相应字段进行比较,对六种前沿 LLM 进行了基准测试。该分析将 5,587 份致命事故叙述与来自阿肯色州(2015-2025 年)的 5,889 条结构化事故记录进行关联,得到 4,194 起匹配的事故。使用相同的零样本提示对六种 LLM 进行评估,以对碰撞方式、非机动车驾驶人关系、交叉口类型、施工区关系、路面状况和光照条件进行编码。使用一致性、宏平均 F1 分数、Cohen's kappa、覆盖率、选择性一致性以及与始终多数类、始终未知类和关键词规则基线的比较来评估性能。重复测量分析和广义估计方程模型评估了模型和属性之间的差异。GPT-5.5 High 在评估的 LLM 中取得了最高的一致性,但始终多数类基线产生了更高的原始一致性,关键词规则基线取得的宏平均 F1 分数和 Cohen's kappa 与表现最好的 LLM 相当。非机动车驾驶人关系和碰撞方式的一致性最高,光照条件、路面状况和施工区关系的一致性最低。事故属性之间的差异超过模型之间的差异。这些结果为评估基于 LLM 的事故编码提供了基准,并表明在部署时应在属性特定的基础上使用透明的基线和人工审查进行评估。
查看缓存全文
缓存时间: 2026/08/03 07:35
# 基于警方事故叙述对前沿大语言模型进行官方事故数据库编码基准测试 来源:https://arxiv.org/abs/2607.29064 查看 PDF(https://arxiv.org/pdf/2607.29064) > 摘要:警方事故叙述中包含的信息可补充结构化事故数据库,但人工审核劳动强度大,且目前尚不清楚大语言模型(LLMs)能在多大程度上复现官方事故编码。本研究通过比较从叙述中提取的事故属性编码与阿肯色州致命事故数据库中的相应字段,对六种前沿大语言模型进行了基准测试。分析将阿肯色州(2015—2025年)的 5,587 条致命事故叙述与 5,889 条结构化事故记录进行关联,得到 4,194 起匹配事故。使用相同的零样本提示对六种 LLM 进行评估,用于编码碰撞方式、非机动车使用者关系、交叉口类型、施工区关系、路面状况和光照条件。评估指标包括一致性、宏平均 F1 分数、Cohen's kappa、覆盖率、选择性一致性,并与始终多数类、始终未知类和关键词规则基线进行比较。采用重复测量分析和广义估计方程模型来评估不同模型和属性之间的差异。GPT-5.5 High 在所评估的 LLM 中取得最高一致性,但始终多数类基线产生了更高的原始一致性,关键词规则基线的宏平均 F1 分数和 Cohen's kappa 与表现最佳的 LLM 相当。非机动车使用者关系和碰撞方式的一致性最高,而光照条件、路面状况和施工区关系的一致性最低。不同事故属性之间的差异大于不同模型之间的差异。这些结果为评估基于 LLM 的事故编码提供了基准,并表明部署应在属性特定基础上,使用透明的基线和人工审核进行评估。 ## 提交历史 来自:Sudhir Bharati \[查看邮件(https://arxiv.org/show-email/1b43d849/2607.29064)\] **\[v1\]** 2026年7月31日 星期五 06:32:02 UTC(522 KB)
相似文章
大型语言模型用于安全数据提取的基准测试
本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。
基于多传感器物理危害评估的大语言模型基准测试
该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
真实场景下的对比归因:针对现实基准中大模型失效的可解释性分析
研究者采用基于LRP的对比归因方法,分析大模型在现实基准中失败的原因,发现该方法在某些场景下能提供有用信号,但并非始终可靠。
测试前沿大语言模型在平行物理世界中的物理素养
本文介绍了一种四阶段诊断法,用于测试大语言模型能否在不熟悉的物理框架中进行推理。研究发现,前沿模型的通过率较低,并表现出定性分析与定量分析之间的不对称性。