crash-coding

标签

Cards List
#crash-coding

使用警方事故叙述对前沿大语言模型进行基准测试:对照官方事故数据库编码

arXiv cs.LG · 6天前 缓存

本文对六种前沿大语言模型(LLM)进行基准测试,评估其根据警方事故叙述为事故属性编码的效果,并与官方致命事故数据库进行对照。研究发现,虽然 GPT-5.5 High 在 LLM 中表现领先,但简单基线方法的性能可与 LLM 媲美甚至更优,且属性间的差异大于模型间的差异。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈