language-model-benchmark

标签

Cards List
#language-model-benchmark

语言模型在统计问题表述上的基准测试

arXiv cs.AI · 5天前 缓存

本文介绍了StatFormBench,这是一个用于评估LLMs在统计问题表述上的基准测试,发现当前模型在分类问题和识别变量方面存在显著局限性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈