LLM基准测试
摘要
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
暂无内容
相似文章
基准并非铁板一块:面向LLM评估的样本级审计与编排
本文提出了一种以数据集为中心的元评估框架,在五个潜在维度上对LLM基准进行样本级审计,揭示其内部异质性,并支持基于标准的基准子集组合,以实现针对性的模型评估。
RepBench:将基准测试编译为大语言模型的能力表示
RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。
语言模型在统计问题表述上的基准测试
本文介绍了StatFormBench,这是一个用于评估LLMs在统计问题表述上的基准测试,发现当前模型在分类问题和识别变量方面存在显著局限性。
CulturALL:评测大模型多语言多文化能力的实景基准
CulturALL 发布含 2,610 条样本、覆盖 14 种语言和 51 个地区的实景基准,用于检验大模型在真实文化场景下的表现;目前最佳模型仅得 44.48%,提升空间巨大。
大型语言模型个性化能力的基准测试
本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。