扩展项目反应理论以实现高效且有意义的多语言评估
摘要
本文介绍了Multilingual-IRT,这是一个统计框架,通过每种语言的难度偏差和拆分可区分性扩展了项目反应理论,能够高效预测未观测到的评估、检测翻译错误以及恢复跨29种语言的文化特定项目。
arXiv:2606.15643v1 Announce Type: new
Abstract: 多语言基准测试对于跨语言评估大型语言模型(LLM)至关重要,但它们存在三个问题:详尽评估随着语言数量线性增长,自动翻译会引入在规模化时容易被忽视的错误,以及某些项目混淆了通用知识和文化特定知识。我们通过统一的统计框架Multilingual-IRT解决了所有三个问题,该框架通过每种语言的难度偏差、将内容与语言效应分离的拆分可区分性以及每种语言的能力残差来扩展项目反应理论。通过在MMLU-Pro-X的29种语言中对25个LLM拟合Multilingual-IRT,我们展示了其拟合参数支持三个实际应用:预测未观测到的(项目、LLM、语言)实例,其二元交叉熵比最强的基于准确率的基线低11-16%;发现分布所有28种非英语语言的候选翻译错误,而基于准确率的基线将检测集中在少数语言上;以及恢复基于准确率的基线遗漏的文化特定项目。
查看缓存全文
缓存时间: 2026/06/16 11:50
# 扩展项目反应理论以实现高效且有意义的多语种评估 来源:https://arxiv.org/abs/2606.15643 查看 PDF (https://arxiv.org/pdf/2606.15643) > 摘要:多语种基准测试是评估大型语言模型(LLM)跨语言性能的核心工具,但它们面临三个问题:全面评估的工作量随语言数量线性增长,自动翻译引入的错误在大规模评估中容易被忽略,以及部分测试项混淆了通用知识与特定文化知识。我们通过统一的统计框架 Multilingual-IRT 解决了这三个问题。该框架在项目反应理论基础上扩展了每语言的难度偏差、区分内容与语言效应的分裂区分度,以及每语言的能力残差。将 Multilingual-IRT 应用于 MMLU-Pro-X 中 29 种语言上的 25 个 LLM,我们展示了其拟合参数支持三种实际应用:预测未观测的(项目、LLM、语言)实例,二元交叉熵比基于准确率的最强基线低 11–16%;揭示分布在所有 28 种非英语语言中的潜在翻译错误,而基于准确率的基线仅将检测集中在少数几种语言上;以及恢复基于准确率基线遗漏的文化特定项目。 ## 提交历史 来自:Gili Lior [查看邮件 (https://arxiv.org/show-email/66399e69/2606.15643)] **[v1]** 2026 年 6 月 14 日(周日)07:16:03 UTC(403 KB)
相似文章
面向AI安全的项目反应理论
本文将项目反应理论应用于192个语言模型在八个安全基准上的评估,识别出三个潜在因素,通过自适应测试实现97-99%的成本削减,并支持故意表现不佳检测和模型审计。
评估失效的缩放定律:为何简单平均在数据稀疏和题目难度差距下会崩溃,以及项目反应理论如何跨领域恢复真实情况
本文指出,在数据稀疏和难度异构的情况下,AI基准测试中的简单平均法会失效,并提出项目反应理论(IRT)作为一种稳健的替代方案,以恢复真实的排名情况。
项目反应缩放定律:一种用于高效且可泛化的神经缩放估计的测量理论方法
介绍项目反应缩放定律(IRSL),该定律整合项目反应理论,可高效估计神经缩放定律,将所需评估问题数量减少99.9%,同时达到相当准确性。
为何安全护栏在不同语言中会退化?
本文引入一个多组项目反应理论框架,以解耦非英语语言中安全退化背后的因素,揭示安全性主要是一维的,且低资源语言会产生更多不确定的响应。
使用项目反应理论审计LLM基准测试
本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。