NOLLI:用于诊断英语-韩语性能差距的难度校准谜题基准

Hugging Face Daily Papers 论文

摘要

介绍NOLLI,一个程序化生成的英语-韩语谜题基准,用于诊断LLM性能差距,包含15种谜题类型和校准难度,揭示书写系统密集型任务表现出显著的性能差距。

我们推出NOLLI,一个程序化生成的英语-韩语谜题基准,旨在诊断韩语性能差距的出现位置。它由15种谜题类型(25个任务;7,500个题目)组成,每个实例均可通过种子重新生成,经验证具有唯一解,并以确定性方式评分。我们没有将“更难”等同于“更大”,而是从行为层面校准难度,调整每个生成器,直到固定的参考模型落在目标准确率区间内。其三层设计结合了匹配的直接翻译、基于韩文jamo(次级音节字母)的脚本改编,以及植根于韩国文化或正字法的仅韩语任务。我们评估了15个前沿模型、开放权重模型和韩国开发的模型;在12个高于3%总体准确率下限的模型中,匹配的英韩准确率在±10个百分点范围内统计等价(TOST),这表明仅凭呈现语言本身造成的成本很小。书写系统密集型任务表现出更明显的差距:韩语密码(Cipher)比英语落后最多68.7个百分点,而基于相同jamo的字母算术(Cryptarithmetic)没有表现出系统性损失,并且jamo组合准确率可以预测韩语密码准确率。这些对比具有诊断性而非因果性,与多步骤次级音节执行的难度相符。仅韩语任务将符号各异的规则应用缺陷与在所有12个模型中均为正向的亲属关系缺陷区分开来。最后,一个显著的大小度量在15种类型中的7种中未能从简单到困难增长,这使得结构大小无法可靠地代表经验难度。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:50

论文页面 - NOLLI:用于诊断英语-韩语性能差距的难度校准谜题基准

来源:https://huggingface.co/papers/2608.04397

摘要

我们推出了 NOLLI,一个程序化生成的英语-韩语谜题基准,旨在诊断韩语性能差距出现在何处。它包含 15 种谜题类型(25 个任务;7,500 个条目),每个实例都可以通过种子重新生成、已验证具有唯一解,并以确定性方式评分。我们并没有将“更难”等同于“更大”,而是通过行为方式校准难度,调整每个生成器,直到一个固定的参考模型落入目标准确率区间。其三层次设计结合了匹配的直接翻译、基于韩文子音节的字母(jamo)的书写系统改编,以及根植于韩国文化或正字法的纯韩语任务。我们评估了 15 个前沿、开放权重及韩国开发的模型;在 12 个高于 3% 总体准确率下限的模型中,匹配的英语-韩语准确率在 ±10 个百分点范围内(TOST)统计上等价,这表明仅呈现语言本身带来的代价很小。书写系统密集型任务显示出更明显的差距:韩语密码(Korean Cipher)落后于英语最多达 68.7 个百分点,而基于相同 jamo 的字母算术(Cryptarithmetic)没有表现出系统性惩罚,并且 Jamo 组合准确率可以预测韩语密码准确率。这些对比是诊断性的而非因果性的,与多步子音节执行的难度一致。纯韩语任务将规则应用缺陷(其符号方向各异)与在所有 12 个模型中均为正向的亲属关系缺陷区分开来。最后,一个显著的规模度量在 15 种类型中有 7 种未能从“简单”增长到“困难”,这使得结构性规模成为经验难度不可靠的代理指标。

查看 arXiv 页面 (https://arxiv.org/abs/2608.04397)查看 PDF (https://arxiv.org/pdf/2608.04397)GitHub2 (https://github.com/HAE-RAE/NOLLI)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04397)

在你的 agent 中获取这篇论文:

hf papers read 2608\.04397

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.04397 即可从此页面关联该模型。

引用此论文的数据集 1

HAERAE-HUB/NOLLI 查看器• 约 3 小时前更新 • 7.5k • 7 (https://huggingface.co/datasets/HAERAE-HUB/NOLLI)

引用此论文的 Space 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.04397 即可从此页面关联该 Space。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面关联它。

相似文章

利用多语言LLM嵌入发现词汇空缺

arXiv cs.CL

本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。

衡量跨语言理解差距:证据语言如何影响语言模型的理解

arXiv cs.CL

本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。