NOLLI:用于诊断英语-韩语性能差距的难度校准谜题基准
摘要
介绍NOLLI,一个程序化生成的英语-韩语谜题基准,用于诊断LLM性能差距,包含15种谜题类型和校准难度,揭示书写系统密集型任务表现出显著的性能差距。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - NOLLI:用于诊断英语-韩语性能差距的难度校准谜题基准
来源:https://huggingface.co/papers/2608.04397
摘要
我们推出了 NOLLI,一个程序化生成的英语-韩语谜题基准,旨在诊断韩语性能差距出现在何处。它包含 15 种谜题类型(25 个任务;7,500 个条目),每个实例都可以通过种子重新生成、已验证具有唯一解,并以确定性方式评分。我们并没有将“更难”等同于“更大”,而是通过行为方式校准难度,调整每个生成器,直到一个固定的参考模型落入目标准确率区间。其三层次设计结合了匹配的直接翻译、基于韩文子音节的字母(jamo)的书写系统改编,以及根植于韩国文化或正字法的纯韩语任务。我们评估了 15 个前沿、开放权重及韩国开发的模型;在 12 个高于 3% 总体准确率下限的模型中,匹配的英语-韩语准确率在 ±10 个百分点范围内(TOST)统计上等价,这表明仅呈现语言本身带来的代价很小。书写系统密集型任务显示出更明显的差距:韩语密码(Korean Cipher)落后于英语最多达 68.7 个百分点,而基于相同 jamo 的字母算术(Cryptarithmetic)没有表现出系统性惩罚,并且 Jamo 组合准确率可以预测韩语密码准确率。这些对比是诊断性的而非因果性的,与多步子音节执行的难度一致。纯韩语任务将规则应用缺陷(其符号方向各异)与在所有 12 个模型中均为正向的亲属关系缺陷区分开来。最后,一个显著的规模度量在 15 种类型中有 7 种未能从“简单”增长到“困难”,这使得结构性规模成为经验难度不可靠的代理指标。
查看 arXiv 页面 (https://arxiv.org/abs/2608.04397)查看 PDF (https://arxiv.org/pdf/2608.04397)GitHub2 (https://github.com/HAE-RAE/NOLLI)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04397)
在你的 agent 中获取这篇论文:
hf papers read 2608\.04397
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.04397 即可从此页面关联该模型。
引用此论文的数据集 1
HAERAE-HUB/NOLLI 查看器• 约 3 小时前更新 • 7.5k • 7 (https://huggingface.co/datasets/HAERAE-HUB/NOLLI)
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.04397 即可从此页面关联该 Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面关联它。
相似文章
XLGoBench: 通过算法任务检测跨语言技能差距
XLGoBench 引入了一个合成算法任务基准,用于检测大语言模型中的跨语言技能差距,并在多个先进模型中展示了持续的差距。
K-BrowseComp:基于韩国语境的网络浏览智能体基准测试
介绍了K-BrowseComp,一个包含400个问题的韩国网络浏览智能体基准测试,揭示了与英文基准测试相比存在的显著性能差距,并强调了开发强健的韩国人工智能的必要性。
利用多语言LLM嵌入发现词汇空缺
本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。
衡量跨语言理解差距:证据语言如何影响语言模型的理解
本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。
LLMEval-Logic:一个经过求解器验证的、带有对抗性加固的大语言模型逻辑推理中文基准
LLMEval-Logic 是一个新的中文基准,专门评估大语言模型的逻辑推理能力,具有求解器验证的答案和对抗性加固。该基准揭示了当前模型的显著差距,最佳模型在困难项目上仅达到37.5%的准确率。