KoNeoBench:一个用于评估 LLM 对韩语新词理解的精选评估数据集

arXiv cs.CL 论文

摘要

本文介绍了 KoNeoBench,这是一个精选的基准数据集,用于评估大型语言模型对韩语新词的理解,基于自2020年以来的1,785个在线新闻条目。它揭示了当前 LLM 在处理近期词汇变化和特定韩语语言特性方面的局限性。

arXiv:2609.19916v1 公告类型:新 摘要:大型语言模型(LLMs)通常在静态基准上进行评估,即使自然语言通过新出现的词汇和意义不断演变。现有的韩语基准以已确立的词汇为中心,因此对这类近期词汇变化的覆盖有限,并且它们以英语为导向的设计使得评估韩语的类型学特性变得困难,韩语中实义词与功能词素具有生产性的组合。在本文中,我们介绍了 KoNeoBench,一个用于评估 LLM 对韩语新词理解的基准。KoNeoBench 基于自2020年以来在线新闻中证实的1,785个韩语新词构建,并通过专家词典编纂审查进行精选。每个条目提供用例示例、构词分析和字典式定义。基于此资源,我们定义了四个任务,并报告了最近模型的结果以及人类基线。我们的实验表明,当前 LLM 在恢复源成分、区分语义类别和生成准确定义方面表现出明显的局限性。这些结果揭示了当前 LLM 仍面临挑战的韩语近期词汇变化的具体方面。KoNeoBench 可在 https://github.com/bcmilab/ko-neobench/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:06

# 评估LLM对韩语新词理解能力的精选数据集  
来源:https://arxiv.org/html/2609.19916  

Soha Lee††注:这些作者对本工作贡献均等。  
Soojin Lee11注脚标记:1  
单位:庆北大学国际交流处  

Heesung Yang  
单位:庆北大学计算机科学与工程学院  

Hyunju Song  
单位:庆北大学国语国文教育学系  

Hyunji Lee  
单位:庆北大学计算机科学与工程学院  

Jinsan An  
单位:庆北大学国语国文系  

Jeongwan Shin  
单位:大邱庆北科学技术院(DGIST)  

Jin Hyun Park  
单位:德州农工大学计算机科学与工程系  

Jun Lee  
单位:延世大学国语国文系  

Hyeyoung Park††注:通讯作者:Kilim Nam ([email protected]), Hyeyoung Park ([email protected])  
单位:庆北大学计算机科学与工程学院  

Kilim Nam22注脚标记:2  
单位:延世大学国语国文系  

###### 摘要  
大型语言模型(LLMs)通常在静态基准上进行评估,尽管自然语言通过新涌现的词汇和含义不断演变。现有的韩语基准以既定词汇为中心,因此对此类近期词汇变化的覆盖有限,其面向英语的设计使得难以评估韩语的类型学特性——在韩语中,实义词可与功能性语素进行能产性结合。本文介绍了KoNeoBench,一个用于评估LLMs对韩语新词理解能力的基准。KoNeoBench基于自2020年以来在线新闻中记录的1,785个韩语新词构建,并通过专业词典编纂审查进行整理。每个词条提供使用示例、构词分析和词典式定义。基于此资源,我们定义了四个任务,并报告了近期模型的结果,同时提供了人类基线。实验表明,当前LLMs在溯源构成成分、区分语义类别和生成准确释义方面存在明显局限。这些结果揭示了当前LLMs在处理近期韩语词汇变化时面临的具体挑战。KoNeoBench可在https://github.com/bcmilab/ko-neobench/获取。  

## 1 引言  
大型语言模型(LLMs)在许多语言任务上表现优异,但其评估仍主要依赖于基于固定语言数据和知识构建的静态基准,参见图注:图1:理解韩语新词的挑战。(a)LLMs对新词与通用词的语义分类性能对比。(详细信息见附录C.1 https://arxiv.org/html/2609.19916#A3.SS1)(b)一个由缩略和混成构成的新词。这可能无法完全捕捉近期语言变化的方面。先前工作已从时间泛化和时间错位的角度强调了这一局限性,表明模型在未来文本、时间敏感事实和更新的世界知识上性能下降(Lazaridou等,2021;Luu等,2022;Dhingra等,2022;Vu等,2024;Zhu等,2025)。然而,近期的语言变化不仅限于事实更新;它也通过新词和词义转变在词汇和语义层面涌现。作为此类变化的早期指标,新词不仅反映了语言形式和意义的变化,也反映了语言社群的社会文化背景(Nam等,2025)。因此,评估LLM对新词的理解可以为其在捕捉语言使用中近期的词汇及社会文化发展方面的表现提供洞察。  

近期研究已开始通过新词和非正式表达来评估LLMs对语言变化的适应能力。NeoBench(Zheng等,2024)引入了新词处理的基准数据和任务,而Mei等(2024)和Sun等(2024)考察了LLMs对网络俚语、梗图和非正式表达的理解、检测及来源识别。然而,这些研究主要关注英语,针对韩语新词的基准仍然有限。在韩语内部,我们在图1(a)中的初步结果也显示,不同LLMs在既定词汇和新词之间存在显著的性能差距,这促使我们更深入地考察它们对韩语新词的理解。  

除了性能差距,韩语新词还表现出一些语言特征,值得在基准设计中明确考虑。韩语是黏着语,助词和词尾附着于词干。图1(b)展示了一个通过缩略和/或混成形成的新词如何与语法语素结合,要求模型既识别新词边界,又识别附着语素的功能。韩语还包含许多由多个词汇层构成的混合新词,包括固有韩语、汉字韩语和外来词。这些特性使得韩语新词特别难以解释和分析,因此在评估模型理解时应予以考虑。  

为解决现有基准对韩语新词覆盖有限的问题,我们推出了KoNeoBench,一个用于多维度评估LLMs对韩语新词理解能力的基准。它建立于通过专业词典编纂审查收集和标注的韩语新词列表之上,包含四项任务:(1)完形填空任务,测试新词语境下的理解;(2)与母语者解释一致的源词识别;(3)语义和专业领域分类;(4)词典式释义生成。使用KoNeoBench,我们评估了多个LLMs,并从多角度分析了它们在处理韩语新词方面的优势和局限。  

本文主要贡献如下:  
- • 我们提出了KoNeoBench,一个由词典编纂专家整理和标注的韩语新词数据集。  
- • KoNeoBench是首个为多维度评估LLMs对韩语新词理解能力提供精心设计测试集的基准。  
- • 利用这些韩语特定测试集,我们评估了一系列LLMs,并分析了处理韩语新词时的主要挑战和错误模式。  

## 2 相关工作  
##### LLM中的时间漂移与鲁棒性  
关于LLM在时间变化下的鲁棒性研究主要考察了在训练后数据上的性能下降(Lazaridou等,2021;Luu等,2022)以及在时间敏感下游任务(如问答)上的表现(Chen等,2021;Liska等,2022;Dhingra等,2022;Agarwal和Nenkova,2022)。其他研究表明,新出现的实体以及词义或词频的变化同样会影响模型性能(Rijhwani和Preotiuc-Pietro,2020;Onoe等,2022;Pramanick等,2022)。这些发现共同推动了将新词作为词汇层面时间语言变化表现的研究。  

##### LLM中的新词研究  
传统上,新词研究侧重于收集和分类新词、分析其构词和涌现过程,并追踪其在网络社群中的传播(Pinter等,2020;Ryskina等,2020;Zhu和Jurgens,2021)。近期,研究开始评估LLMs对快速变化的表达(如新词、俚语和梗图)的理解程度(Zheng等,2024;Sun等,2024;Mei等,2024)。与传统对词汇表外(OOV)项目的研究不同,这一研究路线强调新颖的形式和意义、构词模式以及社群化的使用(Garneau等,2018;Nayak等,2020;Araabi等,2022)。早期的计算研究例如探索了从英语词汇混成中恢复源词以及整合关于新词形成的语言知识(Cook和Stevenson,2010;Cook,2010),而近期工作已扩展到词汇熟练度、科学新词翻译、俚语词义交替以及特定文化或地区的俚语(Ciaccio等,2025;Lerner和Yvon,2025;Aloraini等,2026;Wu和Sun,2025;Wuraola等,2026)。在这些研究中,NEO-BENCH(Zheng等,2024)与我们的工作最为相关。它通过机器翻译、完形填空问答、释义生成和困惑度来评估近期英语新词,强调模型对词汇时间漂移的鲁棒性。KoNeoBench通过聚焦韩语词汇变化并评估新词知识的多个方面(包括新词识别、源构成成分恢复、语义和专业领域分类以及释义生成)补充了这一视角。特别是,其经过专家整理的词汇标注使我们能够评估模型不仅是否能在语境中识别或解释近期表达,是否还能捕捉表征韩语新词的构词和语义属性。  

##### 韩语NLP基准与新词  
韩语NLP领域也发展了各种评估资源。KLUE、KoBEST、HAE-RAE Bench和Ko-H5等基准为评估理解、推理、知识、文化背景和LLM性能提供了重要基础(Park等,2021;Jang等,2022;Son等,2024;Park等,2024)。然而,它们主要针对通用语言理解或相对静态的语言知识。与此同时,关于韩语新词的语言学研究不仅考察数据收集,还研究构词模式、使用语境和词汇化过程(Moon,1999;Lee和Kim,2014;Nam,2015;Lee,2006;Lee,2024)。基于这两条研究路线,KoNeoBench提供了一个基于语言学理论的基准,用于评估LLMs在形态、语义和语境维度上对近期韩语词汇变化的理解程度。  

## 3 KoNeoBench:韩语新词基准数据集  
### 3.1 数据收集  
自1994年以来,韩语新词数据一直在国语院的监督下每年编制。我们使用了自2020年以来按相同方法制作的年度出版物中列出的1,785个新词。源语料库由韩国主要综合和商业报纸的文章组成。候选新词首先被自动提取为词汇表外项目,然后由词典编纂专家筛选和补充。每年的最终列表通过在Naver News中验证首次出现日期来确定,Naver News包含约130家媒体的文章数据。图2(a)展示了整体收集流程,附录A.1提供了更多细节。  

在自动候选收集阶段,主要通过将语料库项目与《标准国语大词典》(韩国最大的规范词典)的词头表进行比较来识别候选词,然后去除屈折形式和复数形式。由于韩语是黏着语,此过程不可避免地产生噪音,并可能遗漏真正的新词,因此专家审查至关重要。在验证阶段,候选词首先使用基于规则的标准进行过滤,然后由专家审核。候选词若满足以下条件则被接受为新词:(1)为指称新出现的对象或现象而创造;(2)尽管存在传统表达,但表达了新的细微含义;(3)作为具有统一词汇意义的短语单位发挥作用。专有名词、特定团体表达、临时造词以及尚未在韩语词汇体系中确立的外来词均被排除。实际上,五年间自动提取的词汇表外列表包含1,627,371个候选词,但大多数是机械识别的错误,如不完整的片段、失败的形态分析或拼写错误。经过自动过滤和专家审查后,仅保留了1,269个项目作为新词,这说明了获得最终集合所需的大幅缩减。此外,为发现自动提取无法捕获的新词,我们进行了专家手动补充阶段,利用语料库中的语用标记,由此获得了516个额外新词。语用标记是文本中指示新词存在的语境线索,例如韩语表达“xx-라는 신어”(“一个叫做xx的新词”),这些被认为是评估新词新颖性和确立程度的重要指标(Klosa-Kückelhaus和Wolfer,2020;Lee,2024)。  

### 3.2 数据描述与统计  
如图2所示,KoNeoBench不仅包含新词列表,还包括其相关属性:词典式定义和使用示例、调查年份、源形式、构词类型等。

相似文章

通过令牌剪枝优化韩语中心的大语言模型

arXiv cs.CL

本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。

VLegal-Bench: 越南法律推理认知基础基准测试

arXiv cs.CL

VLegal-Bench 是一个认知基础基准测试,用于评估大语言模型在越南法律推理任务中的表现,包含 10,450 个专家标注样本,旨在填补民法系统法律基准的空白。该基准通过问答、多步推理和场景问题解决来评估多个层次的法律理解,为在非英文、成文法律背景下评估大语言模型提供了一个可复现的框架。