YOMI-Bench:评估日语中汉字读音和语音理解的LLM基准测试

arXiv cs.CL 论文

摘要

YOMI-Bench 是一个旨在评估大语言模型在日语汉字读音和语音理解方面的基准测试。它包含四项任务,并揭示即使是专门针对日语的模型在需要汉字读音知识的生成任务上也表现不佳。

arXiv:2607.00664v1 公告类型:新 摘要:我们提出了YOMI-Bench,这是一个用于评估大语言模型(LLM)在日语中汉字读音和语音理解的基准测试。在日语中,单个汉字字符通常有多个可能的读音,这使得仅从表面文本推断正确读音变得困难。由于这些语言特性,根据经验已知,LLM在日语汉字读音方面表现较低。提出的YOMI-Bench包含四项专门设计用于评估日语汉字读音表现的任务。在使用YOMI-Bench的评估中,我们评估了一个多语言开放LLM、四个日语专用开放LLM和五个商业LLM。结果发现,即使是日语专用模型也表现出较低的性能,而商业模型在需要考虑汉字读音的生成任务上也表现不佳。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:38

# 用于评估日语LLM汉字阅读和音韵理解能力的基准
来源:https://arxiv.org/html/2607.00664
Ryota Mibayashi¹, Hiroya Takamura², Hitomi Yanaka³,⁴,⁵  
¹神户大学  
²产业技术综合研究所 (AIST)  
³东京大学  
⁴理化学研究所  
⁵东北大学  

###### 摘要

我们提出YOMI-Bench,一个用于评估大型语言模型(LLM)在日语中汉字阅读和音韵理解能力的基准。在日语中,单个汉字字符常有多重读音,仅凭表层文本难以推断正确读音。由于这些语言特性,经验表明LLM在日语汉字阅读方面表现较低。所提出的YOMI-Bench包含四个专门设计来评估日语汉字阅读表现的任务。在使用YOMI-Bench进行的评估中,我们测试了一个多语言开放LLM、四个日语专用开放LLM以及五个商业LLM。结果发现,即使是日语专用模型也表现较低,商业模型在需要考量汉字读音的生成任务上同样表现不佳。

\\CJKencfamily

UTF8mc\\CJK@envStartUTF8

YOMI-Bench: 用于评估日语LLM汉字阅读和音韵理解能力的基准

## 1 引言

大型语言模型(LLM)的多语言能力已从多种角度得到分析[zhu2024multilinguallargelanguagemodels]。在其中,我们聚焦于LLM识别并利用文本音韵读音的能力,这涉及如字素到音素(G2P)估计和音素感知文本生成等任务。不同语言中书写形式与其发音之间的关系差异很大,即使在共享相同书写系统的语言之间,也存在显著差异。例如,虽然中文和日语共享许多汉字字符,但除约10%的情况外[Matsuo2010Neural],中文中的几乎所有汉字字符对应单一发音。相比之下,约60%的日语汉字字符具有多重可能读音(详见第3.1节 (https://arxiv.org/html/2607.00664#S3.SS1)),需要更复杂的语言信息才能正确解读。例如,汉字字符“覚”有三种可能读音:“kaku”、“obo”和“sa”。这些读音根据字符出现的词语而变化,如“覚醒 (kakusei/觉醒)”、“覚える (oboeru/记忆)”和“覚める (sameru/醒来)”。因此,为了正确预测出现在单个词语中的汉字字符读音,模型不仅需要掌握每个汉字字符的多重读音知识,还需基于词语预测正确读音。在实际场景中,正确理解汉字读音的能力对于LLM解决需要考虑押韵的分类和生成任务至关重要,如校对和生成歌词[potash2015ghostwriter; nikolov2020conditional]、说唱韵文[xue2021deeprapper; mibayashi2023rapbattle]以及广告文案[Lei2022plato]。

参见图注 图1:YOMI-Bench 概述。然而,考虑此类日语语言特性的LLM阅读能力仍基本未被探索。因此,如图1 (https://arxiv.org/html/2607.00664#S1.F1) 所示,我们构建了YOMI-Bench,一个用于评估LLM日语阅读表现的基准。YOMI-Bench是一个多任务评估集,包含七种类型的二值/多项问答和文本生成任务。例如,问题“生成词语‘覚醒’的读音”要求LLM作为文本生成任务回答正确汉字读音,其中标准答案为“kakusei”。我们还使用YOMI-Bench评估代表性LLM的阅读能力。

本研究的贡献包括:

- •我们构建了一个包含七项任务的挑战性基准,要求正确理解日语音韵读音,并将其作为公开可用的语言资源在GitHub¹¹¹https://github.com/benchmark-release/YOMI-Bench 上发布。
- •使用该基准,我们评估了一个多语言LLM、四个日语专用LLM以及五个商业模型,为汉字阅读表现提供了基线。

## 2 相关工作

#### 字素到音素(G2P)基准

字素到音素(G2P)是一项从给定文本估计音素序列的任务。其主要应用包括语音合成和语音识别。代表性的G2P评估基准包括基于以英语为中心的CMU发音词典²²²http://www.speech.cs.cmu.edu/cgi-bin/cmudict 的基准,以及通过共享任务(如SIGMORPHON [cotterell2018conll])发布的多语言评估数据集。这些基准已被广泛用于评估G2P系统,特别是对于采用字母书写系统的语言。

然而,现有基准主要针对字母书写系统的语言(如英语),且通常假设书写形式与声音之间的对应关系相对规律。因此,直接将这些评估设置应用于日语和中文等语言并不简单,因为在这些语言中,字符与发音之间的对应关系往往模糊且依赖上下文。此外,大多数现有G2P基准是为语音处理模型设计的,并非旨在直接评估基于文本的模型(如LLM)的阅读能力。为解决这一局限,我们构建了一个用于评估LLM日语阅读能力的基准。

#### 日语中的LLM基准

迄今为止,已有多个针对日语的LLM评估基准发布[saito2025buildlocallargelanguage]。这些基准主要关注问答(QA)任务,评估从维基百科到更专业领域内容的回答。一个代表性例子是JMMLU[yin-etal-2024-respect],它基于MMLU,由翻译和改编以反映日本文化背景的数据集组成。

与评估通用日语理解的基准相反,与阅读相关的基准也已被提出。假名到汉字转换基准AJIMEE-Bench³³³https://github.com/azooKey/AJIMEE-Bench 尚未作为学术论文发表,但它提出了基于音韵读音将假名字符转换为汉字的任务,从而涉及阅读相关的处理。然而,这些数据集均未明确评估阅读能力。但在非罗马字母语言中,发音常因上下文而变化,使得阅读成为语言理解的一个重要方面。因此,我们构建了一个数据集来评估日语阅读能力。

表1:YOMI-Bench 数据集统计信息。

## 3 YOMI-Bench

YOMI-Bench 主要包含两类任务:评估汉字阅读知识的任务和需要音韵理解的任务。

### 3.1 汉字数据收集

基准中针对的汉字字符基于日本文化厅发布的常用汉字表(Jōyō Kanji List)选择,该表包含2,136个官方指定的汉字字符。⁴⁴⁴https://www.bunka.go.jp/kokugo_nihongo/sisaku/joho/joho/kijun/naikaku/kanji/joyokanjisakuin/index.html 常用汉字表总共包含2,136个汉字字符,其中803个具有单一读音,1,333个具有两种或更多可能读音。从该列表中,我们随机抽取100个具有单一读音的汉字字符和100个具有多重读音的汉字字符。

### 3.2 多提示评估

为减轻依赖单一提示可能产生的偏差[wang2024llmsperformmcqaselecting; chujie2024multiplechoice],我们采用多提示评估策略。对于每项任务,我们设计一个基础提示,并使用ChatGPT生成四个保留原始语义意图的改写变体。评估期间,模型使用五个提示进行测试,最终得分计算为其结果的平均值。

### 3.3 YOMI-Bench 任务

#### 汉字阅读二值问答任务

在该任务中,模型通过回答“是”或“否”来判断给定读音是否为汉字的正确发音。例如,模型被问到诸如:“‘kaku’是词语‘覚醒’中汉字‘覚’的正确读音吗?”的问题,必须回答“是”或“否”。此任务评估LLM是否具备汉字读音知识。

在此任务中,基于汉字数据集构建“是/否”式提示。负例通过从汉字数据集中选择与目标汉字具有相同读音数量的读音并分配为错误读音来生成。此外,每个提示使用4-shot设置进行评估,其中提供两个正例和两个负例。正例和负例通过从测试数据集中每类各抽取四个实例构建。

#### 汉字阅读预测任务

汉字阅读预测任务要求模型输出由汉字字符组成的给定日语词语的正确读音。例如,对于输入“请提供词语‘覚醒’的读音”,期望输出为“kakusei”。

在此任务中,使用正则表达式从LLM输出中提取预测读音。如果提取的读音与标准读音完全匹配,则分配1分,否则0分;准确率计算为平均分。对于具有多重读音的汉字,来自同一汉字的问题被视为一个组,最终得分通过对组级准确率取平均来计算。

#### 押韵选择任务

押韵选择任务要求选择一个与给定输入词共享相同元音序列(即形成押韵)的词语。例如,对于提示:“请从以下选项中选择恰好一个与‘覚醒 (kakusei*)’具有相同元音序列的字符串。(A)论文,(B)学生,(C)委员,(D)博士”,正确答案是“(B)学生 (gakusei*)”。⁵⁵⁵各选项的读音分别为:(A)论文 (ronbun* / 论文),(B)学生 (gakusei* / 学生),(C)委員会 (iinkai* / 委员会),(D)博士 (hakase* / 博士)。

由于押韵选择任务被表述为多项选择题,我们从LLM输出中提取从A到D的选项之一。如果提取的选项与正确答案匹配,则分配1分,否则分配0分。最终准确率通过除以评估实例总数计算。目标词仅限于包含单一可能读音汉字字符的词,我们构建包含一个正例和三个负例的配对数据。

#### 押韵生成任务

押韵生成任务要求模型生成一个与给定的平假名输入词共享相同元音序列的平假名词语。例如,对于提示“请提供一个与‘かくせい (kakusei)’元音序列完全一致的词”,期望输出为“はつめい (hatsumei)”。

在押韵生成任务中,通过比较元音序列来评估生成的押韵。使用正则表达式从模型输出中提取押韵,并使用mibayashi2025rhyme提出的转换表将其转换为元音序列。如果结果序列与标准元音序列完全匹配,则分配1分,否则0分;准确率计算为平均分。

表2:YOMI-Bench上的平均定量评估结果。

## 4 基线实验

### 4.1 概述

为展示YOMI-Bench作为基准的难度和有效性,我们进行基线评估。本研究中,我们使用总共十个模型进行评估:一个支持日语的多语言开放LLM、四个日语专用开放LLM以及五个商业模型。评估中使用的具体模型如下:Ministral-8B-Instruct-2410、Llama-3.1-Swallow-8B-Instruct-v0.5⁶⁶⁶https://huggingface.co/tokyotech-llm/Llama-3.1-Swallow-8B-Instruct-v0.5、Llama-3-ELYZA-JP-8B⁷⁷⁷https://huggingface.co/elyza/Llama-3-ELYZA-JP-8B、llm-jp-3-7.2b-instruct3⁸⁸⁸https://huggingface.co/llm-jp/llm-jp-3-7.2b-instruct3 以及 llm-jp-3-13b-instruct3⁹⁹⁹https://huggingface.co/llm-jp/llm-jp-3-13b-instruct3。Ministral-8B-Instruct-2410 是一个多语言模型,其余四个模型专用于日语。我们评估中使用的五个商业模型如下:claude-sonnet-4-5-20250929、mistral-medium-2508、gemini-2.5-flash、gpt-4o 和 gpt-5。

我们基准中每项任务的评估结果如表2 (https://arxiv.org/html/2607.00664#S3.T2) 所示。总体而言,在所有任务中,商业模型表现出比日语专用开放模型更高的阅读性能,尽管它们并非明确专用于日语。

### 4.2 各项任务讨论

#### 汉字阅读二值问答任务

如表2 (https://arxiv.org/html/2607.00664#S3.T2) 所示,除 llm-jp-3-13b 外,所有日语专用模型的表现均约为0.7。大多数模型在多重条件设置下比单个条件设置下表现更差。这表明,虽然模型在一定程度上记忆了汉字字符的单个读音,但它们难以根据上下文预测正确读音。此外,多语言模型也未达到高性能。由于其在性能上与日语专用模型相当,这一结果表明,仅使用日语专用语料库进行训练不一定能带来汉字阅读任务表现的提升。

#### 汉字阅读预测任务

对于具有单一读音的汉字字符,日语专用LLM和商业LLM均显示出高准确率(超过0.79)。这些结果证实,LLM通常能够为具有单一读音的汉字字符生成正确读音。相比之下,包含日语的多语言LLM表现出相对较低的准确率(0.4679)。这些结果表明,日语训练数据量的差异可能影响汉字阅读表现。此外,在 llm-jp 系列(由共享相同架构但参数大小不同的模型组成)中,13B模型优于7.2B模型,表明增加参数数量可能带来模型性能的提升。

#### 押韵选择任务

在此任务中,日语专用模型总体表现较低。值得注意的是,即使是像 llm-jp-13b 和 Llama-3.1-Swallow-8B 这样在汉字阅读任务中取得高表现的模型,在押韵选择上也表现出低准确率。这种模式在商业模型如 mistral 和 gpt-4o 中也可见。尽管这些模型似乎知道正确的汉字读音,但它们在汉字和平假名设置下均表现不佳,表明读音知识不一定与其使用相关联。

#### 押韵生成任务

最后,在押韵生成任务中,总体表现较低,特别是日语专用开放模型几乎无法生成押韵。日语专用开放模型输出的例子包括:对于输入“かし (kasi)”生成“やく (yaku)”,或对于输入“けん (ken)”生成“せっけん (sekken)”,这表明这些模型未能生成元音序列匹配的输出。即使是商业模型有时也会生成不自然的词语。例如,对于输入“せつな (setsun

相似文章

JOR-Bench:面向大型语言模型的日语运筹学基准测试

arXiv cs.CL

JOR-Bench 是一个包含五个日语基准测试的集合,用于评估大型语言模型在运筹学问题建模方面的能力,这些基准测试从现有的英语基准翻译而来。评估结果显示整体性能与语言无关,仅有轻微的跨语言差异。