评估大型语言模型中的中文歧义理解能力
摘要
本文介绍了基于潜在歧义理论的汉语歧义数据集CHA-Gen,并评估了多个LLM在歧义检测任务上的表现。研究发现,模型虽然面临挑战,但通过思维链提示有所改进,而指令调优则导致过度自信。
arXiv:2605.15635v1 Announce Type: new
摘要:语言歧义对大型语言模型(LLM)的鲁棒性至关重要,但现有研究主要集中在英语上,对中文的关注有限。现有的中文歧义数据集(如CHAmbi)可扩展性较差。在潜在歧义(PA)理论的指导下,我们设计了一个半自动流水线来构建CHA-Gen。这是第一个基于PA理论的中文歧义数据集,包含5,712个句子(2,414个歧义句,3,298个无歧义句),涵盖18种潜在歧义结构。通过直接查询和机器翻译评估多个LLM(例如Gemma 3、Qwen 2.5/3系列),我们发现LLM在歧义检测上表现不佳(通过思维链提示有所改进)。对Qwen3-32B的思维链推理过程进行分析,揭示了三种常见的失败模式:歧义盲视、归因错误和过早消歧。使用语义熵指标进行不确定性量化显示,歧义句子的不确定性更高。此外,指令调优导致过度自信,而基础模型能更好地捕捉语义多样性。我们还观察到模型存在偏向主导解释的倾向。我们的工作为中文歧义语料库提供了一种可扩展的方法,并深入分析了LLM处理歧义的能力,为提升LLM中的中文歧义研究奠定了基础。
查看缓存全文
缓存时间: 2026/05/18 06:33
# 评估大语言模型的中文歧义理解能力 来源: https://arxiv.org/html/2605.15635 utokyo\]organization=东京大学信息科学与技术研究生院, city=东京, country=日本 scut\]organization=华南理工大学软件学院, addressline=广州市番禺区广州大学城, city=广州, postcode=510006, state=广东, country=中国 \\credit 概念化, 方法论, 软件, 数据整理, 形式分析, 撰写初稿, 可视化, 验证 \\credit 方法论, 软件, 数据整理, 形式分析, 撰写初稿, 可视化, 验证 \\credit 方法论, 软件, 数据整理, 形式分析, 撰写初稿, 可视化, 验证 \[orcid=0000-0002-2265-756X\]\\credit概念化, 方法论, 形式分析, 数据整理, 监督, 撰写审阅与编辑, 项目管理, 资金获取, 资源 \\cormark \[2\]\\cortext\[2\]通讯作者。电子邮箱: [email protected] \\credit 监督, 资金获取, 撰写审阅与编辑, 资源 Yuanzhi [email protected] Yifang [email protected] Ke Xu Hideki [email protected] ###### 摘要 语言歧义对于大语言模型(LLMs)的鲁棒性至关重要,但现有研究主要聚焦于英语,对中文的关注有限。现有中文歧义数据集(如CHAmbi)存在可扩展性差的问题。在潜在歧义(PA)理论的指导下,我们设计了一个半自动流水线来构建CHA-Gen。这是首个基于PA理论的中文歧义数据集,包含5,712个句子(2,414个歧义句,3,298个非歧义句),涵盖18种潜在歧义结构。通过直接查询和机器翻译评估LLMs(如Gemma 3, Qwen 2.5/3系列),我们发现LLMs在歧义检测方面存在困难(通过思维链提示可改善)。对Qwen3-32B思维链推理过程的分析揭示了三种常见失败模式:歧义盲视、归因错误和过早消歧。基于语义熵的不确定性量化指标显示,歧义句的不确定性更高。此外,指令微调会导致过度自信,而基座模型能更好地捕捉语义多样性。我们进一步观察到模型存在偏向主导释义的倾向。我们的工作为中文歧义语料库提供了一种可扩展的方法,并深入了解了LLMs处理歧义的方式,为加强LLMs中的中文歧义研究奠定了基础。 ###### 关键词: 语言歧义\sep大语言模型\sep机器翻译\sep不确定性量化 ## 1 引言 语言歧义是所有人类语言中普遍存在的现象(Piantadosi et al.,2012 (https://arxiv.org/html/2605.15635#bib.bib21)),指的是某些句子存在多种合理解释。识别和解读此类歧义非常重要,因为它有助于我们在日常交流中避免误解和混淆。近年来,大语言模型(LLMs)发展迅速,并广泛应用于智能助手(Brown et al.,2020 (https://arxiv.org/html/2605.15635#bib.bib3); Liu et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib14); Guo et al.,2025 (https://arxiv.org/html/2605.15635#bib.bib7); Team et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib23))。为了提高这些助手的鲁棒性和可信度,检测歧义句的能力对于防止因误解造成的损失至关重要(Bajceta et al.,2022 (https://arxiv.org/html/2605.15635#bib.bib1); Min et al.,2020 (https://arxiv.org/html/2605.15635#bib.bib19); Bhaskar et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib2); Wang et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib24))。虽然现有的大多数语言歧义研究都集中在英语上(Ortega-Martín et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib20); Liu et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib15); Mehrabi et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib17); Kim et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib10)),但对中文的关注相对较少。由于其独特的语法特征,中文通常被认为比英语更依赖语境(Li,2021 (https://arxiv.org/html/2605.15635#bib.bib12))。因此,在缺乏足够语境线索的情况下,中文句子或短语更容易产生多种合理解释。一项相关工作是CHAmbi(Zhang et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib28)),它提出了一个包含中文歧义句的自然语言推理(NLI)数据集。然而,该数据集中的大多数句子是从互联网收集的,导致其不可扩展。因此,探索系统生成或扩展歧义句语料库的方法对于后续研究至关重要,这也是本工作的核心焦点。 潜在歧义理论(PA Theory)(Feng,1989 (https://arxiv.org/html/2605.15635#bib.bib5),1995 (https://arxiv.org/html/2605.15635#bib.bib6))认为,某些被称为*潜在歧义结构*的抽象句法配置,在满足特定条件时,可能在实际使用中产生歧义。例如(见图1 (https://arxiv.org/html/2605.15635#S1.F1)),在英语中,结构V + NP + PP很可能导致歧义,当动词后的PP既可以解释为修饰NP,也可以解释为动词的附加语时。具体来说,短语“saw the child with a telescope”在两种解读之间存在歧义:一种解读是PP修饰NP(那个有望远镜的孩子),另一种解读是PP作为动词的工具性修饰语(用望远镜看孩子)。相比之下,“saw the child with a bag”是非歧义的,因为它无法触发工具性解读。在中文中,Feng (1995 (https://arxiv.org/html/2605.15635#bib.bib6))总结了18种潜在歧义结构及其相应的歧义触发条件。 参考图注 图1: PA理论中潜在歧义结构的一个例子。 在PA理论的指导下,我们设计了一个半自动流水线。该流水线收集潜在歧义结构及其歧义触发条件,然后通过LLMs生成并验证实例,最后进行人工验证。结果是高质量数据集CHA-Gen,共包含5,712个句子。其中2,414个是歧义句,3,298个是非歧义句。这些实例涵盖18种不同的歧义结构。 本工作的另一个重点是系统评估LLMs的中文歧义处理能力。基于提出的CHA-Gen语料库和现有的CHAmbi数据集,我们设计并使用定制的评估方法进行评估:直接查询和机器翻译。评估的模型包括多种通用大语言模型,如Gemma 3、Qwen 2.5和Qwen 3,涵盖不同模型规模。 本工作的主要贡献总结如下: 1. 1.我们开发了一个半自动流水线,用于构建大规模中文结构歧义语料库CHA-Gen11https://github.com/SpaJune/CHA-Gen。据我们所知,CHA-Gen是首个基于PA理论的中文歧义数据集。它丰富了可用于中文语言歧义研究的现有资源。 2. 2.我们进行了歧义识别和比较任务,以评估LLMs的歧义检测和区分能力。正如先前工作所示(Liu et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib15); Zhang et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib28)),LLMs在这些任务中仍然面临挑战,而思维链(CoT)提示在大多数情况下可以显著提升性能。我们分析了它们生成的推理过程,并为未来的研究提供了见解。 3. 3.我们使用语义熵作为不确定性量化指标,研究了LLMs在汉英翻译中的不确定性。结果表明,LLMs对歧义句的生成不确定性高于非歧义句。此外,基座模型在某些歧义情况下能捕捉语义多样性,而指令微调降低了不确定性并导致过度自信的预测。进一步的案例研究调查了模型如何偏向主导释义。这些发现凸显了指令微调的潜在局限性,并引发了对跨语言交流中误解的担忧。 本文的其余部分组织如下。我们在第2节 (https://arxiv.org/html/2605.15635#S2)回顾相关工作,并在第3节 (https://arxiv.org/html/2605.15635#S3)介绍CHA-Gen语料库。通过直接查询和机器翻译进行评估的详细信息分别在第4节 (https://arxiv.org/html/2605.15635#S4)和第5节 (https://arxiv.org/html/2605.15635#S5)中介绍。第6节 (https://arxiv.org/html/2605.15635#S6)总结全文。 ## 2 相关工作 研究人员致力于构建相关的数据集和基准,并研究LLMs在面对歧义输入时的行为。我们回顾了这些主题的相关工作。 **歧义的数据集和基准。** 先前的研究已经发布了关注视觉歧义(Rostamkhani et al.,2025 (https://arxiv.org/html/2605.15635#bib.bib22); Chen et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib4))和基于视觉的上下文歧义(Ma et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib16); Wang et al.,2025 (https://arxiv.org/html/2605.15635#bib.bib25))的数据集和基准。Wildenburg et al. (2024 (https://arxiv.org/html/2605.15635#bib.bib26))引入了DUST数据集,包含未完全指定的句子,并进行了实验以评估LLMs是否能基于困惑度检测句法歧义。然而,尽管英语和多模态领域的消歧取得了显著进展,中文的可用资源仍然相对有限。在中文语境下,He et al. (2020 (https://arxiv.org/html/2605.15635#bib.bib8))提出了一个包含词汇和句法歧义的数据集,用于评估LLMs的常识推理能力。最近,Zhang et al. (2024 (https://arxiv.org/html/2605.15635#bib.bib28))构建了CHAmbi,这是一个专门用于歧义检测和消歧的细粒度中文基准。然而,CHAmbi中的句子主要从互联网收集,这限制了其可扩展性和实际应用。与CHAmbi不同,我们开发了一种基于潜在歧义结构构建歧义中文句子/短语的新流程。这种方式在保持语言质量的同时,增强了语料库构建的可扩展性。 **检验LLMs处理歧义的行为。** LLMs的歧义处理能力主要通过直接查询和基于行为的分析进行评估。直接查询的思路很直接:LLM模型被明确提示判断给定句子是否有歧义(Zhang et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib28); Ortega-Martín et al.,2023 (https://arxiv.org/html/2605.15635#bib.bib20))。特别是,Wu et al. (2025 (https://arxiv.org/html/2605.15635#bib.bib27))对不同提示策略进行了全面研究。直接查询研究的另一条线索采用比较方法(Wildenburg et al.,2024 (https://arxiv.org/html/2605.15635#bib.bib26)),其中模型被提供歧义句和非歧义句对,以识别更不明确的句子。为了全面理解LLMs理解歧义的能力,检查它们在不同下游任务中如何处理歧义句也很重要。Liu et al. (2023 (https://arxiv.org/html/2605.15635#bib.bib15)); Zhang et al. (2024 (https://arxiv.org/html/2605.15635#bib.bib28))采用多标签NLI任务,以观察LLMs是否能意识到歧义输入的不确定性。此外,Liu et al. (2023 (https://arxiv.org/html/2605.15635#bib.bib15))通过比较以歧义句及其消歧结果为条件的延续分布,评估语言模型中的歧义意识。使用采样的文本延续,他们评估来自有效解释的延续在歧义上下文中是否比来自干扰项上下文的延续更不令人惊讶。然而,这些实验需要预定义多个合理消歧结果的枚举。Mehrparvar and Pezzelle (2024 (https://arxiv.org/html/2605.15635#bib.bib18))采用机器翻译通过测量回译与原始句子在表示空间中的差异来检测句子歧义。其直觉是,歧义句有多种解释,因此会导致不同语义的多种合理翻译。受此启发,我们探索LLMs在歧义句和非歧义句之间的翻译不确定性行为。这使我们能够研究与歧义相关的不确定性,而无需显式枚举替代假设,同时揭示当歧义未完全指定时LLMs偏向哪种阅读。 总之,为了进行更全面的评估,我们同时采用了直接查询(包括比较方法)和基于行为分析(机器翻译)的方法。值得注意的是,本工作中机器翻译用于探究LLMs的不确定性行为,而非检测歧义句。我们也相信,与直接查询相比,翻译任务有助于更深入地理解LLMs对歧义输入的隐含解释。 ## 3 CHA-Gen 语料库 为了系统研究LLMs在中文歧义识别和理解方面的能力,构建一个大规模、分类良好且标注精细的语料库至关重要。然而,现有资源在这方面仍然不足。为了填补这一空白,本文提出了中文歧义生成(CHA-Gen)语料库。以下子节详细阐述其构建过程和语料库组成。 参考图注 图2: CHA-Gen语料库构建流水线 ### 3.1 语料库构建 我们设计了一个半自动流水线来构建专门的中文歧义语料库。该过程涉及三个关键阶段:初步生成、自动验证和人工标注,如图2 (https://arxiv.org/html/2605.15635#S3.F2)所示。 表1: CHA-Gen中歧义/非歧义句子的数量。缩写:VP (动词短语), NP (名词短语), V (动词), N (名词), ADJ (形容词), Q (量词) 和 PREP (介词)。 编号 | 潜在歧义结构 | 歧义 | 非歧义 --- | --- | --- | --- 1 | VP+的是+NP | 356 | 234 2 | Q+NP1+的+NP2 | 243 | 362 3 | N1+N2+N3 | 220 | 545 4 | ADJ+N1+N2 | 72 | 50 5 | V1+V2+NP | 155 | 132 6 | N+V | 49 | 40 7 | N1+的+N2+和+N3 | 47 | 103 8 | N+V+NP+AP | 163 | 254 9 | 全部+VP+的+NP | 30 | 713 10 | N1+N2 | 25 | 22 11 | VP+ADJ+的+N | 61 | 67 12 | N1+和+N2+的+N | 36 | 910 13 | VP+Q+NP | 33 | 653 14 | V+ADJ+N | 50 | 137 15 | VP1+VP2+的+N | 158 | 163 16 | V+N | 29 | 21 17 | VP+N1+的+N2 | 114 | 113 18 | PREP+N1+的+N2 | 263 | 170 总计 | | 2,414 | 3,298 **初步生成。** 这一阶段旨在建立歧义结构的类型学,并生成初始的、可扩展的语料库。遵循PA理论,我们首先识别出18种潜在歧义结构。对于每种结构,手动构建一小部分歧义句子...
相似文章
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。
ChLogic: 评估中文表达中逻辑推理的鲁棒性
介绍ChLogic,这是一个英汉对齐的基准测试,用于检验大型语言模型在不同语言间是否保持逻辑推理性能,揭示了持续存在的差距,这些差距受到表面实现和翻译痕迹的影响。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
使用探针目标归因定位大型语言模型中的提示模糊性
介绍了PRIG,一种梯度归因方法,通过训练线性探针区分清晰提示和模糊提示,并将探针得分归因于残差流中的标记表示,从而定位大型语言模型中的提示模糊性,在合成和人工编写的基准测试上取得了强劲性能。