低资源语言农业文档中有效文本嵌入的分块策略评估

arXiv cs.CL 论文

摘要

本文评估了四种用于高棉语农业文档检索增强生成(RAG)的文本分块策略,发现基于字符的递归分块(300字符)在检索和相关性方面表现最佳。

arXiv:2605.22203v1 公告类型: new 摘要:在本研究中,我们比较了四种文本分块方法:递归、高棉语感知、基于句子和基于LLM,并将其应用于高棉语农业文档的检索增强生成(RAG)框架。文档块使用BGE-M3多语言嵌入模型编码,并使用FAISS库进行检索。性能通过四个指标评估:平均检索分数(L2距离)、答案相关性、高棉语覆盖率和高棉语交集比,均与真实问答对进行比较。评估中,我们在18个问答对上进行了5折交叉验证。我们发现基于字符的递归分块方法(块大小300字符)表现最佳,达到了最低的L2距离(0.4295 ± 0.0461)、最高的答案相关性(0.8663 ± 0.0199)和最高的高棉语IoU(0.6441 ± 0.0347)。配对t检验显示,与基于句子的分块方法相比,L2距离有统计显著改善(p = 0.0121)。这些结果凸显了在形态复杂、低资源语言(如高棉语)中,分割粒度和结构保留对于优化密集检索的重要性。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:45

# 面向低资源语言农业文档的文本分块策略评估:实现高效文本嵌入

来源:https://arxiv.org/html/2605.22203

Pichdara Po  
忠北国立大学计算机科学系,韩国清州市  
Sereiwathna Ros  
忠北国立大学计算机科学系,韩国清州市  
Wan-Sup Cho  
BigDataLabs 有限公司 · 忠北国立大学管理信息系统系,韩国  
Saksonita Khoeurn  
BigDataLabs 有限公司 · 忠北国立大学管理信息系统系,韩国  

###### 摘要

在本研究中,我们在应用于高棉语农业文档的检索增强生成(RAG)框架内,比较了四种文本分块方法——递归分块、高棉语感知分块、基于句子的分块和基于大语言模型的分块——的性能。文档分块使用 BGE-M3 多语言嵌入模型进行编码,并使用 FAISS 库进行检索。性能通过四个指标进行评估:平均检索得分(L2 距离)、答案相关性、高棉语覆盖率和高棉语交并比,所有指标都针对真实问答对进行测量。在评估中,我们对 18 个问答对进行了 5 折交叉验证。我们观察到,基于字符的递归分块方法在块大小为 300 个字符时表现最佳,实现了最低的 L2 距离(0.4295 ± 0.0461)、最高的答案相关性(0.8663 ± 0.0199)和最高的高棉语 IoU(0.6441 ± 0.0347)。配对 t 检验显示,与基于句子的分块方法相比,在 L2 距离上具有统计学上的显著改善(p = 0.0121)。这些结果突显了在形态复杂、低资源的语言(如高棉语)中,分割粒度和结构保留对于优化密集检索的重要性。

## 1 引言

基于嵌入的自然语言处理的最新突破彻底改变了处理文本数据的方式,包括现代智能系统中的索引、检索和语义分析[11 (https://arxiv.org/html/2605.22203#bib.bib1)]。通过深度神经嵌入架构学习到的密集向量表示,能够实现超越简单词级匹配的语义相似性搜索、文档检索和问答[4 (https://arxiv.org/html/2605.22203#bib.bib9)]。标准流程包括文档预处理、分块、嵌入生成以及使用近似最近邻搜索库(如 FAISS [8 (https://arxiv.org/html/2605.22203#bib.bib16)])进行基于向量的索引。尽管大量研究改进了嵌入架构和检索范式,但在改进文档分块步骤方面的研究相对较少,而该步骤对于在嵌入之前将长文档划分为语义连贯的块至关重要[14 (https://arxiv.org/html/2605.22203#bib.bib6)]。

分块可以说是文档准备中最关键的步骤,因为它直接影响嵌入文档表示的粒度和语义内容[15 (https://arxiv.org/html/2605.22203#bib.bib3),5 (https://arxiv.org/html/2605.22203#bib.bib5)]。糟糕的文档分割可能导致嵌入过于通用,混合了不相关的概念,或者过于精细,破坏了概念和过程之间的语义关系。因此,文档分块是基于嵌入的文档检索和语义搜索系统中一个研究不足但至关重要的组成部分[11 (https://arxiv.org/html/2605.22203#bib.bib1),6 (https://arxiv.org/html/2605.22203#bib.bib22)]。尽管重要性很高,但针对文档分块策略的评估工作很少,尤其是在资源有限的语言中[3 (https://arxiv.org/html/2605.22203#bib.bib10)]。

这些问题在处理低资源语言时尤为突出,因为其语言特性使得预处理和建模更加困难[3 (https://arxiv.org/html/2605.22203#bib.bib10),2 (https://arxiv.org/html/2605.22203#bib.bib11)]。高棉语是一个有趣的研究案例,它是柬埔寨的官方语言,没有词边界、正字法复杂,且下游自然语言处理(NLP)资源有限[16 (https://arxiv.org/html/2605.22203#bib.bib12)]。传统的分块方法,如固定窗口或基于句子的分块,是参考拥有完善标点和语法规则的高资源语言开发的[9 (https://arxiv.org/html/2605.22203#bib.bib4),1 (https://arxiv.org/html/2605.22203#bib.bib19)]。将这些方法应用于高棉语可能导致语义连续性的丧失,甚至破坏程序性内容。这在处理农业文档时尤为关键,因为农业文档通常包含多步骤的程序性内容、专业词汇和层级化解释性内容[3 (https://arxiv.org/html/2605.22203#bib.bib10),2 (https://arxiv.org/html/2605.22203#bib.bib11)]。保持语义连续性对于确保准确检索和问答至关重要[11 (https://arxiv.org/html/2605.22203#bib.bib1),6 (https://arxiv.org/html/2605.22203#bib.bib22)]。

受此问题启发,本研究旨在探讨分块策略的选择如何影响高棉语农业文档中基于嵌入的检索性能。更具体地说,本研究旨在回答以下研究问题:

- • 1) 不同的分块策略如何影响高棉语农业文档的检索准确性?
- • 2) 在递归分割框架内,什么块大小能优化语义连贯性和检索精度?
- • 3) 基于规则和基于大语言模型的分块方法之间有哪些计算权衡?

为了进行这项研究,我们对四种不同的分块方法进行了广泛评估:递归分块、高棉语感知分块、基于句子的分块和大语言模型分块。我们所采用的方法基于不同的分割理念,可以大致分为基于规则的分割和语义分割[1 (https://arxiv.org/html/2605.22203#bib.bib19)]。

对于嵌入和检索,我们使用多语言模型 BGE-M3[4 (https://arxiv.org/html/2605.22203#bib.bib9)],其向量表示使用 FAISS[8 (https://arxiv.org/html/2605.22203#bib.bib16)] 进行索引。评估指标基于多个标准,包括平均检索得分(L2 距离)、答案相关性(余弦相似度)、高棉语覆盖率和高棉语交并比(Khmer IoU)[16 (https://arxiv.org/html/2605.22203#bib.bib12)]。我们采用 5 折交叉验证方法以确保评估的统计稳健性。

## 2 相关工作

### 2.1 基于嵌入的检索中的文本分块

文本分块是基于嵌入的信息检索系统中的关键组成部分,因为它决定了被检索内容的语义粒度。在整合了检索增强生成(RAG)机制的基于文本的信息检索系统中,文本分割是一个关键组成部分,它影响文档嵌入的准确性,进而影响信息检索的准确性[11 (https://arxiv.org/html/2605.22203#bib.bib1),6 (https://arxiv.org/html/2605.22203#bib.bib22)]。文本分块是一种将长文档分割成更小语义单元的技术,这些单元可以轻松地嵌入并在大型语言模型中处理[13 (https://arxiv.org/html/2605.22203#bib.bib2)]。因此,文本分割技术在很大程度上决定了文档嵌入在表示源文本上下文信息方面的准确性。

以往基于文本的信息检索系统中的技术依赖于固定大小的文本分块,即将文本文档分割成相等字符或标记大小的较小块,通常带有重叠段以保留上下文信息。尽管这种技术在文本处理和信息检索中很高效,但它容易导致信息碎片化,即语义上重要的信息分散在多个块中,或者不相关的信息嵌入到一个块中[15 (https://arxiv.org/html/2605.22203#bib.bib3)]。大的块大小可能导致语义特异性不足,而小的块大小可能碎片化文本文档中的上下文信息。最近的研究表明,与固定大小的文本分割技术相比,递归文本分割技术可以显著提高信息检索的准确性[14 (https://arxiv.org/html/2605.22203#bib.bib6),5 (https://arxiv.org/html/2605.22203#bib.bib5)]。然而,目前缺乏对各种文本分割技术的系统评估[9 (https://arxiv.org/html/2605.22203#bib.bib4),1 (https://arxiv.org/html/2605.22203#bib.bib19)]。

### 2.2 基于句子和语言感知的分块

基于句子的分块方法旨在通过根据句子边界划分文本来保持语义完整性。更高级的语义分块方法涉及计算相邻句子组的嵌入,并根据语义距离阈值识别主题变化[14 (https://arxiv.org/html/2605.22203#bib.bib6)]。这种方法对于句子分词器稳健且标点标准化的资源丰富语言可能产生最佳结果。

然而,基于句子的分块方法在低资源语言中可能面临挑战,因为这些语言的标点可能不规则,且缺乏稳健的 NLP 工具。为了克服这些挑战,已经开发了语言感知的预处理方法。例如,在越南语中,NLP 方法如 VnCoreNLP 使用条件随机场(CRF)和神经序列模型来改进短语分割[19 (https://arxiv.org/html/2605.22203#bib.bib7)]。针对高棉语也开发了类似的方法,包括基于 CRF 的词分割[3 (https://arxiv.org/html/2605.22203#bib.bib10)]、基于 BiLSTM 网络的分割方法[2 (https://arxiv.org/html/2605.22203#bib.bib11)]以及高棉语词分割方法的综述[16 (https://arxiv.org/html/2605.22203#bib.bib12)]。尽管这些研究强调了语言感知分割的重要性,但它们对基于嵌入的检索系统性能的影响尚未得到广泛探索[18 (https://arxiv.org/html/2605.22203#bib.bib13),10 (https://arxiv.org/html/2605.22203#bib.bib15)]。

### 2.3 基于大语言模型的文档分割

最近,大型语言模型(LLMs)被用于基于提示的文档分割方法。上下文检索方法使用整个文档来提示 LLM 为文档段生成丰富的描述,然后再进行嵌入,如之前的研究所示[17 (https://arxiv.org/html/2605.22203#bib.bib17)]。另一方面,基于 LLM 的语义分块方法提示 LLM 根据模型推断的语义边界来分割文档。

虽然这些方法为不同语言和领域提供了灵活性,但代价是增加了计算延迟。上下文检索方法,如密集嵌入和稀疏检索的组合,已被证明可以显著减少检索错误[17 (https://arxiv.org/html/2605.22203#bib.bib17)]。然而,对于像高棉语这样的低资源语言,基于 LLM 的文档分块策略的评估还不够充分[18 (https://arxiv.org/html/2605.22203#bib.bib13),10 (https://arxiv.org/html/2605.22203#bib.bib15)]。

### 2.4 多语言检索的嵌入模型

密集嵌入模型允许将文本段映射到连续向量空间,便于使用余弦相似度或 L2 距离进行语义相似度测量。多语言嵌入是这一概念的扩展,旨在即使在低资源语言中也能执行此操作。诸如 mBERT、LaBSE 和 E5 之类的嵌入已被证明在多语言环境中具有稳健的跨语言检索能力[4 (https://arxiv.org/html/2605.22203#bib.bib9)]。

BGE-M3 是多语言嵌入模型家族的最新进展,支持超过 100 种语言,并整合了基于密集、稀疏和多向量的检索模型[4 (https://arxiv.org/html/2605.22203#bib.bib9)]。它处理长文本并同时执行稳健的跨语言检索的能力,使其成为高棉语文本检索任务的合适候选者。BGE-M3 在 MIRACL 基准测试中展示了在多语言环境中的稳健性能,该基准测试处理了包括低资源语言在内的各种语言[20 (https://arxiv.org/html/2605.22203#bib.bib8)]。然而,值得注意的是,即使有了稳健的嵌入模型,文档分割策略在决定检索模型有效性方面同样重要[14 (https://arxiv.org/html/2605.22203#bib.bib6),5 (https://arxiv.org/html/2605.22203#bib.bib5)]。

### 2.5 低资源语言处理

考虑到缺乏可用于该语言的标注语料库和语言工具,高棉语已被确定为低资源语言[2 (https://arxiv.org/html/2605.22203#bib.bib11),3 (https://arxiv.org/html/2605.22203#bib.bib10)]。与基于拉丁字母的文字不同,高棉语没有指定词边界的空白,并且遵循元音附标文字系统,包含辅音和元音的复杂组合[3 (https://arxiv.org/html/2605.22203#bib.bib10)]。尽管在高棉语的词分割和词性标注方面取得了显著进展,达到了高精度结果[16 (https://arxiv.org/html/2605.22203#bib.bib12)],但针对检索应用的文档级分块研究却很少。

最近的研究工作已经确定了东南亚语言建模和代码混合文本处理的当前趋势[7 (https://arxiv.org/html/2605.22203#bib.bib14),18 (https://arxiv.org/html/2605.22203#bib.bib13)]。这表明了对低资源语言的日益重视。然而,针对高棉语农业文档中基于嵌入的检索的分块方法尚未得到广泛探索[10 (https://arxiv.org/html/2605.22203#bib.bib15)]。

## 3 方法

### 3.1 架构概述

所提出的检索流程包括六个相互关联的阶段:数据准备、分块、嵌入、索引、检索和评估[11 (https://arxiv.org/html/2605.22203#bib.bib1),13 (https://arxiv.org/html/2605.22203#bib.bib2)]。最初,文档通过将 PDF 转换为文本,然后将文本规范化为 Markdown 格式进行预处理。随后,文本使用不同的分块策略进行分割,使用 BGE-M3 模型[4 (https://arxiv.org/html/2605.22203#bib.bib9)]进行嵌入,并使用 FAISS[8 (https://arxiv.org/html/2605.22203#bib.bib16)]进行索引以进行高效的最近邻检索。最后,在 5 折交叉验证下,使用真实问答对定量评估检索性能[15 (https://arxiv.org/html/2605.22203#bib.bib3)]。

参见标题

图 1:端到端分块评估流程。
### 3.2 分块策略

考虑了四种分块策略:

- • 高棉语感知递归分割:一种基于高棉文字特征的规则驱动方法[3 (https://arxiv.org/html/2605.22203#bib.bib10),16 (https://arxiv.org/html/2605.22203#bib.bib12)]。
- • 递归分割:使用固定字符数(例如,300 个字符)进行规则驱动的分割,以保留层级上下文。

相似文章

文本块大小对检索增强生成性能的影响

arXiv cs.CL

本文研究了检索增强生成系统中文本块(句子、段落、章节)大小对生成质量、检索精度和计算效率的影响,实验采用了相同的教科书,按不同粒度进行分割。

Adaptive Chunking:为RAG优化分块方法选择

Papers with Code Trending

介绍Adaptive Chunking,一个利用五项文档内在指标为RAG选择最佳分块策略的框架,将答案正确率从62-64%提升至72%,并将问题解决率提高超过30%。

德国法律法规的分块策略

arXiv cs.CL

本文评估了针对德国法律法规的检索增强生成中的多种分块策略,发现与结构对齐的方法(如基于章节的检索)优于更复杂的方案。